Mixture of Experts (MoE) Nedir? Büyük Dil Modelleri Nasıl Daha Verimli Çalışıyor?
Mixture of Experts (MoE), bu yaklaşımlardan biridir. Büyük dil modellerinde yaygın kullanılan seyrek MoE tasarımları, belirli katmanlarda bulunan uzman ağların yalnızca bir bölümünü her token için çalıştırır.
Böylece toplam parametre sayısı yüksek bir model, her tokenda bütün uzmanlarını kullanmadan işlem yapabilir. Bununla birlikte daha az hesaplama, her koşulda daha düşük bellek tüketimi veya daha hızlı yanıt anlamına gelmez.
Mixture of Experts Nedir?
Mixture of Experts, birden fazla uzman sinir ağı ile bunların katkısını belirleyen bir yönlendirme mekanizmasını bir araya getiren mimari yaklaşımdır.
MoE farklı tasarımları kapsar. Sparse MoE — seyrek uzmanlar karışımı yaklaşımında, her girdi için uzmanların yalnızca bir alt kümesi etkinleştirilir.
Transformer tabanlı dil modellerinde uzmanlar, çoğunlukla ileri beslemeli ağların (Feed-Forward Network — FFN) alternatifleri olarak kullanılır. Dikkat mekanizması gibi diğer bileşenler ortak kalabilir.
Bu nedenle MoE, tek bir büyük modelin yerine birbirinden bağımsız sohbet modelleri koymak şeklinde düşünülmemelidir. Uzmanlar genellikle aynı modelin içinde birlikte eğitilen alt ağlardır.
MoE Nasıl Çalışır?
Bir MoE katmanında üç temel bileşen bulunur:
-
Uzman ağlar: Kendilerine yönlendirilen token temsillerini işler.
-
Router veya gating network: Hangi uzmanların kullanılacağını belirler.
-
Birleştirme mekanizması: Uzmanların çıktılarını uygun ağırlıklarla bir araya getirir.
Genel süreç şöyledir:
-
Metin tokenlara ayrılır ve sayısal temsillere dönüştürülür.
-
Bir tokenın temsili MoE katmanına ulaşır.
-
Router, uzmanlar için puanlar hesaplar.
-
Seçilen uzmanlar tokenın temsilini işler.
-
Çıktılar birleştirilerek sonraki katmana aktarılır.
Birleştirilen çıktı, doğrudan kullanıcıya gösterilen nihai cevap değildir. Modelin sonraki katmanlarında işlenmeye devam eden sayısal temsildir.
Uzman seçimi de çoğunlukla bütün soru için bir kez yapılmaz. Aynı cümledeki farklı tokenlar, farklı katmanlarda farklı uzmanlara yönlendirilebilir.
Örneğin Mixtral 8x7B, her katmandaki sekiz uzman arasından token başına iki uzman seçer.
Uzmanlar Belirli Konulara mı Ayrılır?
“Uzman” ifadesi, her alt ağın matematik, hukuk veya yazılım gibi tek bir konuya ayrıldığı izlenimini verebilir. Ancak çoğu MoE modelinde bu alanlar insanlar tarafından önceden atanmaz.
Eğitim sırasında uzmanlar farklı örüntülere yönelmeye başlayabilir. Bu farklılaşma konu başlıklarından çok token yapıları, dilsel özellikler veya başka istatistiksel örüntülerle ilişkili olabilir.
Dolayısıyla “Kod sorusu geldiğinde kod uzmanı çalışır” açıklaması, gerçek mekanizmayı tam olarak yansıtmaz. Router, tokenın o katmandaki sayısal temsiline göre öğrenilmiş bir seçim yapar.
Toplam Parametre ile Aktif Parametre Arasındaki Fark
MoE modellerinde iki büyüklük ayrı değerlendirilmelidir:
Toplam parametre, ortak bileşenler ve bütün uzmanlar dahil modelde bulunan ağırlıkları ifade eder.
Aktif parametre, belirli bir token işlenirken kullanılan ağırlıkların miktarını anlatır.
Mixtral teknik raporunda yaklaşık 47 milyar toplam parametreye karşılık, token başına yaklaşık 13 milyar aktif parametre kullanıldığı belirtilir.
Bu ayrım, yüksek toplam kapasitenin daha sınırlı token başına hesaplamayla kullanılmasını sağlar. Ancak aktif parametre sayısı, modelin toplam bellek ihtiyacını tek başına göstermez.
MoE ile Dense Model Arasındaki Fark Nedir?
Dense model, temel katman hesaplamalarında farklı girdileri aynı yoğun ağırlık yapılarından geçirir. Seyrek MoE ise belirli katmanlarda kullanılacak uzmanları seçer.
| Özellik | Dense model | Seyrek MoE |
|---|---|---|
| Hesaplama yapısı | Aynı yoğun katmanlar kullanılır | Seçilen uzman ağlar kullanılır |
| Uzman yönlendirmesi | Gerekmez | Router gerekir |
| Kapasite artışı | Genellikle hesaplama maliyetini de artırır | Uzman sayısıyla kapasite artırılabilir |
| Bellek ihtiyacı | Model boyutuna bağlıdır | Bütün uzman ağırlıkları önemlidir |
| Dağıtık çalışma | Paralelleştirme yöntemine bağlıdır | Uzmanlara veri taşıma ek maliyet oluşturabilir |
“Dense modelde bütün parametreler her işlemde mutlaka çalışır” ifadesi fazla kesindir. Temel ayrım, yoğun katman hesaplaması ile koşullu uzman seçimi arasındadır.
MoE Neden Önemlidir?
MoE, model kapasitesi ile hesaplama maliyetinin birlikte büyümesini sınırlamaya yardımcı olabilir. Daha fazla uzman eklenerek toplam kapasite artırılırken token başına seçilen uzman sayısı sabit tutulabilir.
Switch Transformer araştırması, sadeleştirilmiş yönlendirme yöntemleriyle çok büyük seyrek modellerin eğitilebildiğini ve belirli deneylerde eğitim hızı kazanımları sağlanabildiğini göstermiştir.
Ancak karşılaştırma koşulları önemlidir. Aynı toplam parametre sayısı, aynı hesaplama bütçesi veya aynı yanıt kalitesi üzerinden yapılan karşılaştırmalar farklı sonuçlar verebilir.
Daha Az Hesaplama, Daha Az Bellek Anlamına mı Gelir?
Her zaman değil. Bir token için kullanılmayan uzman, sonraki token veya başka bir kullanıcı isteği için gerekli olabilir.
Bu nedenle uzman ağırlıklarının sistemde erişilebilir olması gerekir. Ağırlıklar GPU belleğinde tutulabilir, birden fazla GPU’ya dağıtılabilir veya bazıları daha yavaş belleğe taşınabilir. Ancak gerektiğinde ağırlık taşımak da gecikme yaratabilir.
Bu yüzden düşük aktif parametre sayısına sahip bir MoE modeli, aynı parametre sayısındaki küçük bir dense model kadar kolay çalıştırılamayabilir.
Karşılaşılan Zorluklar
Yük Dengeleme
Bazı uzmanların sürekli seçilmesi, diğerlerinin yeterince kullanılmamasına yol açabilir. Bu durum hem öğrenmeyi hem de donanımın verimli kullanılmasını etkiler.
GPU’lar Arası İletişim
Uzmanlar farklı GPU’larda bulunuyorsa token temsilleri ilgili cihazlara gönderilir ve sonuçlar geri toplanır. Bağlantı kapasitesi yetersizse iletişim maliyeti, hesaplama tasarrufunu azaltabilir.
Eğitim Kararlılığı
Router ve uzmanların birlikte öğrenmesi, eğitim sürecini karmaşıklaştırır. Yönlendirme dengesi ve sayısal hassasiyet gibi konular özel optimizasyon gerektirebilir.
Gerçek Çalışma Hızı
Daha az aritmetik işlem yapılması, yanıt süresinin otomatik olarak kısalacağını göstermez. Batch boyutu, bellek erişimi, donanım yerleşimi ve çıkarım yazılımı belirleyicidir.
Enerji tüketimi de yalnızca aktif parametre sayısından hesaplanamaz; bütün sistemin gerçek iş yükünde ölçülmesi gerekir.
Nerelerde Kullanılabilir?
MoE tabanlı dil modelleri; metin üretimi, soru-cevap, kod oluşturma ve çok dilli uygulamalarda kullanılabilir. Ancak bu görevlerin her biri için ayrı ve açıkça adlandırılmış uzmanlar bulunması gerekmez.
Bir kurumsal asistan veya yapay zekâ ajanı da MoE tabanlı model kullanabilir. Bununla birlikte MoE ile çok ajanlı sistem aynı şey değildir. MoE, modelin iç mimarisidir; çok ajanlı sistem ise ayrı görevleri yürüten uygulama bileşenlerinin birlikte çalışmasıdır.
Benzer şekilde eğitilmiş bir modele yeni uzman eklemek, sıradan bir yazılım eklentisi yüklemek kadar basit değildir. Yeni uzmanların ve yönlendirme davranışının uyarlanması için ek eğitim ve değerlendirme gerekebilir.
Sık Sorulan Sorular
Her MoE modeli yalnızca iki uzman mı çalıştırır?
Hayır. Etkinleştirilen uzman sayısı ve yönlendirme yöntemi mimariye göre değişir.
MoE her zaman daha hızlı mı?
Hayır. Hesaplama tasarrufu sağlayabilir; ancak bellek ve iletişim maliyetleri gerçek hızı etkiler.
MoE daha doğru cevap garantiler mi?
Hayır. Eğitim verisi, model tasarımı ve görevin özellikleri sonucu belirler.
Uzmanlar bağımsız dil modelleri mi?
Yaygın Transformer MoE tasarımlarında uzmanlar, modelin içindeki alt ağlardır. Tek başlarına tam bir sohbet modeli değildir.
MoE’nin katkısı, daha geniş model kapasitesini seçici hesaplamayla kullanabilmesidir. Bu avantajın uygulamaya yansıması, yönlendirme kalitesi kadar bellek ve iletişim altyapısının da iyi tasarlanmasına bağlıdır.
Kaynaklar: Shazeer ve diğerleri — Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer; Fedus, Zoph ve Shazeer — Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity; Jiang ve diğerleri — Mixtral of Experts; Hugging Face — Mixture of Experts Explained.
Editör Notu
Bu içerik, kamuya açık akademik araştırmalar ve teknik açıklamalardan yararlanılarak hazırlanmış bir araştırma ve değerlendirme yazısıdır. İçerikte yer alan değerlendirmeler editoryal yorum niteliğindedir. MoE modellerinin kalite, hız, bellek ve enerji performansı; mimariye, eğitim yöntemine, donanıma ve iş yüküne göre değişebilir.