Mixture of Experts (MoE) Nedir? Büyük Yapay Zekâ Modelleri Nasıl Daha Verimli Çalışıyor?
Mixture of Experts (MoE), bu yaklaşımlardan biridir. Büyük dil modellerinde yaygın kullanılan seyrek MoE (Sparse MoE) tasarımlarında, belirli katmanlardaki uzman ağların yalnızca bir bölümü her token için çalıştırılır.
Böylece modelin toplam parametre sayısı yüksek olabilirken tek bir tokenın işlenmesinde kullanılan parametre miktarı daha düşük tutulabilir. Ancak bu avantaj, bütün sistemin otomatik olarak daha az bellek kullanacağı veya her donanımda daha hızlı çalışacağı anlamına gelmez.
Mixture of Experts Nedir?
Mixture of Experts, birden fazla uzman sinir ağı ile bunların katkısını belirleyen bir yönlendirme mekanizmasını bir araya getiren mimari yaklaşımıdır.
MoE kavramı farklı tasarımları kapsar. Günümüzde büyük dil modelleri bağlamında genellikle yalnızca seçilen uzmanların etkinleştirildiği seyrek yapı kastedilir.
Transformer tabanlı birçok uygulamada uzmanlar, model içindeki ileri beslemeli ağların (Feed-Forward Network — FFN) alternatifleridir. Modelin tamamı bağımsız sohbet botlarına bölünmez; dikkat mekanizması gibi başka bileşenler ortak kullanılmaya devam edebilir.
MoE Nasıl Çalışır?
Bir MoE katmanında temel süreç şu şekildedir:
-
Tokenın temsili alınır: Modelin önceki işlemlerinden gelen sayısal temsil kullanılır.
-
Router puan üretir: Yönlendirici ağ, uzmanlar için seçim puanları hesaplar.
-
Uzmanlar seçilir: Yapılandırmaya göre bir veya birden fazla uzman etkinleştirilir.
-
Hesaplama yapılır: Seçilen uzmanlar tokenın temsilini işler.
-
Çıktılar birleştirilir: Sonuçlar, yönlendirme ağırlıklarıyla birleştirilerek sonraki katmana aktarılır.
Bu seçim çoğu yaygın tasarımda soru başına bir kez değil, token ve katman düzeyinde yapılır. Aynı cümledeki farklı tokenlar farklı uzmanlara yönlendirilebilir.
Örneğin Mixtral 8x7B, her katmandaki sekiz uzman arasından token başına iki uzman seçer. Seçilen uzmanlar, tokenlar ve katmanlar arasında değişebilir.
“Uzman” Gerçekten Bir Konunun Uzmanı mı?
Uzman ifadesi, insanlardaki mesleki uzmanlıkla birebir aynı anlamda kullanılmaz.
Bir MoE modelinde uzmanların önceden “hukuk”, “sağlık” veya “Python” şeklinde adlandırılması gerekmez. Yönlendirme ve uzmanların öğrendiği örüntüler eğitim sırasında şekillenir.
Bazı uzmanlar belirli token yapılarına veya örüntülere daha fazla yanıt verebilir. Ancak her uzmanın tek bir konuya ayrıldığı ve router’ın kullanıcı sorusunun konusuna bakarak ilgili uzmanı seçtiği açıklaması fazla basitleştirilmiş olur.
Toplam Parametre ile Aktif Parametre Arasındaki Fark
MoE modellerini değerlendirirken iki farklı sayı önemlidir:
-
Toplam parametre: Modelde bulunan bütün ağırlıkları ifade eder.
-
Aktif parametre: Belirli bir token işlenirken kullanılan ağırlıkların miktarını ifade eder.
Örneğin Mixtral araştırmasında modelin yaklaşık 47 milyar toplam parametreye, token başına ise yaklaşık 13 milyar aktif parametreye sahip olduğu belirtilir.
Bu nedenle “8x7B” adını sekiz bağımsız 7 milyar parametreli modelin tamamının yan yana çalışması şeklinde yorumlamak doğru değildir. Ortak kullanılan bileşenler de vardır.
MoE ile Dense Model Arasındaki Fark
Dense model, temel katman hesaplamalarında girdiler için aynı yoğun ağırlık yapılarını kullanır. Seyrek MoE ise belirli katmanlarda tokenı uzmanların bir alt kümesine yönlendirir.
| Özellik | Dense model | Seyrek MoE |
|---|---|---|
| Katman hesaplaması | Aynı yoğun ağ kullanılır | Seçilen uzman ağlar kullanılır |
| Kapasiteyi büyütme | Genellikle token başına hesaplamayı da artırır | Daha fazla uzmanla kapasite artırılabilir |
| Yönlendirme | Uzman seçimi gerekmez | Router gerekir |
| Bellek ihtiyacı | Model boyutuna bağlıdır | Toplam uzman ağırlıkları önemlidir |
| Dağıtık çalışma | Kullanılan paralelleştirmeye bağlıdır | Uzmanlar arası yönlendirme ek iletişim doğurabilir |
“Dense modelde her parametre her işlemde mutlaka kullanılır” ifadesi teknik olarak fazla kesindir. Buradaki temel ayrım, yoğun hesaplama ile koşullu uzman seçimi arasındadır.
MoE Neden Daha Verimli Olabilir?
Seyrek MoE, her token için bütün uzmanları çalıştırmadan model kapasitesini artırabilir. Böylece aynı toplam parametre büyüklüğündeki yoğun bir modele göre daha az aritmetik işlem gerekebilir.
Switch Transformer araştırması, uzman seçimini sadeleştirerek büyük seyrek modellerin eğitilebildiğini ve belirli deneylerde eğitim hızının artırılabildiğini göstermiştir.
Ancak karşılaştırmanın koşulları önemlidir. Aynı toplam parametre sayısı, aynı aktif parametre sayısı ve aynı yanıt kalitesi üzerinden yapılan karşılaştırmalar farklı sonuçlar verebilir.
Daha Az Hesaplama, Daha Az Bellek Anlamına mı Gelir?
Her zaman değil. Bir token için kullanılmayan uzman, sonraki token veya başka bir kullanıcı isteği için gerekli olabilir.
Bu nedenle bütün uzman ağırlıklarının sistemde erişilebilir olması gerekir. Ağırlıklar birden fazla GPU’ya dağıtılabilir veya bazıları daha yavaş bellekte tutulabilir. Ancak ağırlıkları gerektiğinde taşımak da gecikme oluşturabilir.
MoE’nin hesaplama avantajı ile modelin toplam bellek ihtiyacı ayrı değerlendirilmelidir. Aktif parametre sayısının düşük olması, modelin aynı büyüklükteki küçük bir dense model kadar kolay çalıştırılacağını göstermez.
Karşılaşılan Zorluklar
Yük Dengeleme
Router sürekli aynı uzmanları seçerse bazı uzmanlar aşırı yüklenirken diğerleri yeterince kullanılmayabilir. Bu durum hem eğitim kalitesini hem de donanım verimliliğini etkileyebilir.
Yük dengeleme yöntemleri, tokenların uzmanlar arasında daha uygun dağıtılmasını amaçlar.
GPU’lar Arası İletişim
Uzmanlar farklı GPU’larda bulunuyorsa token temsillerinin ilgili cihazlara gönderilmesi ve sonuçların geri toplanması gerekir. Buna uzman paralelliği (Expert Parallelism) yaklaşımında sık rastlanır.
Ağ bağlantısı yavaşsa veya token dağılımı dengesizse iletişim maliyeti, hesaplama tasarrufunun bir bölümünü azaltabilir.
Eğitim Kararlılığı
Router ile uzmanların birlikte öğrenmesi, eğitim sürecini karmaşıklaştırır. Dengesiz yönlendirme ve sayısal kararlılık sorunları özel yöntemler gerektirebilir. Switch Transformer çalışması da bu sorunları ele alır.
Gerçek Çalışma Performansı
Daha az matematiksel işlem, doğrudan daha düşük yanıt süresi anlamına gelmez. Batch boyutu, bellek erişimi, donanım yerleşimi ve kullanılan çıkarım yazılımı performansı belirler.
Enerji tüketimi de yalnızca aktif parametre sayısından çıkarılamaz; bütün sistemin ölçülmesi gerekir.
MoE ile Çok Ajanlı Sistemler Aynı mı?
Hayır. MoE, genellikle tek bir sinir ağının içindeki hesaplama mimarisidir.
Çok ajanlı sistemlerde ise farklı görevleri üstlenen uygulamalar veya model çağrıları birlikte çalışır. Örneğin bir ajan araştırma yaparken başka biri metin düzenleyebilir.
Bir ajan, arka planda MoE tabanlı bir model kullanabilir. Ancak bu durum ajanın görev planlamasını veya araç seçimini model içindeki uzman yönlendirmesiyle aynı mekanizma yapmaz.
Sık Sorulan Sorular
Her MoE modeli token başına iki uzman mı kullanır?
Hayır. Seçilen uzman sayısı ve yönlendirme yöntemi mimariye göre değişir.
MoE uzmanları bağımsız dil modelleri mi?
Yaygın Transformer MoE tasarımlarında uzmanlar, modelin içindeki alt ağlardır. Tek başlarına tam bir sohbet modeli değildir.
MoE her zaman dense modelden daha başarılı mı?
Hayır. Veri, eğitim yöntemi, hesaplama bütçesi ve görev sonuçları belirler.
MoE küçük donanımda çalışmayı garanti eder mi?
Hayır. Toplam ağırlık boyutu ve bellek gereksinimi hâlâ yüksek olabilir.
MoE’nin temel katkısı, model kapasitesi ile token başına hesaplama maliyeti arasında farklı bir denge kurabilmesidir. Bu avantajın uygulamada karşılık bulması, yönlendirme kalitesi kadar bellek ve iletişim altyapısının da iyi tasarlanmasına bağlıdır.
Kaynaklar: Shazeer ve diğerleri — Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer; Fedus, Zoph ve Shazeer — Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity; Jiang ve diğerleri — Mixtral of Experts; Hugging Face — Mixture of Experts Explained.
Editör Notu
Bu içerik, kamuya açık akademik araştırmalar ve teknik açıklamalardan yararlanılarak hazırlanmış bir araştırma ve değerlendirme yazısıdır. İçerikte yer alan değerlendirmeler editoryal yorum niteliğindedir. MoE modellerinin hız, bellek ve enerji performansı; mimariye, donanıma, eğitim yöntemine ve iş yüküne göre değişebilir.