Mixture of Experts (MoE) Nedir? Büyük Yapay Zekâ Modelleri Neden Her Tokenda Bütün Uzmanları Çalıştırmaz?
Büyük dil modellerinde yaygın kullanılan seyrek MoE (Sparse MoE) tasarımları, belirli katmanlarda yalnızca seçilen uzman ağları çalıştırır. Böylece toplam parametre sayısı yüksek olsa bile tek bir token için kullanılan parametre miktarı daha düşük tutulabilir.
Buradaki önemli ayrım şudur: Uzman seçimi çoğunlukla bütün soru için bir kez yapılmaz. Farklı tokenlar, farklı katmanlarda farklı uzmanlara yönlendirilebilir.
Mixture of Experts Nedir?
Mixture of Experts, birden fazla uzman sinir ağıyla bu ağların katkısını belirleyen bir yönlendirme mekanizmasını bir araya getiren yaklaşımdır.
MoE farklı tasarımları kapsar. Seyrek MoE’de her girdi için uzmanların yalnızca bir bölümü etkinleştirilir. Bu yönteme koşullu hesaplama da denir.
Transformer tabanlı dil modellerinde uzmanlar, genellikle ileri beslemeli ağların (Feed-Forward Network — FFN) alternatifleri olarak kullanılır. Dikkat mekanizması ve diğer bazı bileşenler ortak kalabilir.
Dolayısıyla bir MoE modeli, birbirinden bağımsız ve her biri ayrı cevap yazan sohbet botlarından oluşmak zorunda değildir. Uzmanlar, tek modelin içindeki hesaplama bileşenleridir.
MoE Nasıl Çalışır?
Kullanıcının “Python’da API nasıl yazılır?” diye sorduğunu düşünelim. Yaygın bir MoE mimarisinde doğrudan “kod uzmanı” ve “API uzmanı” adlı iki bölüm seçilmez.
Bunun yerine metin tokenlara ayrılır ve model içinde sayısal temsillere dönüştürülür. Bir MoE katmanına gelindiğinde süreç şöyle ilerler:
-
Tokenın temsili router’a ulaşır.
-
Router, uzmanlar için puanlar hesaplar.
-
Yönlendirme kuralına göre belirli uzmanlar seçilir.
-
Seçilen uzmanlar tokenın temsilini işler.
-
Çıktılar ağırlıklandırılarak birleştirilir.
-
İşlem modelin sonraki katmanlarında devam eder.
Nihai kullanıcı yanıtı, bu katmanların birlikte çalışmasıyla üretilir. Uzmanların her biri ayrı bir doğal dil yanıtı hazırlamaz.
Örneğin Mixtral 8x7B, her katmandaki sekiz uzman arasından token başına iki uzman seçer. Seçimler tokenlar ve katmanlar arasında değişebilir.
Router veya Gating Network Nedir?
Router, tokenın mevcut sayısal temsilinden hareketle uzmanlara yönlendirme yapan öğrenilebilir bileşendir.
Yaygın yöntemlerden biri top-k routing yaklaşımıdır. Router’ın ürettiği puanlara göre belirli sayıda uzman seçilir. Örneğin top-1 bir uzmanı, top-2 iki uzmanı etkinleştirebilir.
Router, insan gibi sorunun konusunu okuyup meslek seçen bir yönetici değildir. Yönlendirme davranışı, eğitim hedefleri ve kullanılan yöntemler doğrultusunda öğrenilir.
Başarılı yönlendirme için yalnızca uygun uzmanların seçilmesi değil, iş yükünün dengeli dağıtılması da önemlidir.
Uzmanlar Gerçekten Matematik veya Hukuk Uzmanı mı?
“Uzman” sözcüğü kolay anlaşılır bir benzetmedir; ancak her uzmanın belirli bir mesleğe veya konuya karşılık geldiğini düşündürebilir.
Çoğu MoE modelinde uzmanlara önceden “matematik”, “hukuk” veya “sağlık” etiketi verilmez. Eğitim sırasında farklı örüntülere yönelik ayrışmalar oluşabilir. Bu ayrışma konu, sözcük yapısı veya başka özelliklerle ilişkili olabilir.
Bir uzmanın belirli örüntülerde daha sık seçilmesi, o alanda bağımsız ve güvenilir bir uzman olduğu anlamına gelmez. MoE modeli de yanlış bilgi üretebilir.
Toplam Parametre ve Aktif Parametre Nedir?
MoE modellerini değerlendirirken iki farklı büyüklük kullanılır:
| Kavram | Anlamı |
|---|---|
| Toplam parametre | Ortak bileşenler ve bütün uzmanlar dahil modelde bulunan ağırlıklar |
| Aktif parametre | Belirli bir tokenın işlenmesinde kullanılan ağırlıklar |
Mixtral teknik raporunda yaklaşık 47 milyar toplam parametreye karşılık, token başına yaklaşık 13 milyar aktif parametre kullanıldığı belirtilir.
Bu ayrım, modelin bütün uzmanlarını her tokenda çalıştırmadan daha geniş kapasiteye erişmesini sağlar. Ancak aktif parametre sayısı, toplam bellek gereksinimini tek başına açıklamaz.
MoE ile Dense Model Arasındaki Fark
Dense model, temel katman hesaplamalarında girdileri aynı yoğun ağırlık yapılarından geçirir. Seyrek MoE ise belirli katmanlarda uzmanların bir alt kümesini seçer.
| Özellik | Dense model | Seyrek MoE |
|---|---|---|
| Hesaplama yolu | Aynı yoğun katmanlar kullanılır | Seçilen uzmanlar kullanılır |
| Yönlendirme | Uzman seçimi gerekmez | Router gerekir |
| Kapasite artışı | Genellikle hesaplama maliyetini de artırır | Uzman sayısı artırılarak kapasite büyütülebilir |
| Bellek | Model ağırlıklarına bağlıdır | Bütün uzman ağırlıkları önemlidir |
| Dağıtık çalışma | Paralelleştirme yöntemine bağlıdır | Uzmanlara veri taşıma ek maliyet oluşturabilir |
“Dense modelde her parametre her işlemde mutlaka çalışır” ifadesi fazla kesindir. Temel fark, yoğun katman hesaplamasıyla koşullu uzman seçimi arasındadır.
MoE Neden Daha Verimli Olabilir?
MoE, toplam kapasiteyi artırırken token başına yapılan aritmetik işlemleri sınırlamaya yardımcı olabilir.
Switch Transformer araştırması, sadeleştirilmiş yönlendirme ve eğitim yöntemleriyle çok büyük seyrek modellerin eğitilebildiğini göstermiştir. Çalışmada belirli karşılaştırmalarda eğitim hızı kazanımları raporlanmıştır.
Ancak verimlilik iddiasında karşılaştırma koşulu belirtilmelidir. Aynı toplam parametre, aynı hesaplama bütçesi veya aynı yanıt kalitesi üzerinden yapılan karşılaştırmalar farklı sonuçlar verebilir.
Daha Az Aktif Parametre, Daha Az GPU Belleği Demek mi?
Her zaman değil. Bir token için kullanılmayan uzman, sonraki token veya başka bir kullanıcı isteği için gerekli olabilir.
Bu nedenle uzman ağırlıklarının sistemde erişilebilir olması gerekir. Bütün ağırlıklar GPU belleğinde tutulabilir, birden fazla GPU’ya dağıtılabilir veya bazıları daha yavaş belleğe taşınabilir. Son seçenek, veri aktarımı nedeniyle gecikme yaratabilir.
MoE’nin düşük aktif parametre sayısı, aynı sayıda parametre içeren küçük bir dense model kadar az bellek kullanacağını göstermez.
Karşılaşılan Zorluklar
Yük Dengeleme
Bazı uzmanların sürekli seçilmesi, diğerlerinin yeterince eğitilmemesine veya kullanılmamasına neden olabilir. Aşırı yüklenen uzmanlar çalışma süresini de uzatabilir.
İletişim Maliyeti
Uzmanlar farklı GPU’lara dağıtıldığında token temsillerinin ilgili cihazlara gönderilmesi gerekir. Expert Parallelism — uzman paralelliği, bu dağıtımın düzenlenmesinde kullanılan yaklaşımlardan biridir.
Eğitim Kararlılığı
Router ile uzmanların birlikte öğrenmesi, optimizasyonu karmaşıklaştırabilir. Dengesiz yönlendirme ve sayısal hassasiyet sorunları özel önlemler gerektirebilir.
Gerçek Hız ve Enerji Tüketimi
Daha az işlem yapmak, otomatik olarak daha düşük gecikme veya enerji tüketimi sağlamaz. Bellek erişimi, iletişim, batch boyutu ve kullanılan yazılım birlikte belirleyicidir.
Bu nedenle performans, yalnızca parametre sayılarına bakılarak değil, gerçek iş yüklerinde ölçülmelidir.
MoE, AI Gateway ve Uzman Ajanlar Aynı Şey mi?
Hayır. Bunlar farklı düzeylerde çalışan yapılardır.
-
MoE: Tek bir sinir ağının içinde uzman hesaplama bileşenleri seçilir.
-
AI Gateway: Uygulama isteği farklı model veya hizmetlerden birine yönlendirilebilir.
-
Çok ajanlı sistem: Ayrı görevleri yürüten ajanlar birlikte çalışabilir.
Bir ajan MoE tabanlı model kullanabilir; bir gateway de isteği böyle bir modele gönderebilir. Ancak bu durum gateway’in veya ajan sisteminin kendi başına MoE mimarisi olduğu anlamına gelmez.
Sık Sorulan Sorular
MoE uzmanları kullanıcı tarafından seçilebilir mi?
Standart kullanımda seçim modelin router bileşeni tarafından yapılır. Kullanıcı genellikle uzmanları tek tek seçmez.
Her model ailesinin bütün sürümleri MoE mi?
Hayır. Aynı model ailesinde yoğun ve MoE tabanlı farklı modeller bulunabilir. Belirli modelin teknik açıklaması kontrol edilmelidir.
MoE daha doğru cevap garantiler mi?
Hayır. Eğitim verisi, model tasarımı ve görev gibi etkenler sonucu belirler.
MoE yalnızca çıkarımda mı kullanılır?
Hayır. Uzmanlar ve yönlendirme mekanizması eğitim sürecinin de parçasıdır.
MoE’nin değeri, model kapasitesi ile token başına hesaplama arasında farklı bir denge kurabilmesidir. Bu avantajın kullanılabilmesi, yönlendirme kadar bellek ve iletişim altyapısının da iyi tasarlanmasına bağlıdır.
Kaynaklar: Shazeer ve diğerleri — Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer; Fedus, Zoph ve Shazeer — Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity; Jiang ve diğerleri — Mixtral of Experts; Hugging Face — Mixture of Experts Explained.
Editör Notu
Bu içerik, kamuya açık akademik araştırmalar ve teknik açıklamalardan yararlanılarak hazırlanmış bir araştırma ve değerlendirme yazısıdır. İçerikte yer alan değerlendirmeler editoryal yorum niteliğindedir. MoE modellerinin kalite, hız, bellek ve enerji performansı; mimariye, eğitim yöntemine, donanıma ve iş yüküne göre değişebilir.