Wafer-Scale Engine (WSE) Nedir? Dev Yapay Zekâ İşlemcisi Nasıl Çalışıyor?
Yapay zekâ donanımlarını karşılaştırırken genellikle işlem kapasitesi öne çıkar. Oysa güçlü bir işlemci, ihtiyaç duyduğu veriyi beklerken hesaplama kaynaklarını tam kullanamayabilir.
Büyük modeller birden fazla hızlandırıcıya dağıtıldığında, cihazlar arasındaki iletişim de toplam çalışma süresinin parçası olur. Wafer ölçeğinde hesaplama, bu iletişimin belirli bölümlerini çok geniş bir silikon yüzey üzerinde gerçekleştirmeyi hedefler.
Cerebras tarafından geliştirilen Wafer-Scale Engine (WSE) ailesi, bu yaklaşımın örneklerinden biridir. WSE bir ürün ailesinin adıdır; wafer ölçeğinde entegrasyon ise daha genel bir mimari kavramdır.
Wafer-Scale Engine Nedir?
WSE, hesaplama çekirdeklerini, dağıtılmış yerel belleği ve bağlantı ağını wafer ölçeğinde birleştiren yapay zekâ işlemcisidir.
Wafer, yarı iletken devrelerin üretildiği silikon plakadır. Geleneksel üretimde bu plaka üzerinde çok sayıda ayrı yonga oluşturulur. Yonga adı verilen bu parçalar daha sonra kesilir, test edilir ve paketlenir.
WSE yaklaşımında ise geniş silikon alan, bağlantılı bir hesaplama yapısı olarak kullanılır. Bununla birlikte waferın yuvarlak yüzeyinin tamamı kullanılmaz; işlemci alanı üretim ve tasarım koşullarına göre belirlenir.
Amaç yalnızca mümkün olan en büyük çipi yapmak değildir. Hesaplama, bellek ve iletişimi birlikte düzenleyerek iş yükünü verimli yürütmektir.
WSE-3’ün Teknik Özellikleri Neler?
Cerebras’ın WSE-3 için yayımladığı teknik değerler arasında yaklaşık 4 trilyon transistör, 900 bin yapay zekâ çekirdeği, 44 GB çip içi SRAM ve 125 petaflop tepe yapay zekâ işlem kapasitesi bulunur. Bu değerler WSE-3’e aittir; bütün WSE ailesi için ortak özellikler değildir.
| Özellik | WSE-3 için açıklanan değer |
|---|---|
| Transistör sayısı | Yaklaşık 4 trilyon |
| Yapay zekâ çekirdeği | 900 bin |
| Çip içi SRAM | 44 GB |
| Tepe yapay zekâ işlem kapasitesi | 125 petaflop |
Buradaki çekirdekler, masaüstü CPU çekirdekleriyle aynı yapıda değildir. Çekirdek sayılarını farklı mimariler arasında doğrudan karşılaştırmak yanıltıcı olabilir.
Ayrıca tepe işlem kapasitesi, gerçek uygulama performansı değildir. Kullanılan veri türü, işlemler, seyrekliğin değerlendirilmesi ve kaynak kullanım oranı sonuçları etkiler.
“Yüzlerce petaflop” gibi genel bir ifade yerine, belirli ürünün teknik değeri ve ölçüm koşulları belirtilmelidir.
Dev İşlemcide Veri Nasıl Hareket Ediyor?
WSE içinde hesaplama birimleri, dağıtılmış bellek ve işlemci üzerindeki iletişim ağı birlikte çalışır.
Bir çekirdeğin ihtiyaç duyduğu verinin yakında bulunması, uzak bir bellek kaynağına erişim ihtiyacını azaltabilir. Hesaplamanın farklı bölümleri arasındaki veriler ise wafer üzerindeki ağ üzerinden taşınabilir.
Ancak bu, bütün veri hareketinin ortadan kalktığı anlamına gelmez. Verilerin uygun yerlere dağıtılması ve çekirdekler arasında aktarılması yine gerekir.
İletişim maliyeti kaldırılmaz; farklı bir fiziksel ve mimari düzen içinde yönetilir.
Bellek Kapasitesi ile Bant Genişliği Aynı mı?
Hayır. Bu iki özellik farklı soruları cevaplar.
Bellek kapasitesi, ne kadar veri tutulabileceğini gösterir.
Bellek bant genişliği, veriye hangi hızda erişilebildiğini ifade eder.
WSE’nin yerel SRAM düzeni yüksek erişim hızları için önemlidir. Ancak sınırlı kapasitedeki hızlı bellek, her büyük modelin bütün ağırlıklarını aynı anda saklayamaz.
Büyük modellerin çalıştırılmasında dış bellek ve başka sistem bileşenlerinden yararlanılabilir. Ağırlıkların ve ara verilerin nasıl taşınacağı, kullanılan çalışma düzenine bağlıdır.
Dolayısıyla “trilyon parametreli model tek işlemcide çalışıyor” ifadesi, modelin bütün verilerinin yalnızca işlemci üzerindeki bellekte bulunduğu şeklinde anlaşılmamalıdır.
GPU’lardan Farkı Nedir?
Bir GPU, zaten çok sayıda hesaplama birimi içeren bir işlemcidir. “Normal işlemciler birçok küçük çipten oluşur” ifadesi bütün ürünler için doğru değildir.
Bazı GPU’lar tek yonga kullanırken bazı tasarımlar birden fazla yongayı bir pakette birleştirir. Çok GPU’lu sistemlerde ise ayrı hızlandırıcılar uygun bağlantılar üzerinden birlikte çalışır.
WSE’nin ayırt edici tarafı, hesaplama yapısını çok geniş silikon alan üzerinde ölçeklendirmesidir.
| Konu | Çok GPU’lu yaklaşım | WSE yaklaşımı |
|---|---|---|
| Hesaplama dağılımı | Birden fazla hızlandırıcı arasında | Geniş wafer alanındaki çekirdekler arasında |
| İletişim | Cihaz içi ve cihazlar arası bağlantılar | Wafer üzerindeki ağ ve dış bağlantılar |
| Bellek düzeni | Önbellekler, hızlandırıcı belleği ve diğer kaynaklar | Dağıtılmış SRAM ve sistem tasarımına bağlı dış kaynaklar |
| Yazılım görevi | İş yükünü hızlandırıcılara dağıtmak | İş yükünü wafer üzerindeki kaynaklara eşlemek |
Bu farklılıklar, WSE’nin her görevde GPU’lardan hızlı olduğunu göstermez. Karşılaştırma aynı iş yükü ve kalite koşullarında yapılmalıdır.
Üretim Kusurları Nasıl Aşılıyor?
Çip alanı büyüdükçe üretim sırasında kusurlu noktalarla karşılaşmak daha olası hâle gelir. Wafer ölçeğinde sistemin bütün yüzeyinin kusursuz üretilmesini beklemek zorlayıcıdır.
Bu nedenle yedek hesaplama kaynakları ve bağlantılar kullanılabilir. Testlerde belirlenen hatalı bölgeler devre dışı bırakılarak kullanılabilir kaynaklar üzerinden çalışma düzeni oluşturulur.
Bu yaklaşım, kusurlara rağmen işlevsel bir sistem kurmayı hedefler.
Ancak bütün hata türleri aynı şekilde yönetilemez. Üretim verimi, kusurların dağılımı ve mimarinin yedeklilik kapasitesi önemini korur.
Yazılım Neden Belirleyici?
Geniş bir hesaplama ağına sahip olmak, uygulamanın bu kaynakları verimli kullanacağını garanti etmez.
Derleyici ve çalışma yazılımı, işlemleri uygun çekirdeklere yerleştirir. Verilerin nerede tutulacağını ve hangi bağlantılardan taşınacağını düzenler.
Modeldeki işlemlerin desteklenmesi, tensör boyutları ve veri akışı bu eşlemeyi etkiler. Donanıma uygun olmayan bir iş yükünde kaynakların bir bölümü boş kalabilir.
Eğitimde geri yayılım ve ağırlık güncellemesi bulunurken çıkarımda giriş işleme ve token üretimi öne çıkar. Bir eğitim sonucu, çıkarım performansını doğrudan açıklamaz.
Güç ve Soğutma Nasıl Yönetiliyor?
Çok geniş silikon alan üzerinde yoğun hesaplama yapmak, güç dağıtımı ve ısı yönetimi açısından özel çözümler gerektirir.
Enerjinin işlemciye kararlı biçimde ulaştırılması, sıcak noktaların kontrol edilmesi ve soğutma yüzeyiyle uygun temas sağlanması gerekir. Paketlemede mekanik gerilimler ve sıcaklıkla genleşme de dikkate alınır.
Bu nedenle WSE, sıradan bir bilgisayara takılan ekran kartı gibi değerlendirilmemelidir. İşlemci, onu barındıran sistemin güç ve soğutma altyapısıyla birlikte çalışır.
Performans İddiaları Nasıl Okunmalı?
Bir sistemin daha hızlı olduğu söylenirken hangi görevde ve hangi koşullarda ölçüm yapıldığı önemlidir.
Dil modeli çıkarımında şu bilgiler birlikte değerlendirilmelidir:
- Model ve hesaplama hassasiyeti.
- Giriş ve çıktı uzunlukları.
- Eşzamanlı istek sayısı.
- İlk token gecikmesi.
- Kullanıcı başına üretim hızı.
- Toplam servis kapasitesi.
- Bütün sistemin enerji tüketimi.
Tek bir kullanıcının hızlı cevap alması ile çok sayıda kullanıcıya ekonomik hizmet sunulması farklı hedeflerdir.
Benzer şekilde, düşük veri taşıma maliyeti belirli görevlerde enerji avantajı sağlayabilir. Ancak dış bellek, ağ, güç dönüşümü ve soğutma da toplam ölçüme dâhil edilmelidir.
Nerelerde Kullanılabilir?
WSE tabanlı sistemler, uygun yazılım desteğiyle yapay zekâ eğitimi ve çıkarımında kullanılabilir. Wafer ölçeğindeki hesaplama düzeni bazı bilimsel uygulamalar için de değerlendirilebilir.
Ancak “iklim simülasyonu” veya “ilaç araştırması” gibi geniş başlıklar tek başına uygunluğu göstermez. İlgili uygulamanın algoritması, veri yapısı ve iletişim ihtiyacı incelenmelidir.
Donanımın büyüklüğü değil, iş yüküyle eşleşmesi belirleyicidir.
Sık Sorulan Sorular
WSE bütün GPU kümelerinin yerine geçebilir mi?
Hayır. Uygunluk; modele, yazılım desteğine, kapasite ihtiyacına ve maliyete bağlıdır. Bütün iş yükleri için tek bir üstün mimari yoktur.
900 bin çekirdek, aynı sayıda CPU çekirdeği demek mi?
Hayır. Çekirdeklerin görevleri ve mimarileri farklıdır. Sayıları doğrudan karşılaştırmak doğru değildir.
WSE’de bütün veriler çip içinde mi kalır?
Hayır. Büyük modeller ve diğer sistem ihtiyaçları için dış kaynaklar kullanılabilir.
Wafer-scale ve chiplet aynı şey mi?
Hayır. Chiplet yaklaşımı ayrı yongaları bir pakette birleştirir. Wafer ölçeğinde yaklaşım, geniş silikon alanı bağlantılı bir hesaplama yapısı olarak kullanır.
Kaynaklar: Cerebras Systems — Third-Generation Wafer-Scale Engine duyurusu ve WSE-3 teknik özellikleri; Sean Lie — Cerebras Architecture Deep Dive: First Look Inside the Hardware/Software Co-Design for Deep Learning; Cerebras Systems — Wafer-Scale Integration mimari kaynakları.
Editör Notu
Bu içerik, Wafer-Scale Engine mimarisinin çalışma mantığını ve yapay zekâ donanımlarındaki kullanım koşullarını ele alan bir araştırma ve değerlendirme yazısıdır. İçerikte yer alan değerlendirmeler editoryal yorum niteliğindedir. Teknik değerler belirtilen ürün nesline aittir. Gerçek performans ve enerji kullanımı; hesaplama hassasiyetine, yazılım eşlemesine, bellek düzenine ve iş yüküne bağlıdır. Çekirdek sayısı ve tepe işlem kapasitesi, bütün uygulamalarda aynı hız avantajını garanti etmez.