Continuous Batching Nedir? Büyük Dil Modelleri Çok Sayıda İsteği Nasıl İşliyor?
Yapay zekâ uygulamalarında kullanıcıların gönderdiği istekler aynı uzunlukta değildir. Bir kişi kısa bir tanım isterken başka biri uzun bir rapor veya yüzlerce satırlık kod talep edebilir. Bu farklılık, sunucuların işlem gücünü verimli kullanmasını zorlaştırır.
02/10/2026 22:49 | Son Güncelleme : 11/10/2026 02:59 | Netosfer
Continuous Batching (Sürekli Gruplama), büyük dil modellerinin birden fazla isteği işlerken çalışma grubunu sürekli güncellemesini sağlayan çıkarım planlama tekniğidir. Tamamlanan isteklerin yerine yeni istekler alınarak mevcut donanımdan daha fazla yararlanılması amaçlanır.
Continuous Batching Nedir?
Continuous Batching, işlem grubunun bütün yanıtlar tamamlanana kadar sabit tutulması yerine, üretim adımları arasında yeniden düzenlenmesidir.
Planlayıcı, tamamlanan istekleri gruptan çıkarabilir ve yeterli kaynak varsa bekleyen istekleri sonraki adıma dahil edebilir. Böylece kısa bir yanıtın ardından boşalan kapasitenin kullanılabilmesi için grubun en uzun yanıtını beklemek gerekmeyebilir.
Bu yaklaşımın temelindeki iteration-level scheduling, yani iterasyon seviyesinde planlama, Orca araştırmasında açıklanan önemli yöntemlerden biridir.
Büyük Dil Modelleri Yanıtları Nasıl Üretir?
Sürekli gruplamayı anlamak için çıkarım sürecinin iki temel aşamasını ayırmak gerekir:
Prefill: Model, kullanıcının gönderdiği girdiyi işler ve yanıt üretiminde kullanılacak ara bilgileri hazırlar.
Decode: Yanıt, birbirini izleyen üretim adımlarıyla oluşturulur. Standart otoregresif üretimde her adımda yeni bir token üretilir. Token, bir kelimeyi veya kelimenin bir bölümünü temsil edebilir.
Farklı isteklerin giriş ve yanıt uzunlukları değiştiğinden, hepsinin aynı anda tamamlanması beklenmez. Sürekli gruplama bu değişkenliği yönetmeye yardımcı olur.
Continuous Batching Nasıl Çalışır?
Aynı işlem grubunda üç kullanıcının bulunduğunu düşünelim:
-
İstekler işlenmeye başlar: Model, kullanıcıların yanıtlarını üretir.
-
Kısa yanıt tamamlanır: İlk kullanıcının isteği aktif gruptan çıkarılır.
-
Kaynaklar değerlendirilir: Planlayıcı bellek kapasitesini ve işlem bütçesini kontrol eder.
-
Yeni istek alınır: Uygun kapasite varsa bekleyen başka bir kullanıcı gruba eklenir.
-
Üretim devam eder: Diğer kullanıcıların yanıtları tamamlanırken grup yeniden güncellenebilir.
Yeni bir isteğin eklenmesi her zaman anında gerçekleşmez. İstek kuyruğu, kullanılabilir bellek ve planlama politikası bekleme süresini etkiler. Hugging Face’in uygulamasında da gruba alınabilecek işler, token bütçesi ve kaynak sınırlarıyla yönetilir.
Static Batching ile Arasındaki Fark Nedir?
Static Batching (Sabit Gruplama) yaklaşımında belirli bir istek grubu birlikte çalıştırılır. Gruba yeni istek eklenmesi genellikle mevcut grubun tamamlanmasını bekler. Kısa yanıtlar erken bittiğinde kullanılmayan kapasite oluşabilir.
Continuous Batching ise grubun üyelerini üretim sürerken günceller. Bu esneklik, farklı uzunluklardaki yanıtların birlikte sunulduğu sistemlerde kaynak kullanımını iyileştirebilir. Ancak GPU’nun her koşulda tamamen dolu çalışacağını garanti etmez.
Daha Fazla İstek İşlemek Her Zaman Daha Hızlı Yanıt Demek mi?
Toplam işlem kapasitesi ile tek bir kullanıcının bekleme süresi farklı ölçütlerdir.
Performans değerlendirilirken özellikle şunlara bakılır:
-
Throughput: Birim zamanda işlenen istek veya üretilen token miktarı.
-
İlk token süresi: Kullanıcının ilk yanıt parçasını ne kadar beklediği.
-
Tokenlar arası gecikme: Yanıt başladıktan sonra parçaların hangi aralıklarla üretildiği.
Daha büyük gruplar toplam kapasiteyi artırabilirken bazı kullanıcıların gecikmesini yükseltebilir. Bu nedenle hedef, yalnızca mümkün olduğunca çok isteği gruba almak değildir.
Chunked prefill, uzun girdileri küçük bölümler hâlinde işleyerek devam eden yanıt üretimiyle dengelemeye yardımcı olabilir. Uygun ayarlar iş yüküne göre değişir.
KV Cache ve PagedAttention ile İlişkisi Nedir?
KV Cache, modelin önceki tokenlara ait bazı hesaplamalarını saklar. Aktif isteklerin sayısı ve bağlam uzunlukları arttıkça bu önbelleğin bellek ihtiyacı da büyür.
PagedAttention ise KV Cache’in bloklar üzerinden yönetilmesini sağlayan bir bellek yaklaşımıdır. Sürekli gruplamayla birlikte kullanılabilir; ancak aynı kavram değildir.
Continuous Batching hangi isteklerin birlikte çalışacağını planlarken, PagedAttention bu isteklerin bellek kullanımını daha verimli yönetmeye yardımcı olur.
Nerelerde Kullanılır?
Bu teknik; sohbet botları, kod asistanları, kurumsal yapay zekâ uygulamaları ve LLM API servislerinde eş zamanlı istekleri yönetmek için kullanılabilir.
AI Agent sistemlerinde de farklı görevlerden gelen model çağrılarının sunulmasına yardımcı olabilir. Bununla birlikte ajanların görev planlamasıyla model sunucusunun istek gruplaması farklı katmanlarda gerçekleşir.
Avantajları ve Sınırları Nelerdir?
Sürekli gruplama, uygun koşullarda donanım başına daha fazla çıktı üretilmesini ve istek başına maliyetin düşmesini sağlayabilir.
Buna karşılık bellek kapasitesi, uzun girdiler, trafik yoğunluğu ve planlayıcı ayarları performansı sınırlar. Tek bir GPU’nun binlerce kullanıcı isteğini aynı anda aktif olarak işlemesi bu yöntemle kendiliğinden mümkün hâle gelmez. Büyük hizmetlerde toplam kapasite, birden fazla sunucu ve model kopyasıyla da artırılır.
Sık Sorulan Sorular
Continuous Batching model eğitimi için mi kullanılır?
Burada anlatılan yöntem, eğitilmiş modelin kullanıcı isteklerine yanıt verdiği çıkarım sürecine yöneliktir.
Her istek beklemeden işlenir mi?
Hayır. Bellek veya işlem kapasitesi doluysa yeni istekler kuyrukta bekleyebilir.
Modelin cevaplarını daha doğru yapar mı?
Temel amacı cevap doğruluğunu artırmak değil, isteklerin yürütülmesini daha verimli planlamaktır.
Continuous Batching’in değeri, değişken uzunluktaki istekleri mevcut kaynaklara göre yönetebilmesidir. Başarılı bir yapılandırma, yüksek işlem kapasitesini kabul edilebilir kullanıcı bekleme süreleriyle birlikte değerlendirir.
Kaynaklar: USENIX OSDI 2022 — Orca: A Distributed Serving System for Transformer-Based Generative Models, Hugging Face — Continuous Batching from First Principles ve Transformers Continuous Batching Architecture dokümantasyonu, vLLM — Optimization and Tuning dokümantasyonu ve Inside vLLM: Anatomy of a High-Throughput LLM Inference System.
Editör Notu
Bu içerik, kamuya açık yapay zekâ araştırmaları ve resmî teknik dokümantasyonlardan yararlanılarak hazırlanmış bir araştırma ve değerlendirme yazısıdır. İçerikte yer alan değerlendirmeler editoryal yorum niteliğindedir. Çıkarım performansı; kullanılan modele, donanıma, istek yoğunluğuna ve sunucu yapılandırmasına göre değişebilir.
Bunlar da ilginizi çekebilir
Yapay Zekâ Şirketleri Kendi İnternetini Kuruyor: AI Trafiği Neden Bu Kadar Büyüdü?
Yapay zekâ sistemleri büyüdükçe binlerce GPU arasında taşınan veri de artıyor. AI networking teknolojileri, teknoloji şirketlerinin veri merkezi altyapısını yeniden şekillendiriyor.
2 ay önceInference Labs Nedir? Doğrulanabilir Yapay Zekâ (Verifiable AI) Altyapısı Nasıl Çalışır?
Yapay zekâ bir sonuç ürettiğinde ona neden güvenelim? Inference Labs, AI çıktılarının gerçekten nasıl üretildiğini kriptografik kanıtlarla doğrulamayı amaçlıyor.
1 ay önceAtoma Network Nedir? Merkeziyetsiz Yapay Zekâ Çıkarım (AI Inference) Ağı Nasıl Çalışır?
Yapay zekâ çalışırken verileriniz ve modelin kendisi gerçekten güvende mi? Atoma, AI çıkarımını merkeziyetsiz altyapı, doğrulanabilir hesaplama ve gizli işlem teknolojileriyle yeniden ele alıyor.
1 ay önce