Yapay Zeka

Prompt Caching Nedir? Büyük Dil Modelleri Tekrarlayan Promptlarla Nasıl Daha Hızlı ve Daha Ekonomik Çalışıyor?

Örneğin bir kurumsal asistan, her istekte aynı şirket politikalarını kullanabilir. Bir kodlama aracı aynı proje kurallarını, bir belge analiz sistemi ise aynı raporu farklı sorularla birlikte işleyebilir.

Prompt Caching, değişmeyen giriş bölümlerine ait hesaplama durumlarını saklayarak uygun sonraki isteklerde yeniden kullanılmasını sağlar. Böylece giriş işleme süresi azalabilir, yanıt daha erken başlayabilir ve kullanılan hizmetin fiyatlandırmasına bağlı olarak API maliyeti düşebilir.

Ancak bu yöntem, bütün isteğin önbellekten karşılandığı anlamına gelmez. Önbellekte bulunmayan giriş bölümleri işlenir ve yeni yanıt tokenları üretilmeye devam eder.

Prompt Caching Nedir?

Prompt Caching, büyük dil modellerinde tekrar kullanılan prompt bölümlerinin hesaplama durumlarını yeniden değerlendiren bir çıkarım optimizasyonudur.

Önbellekleme için uygun içerikler arasında sistem talimatları, araç şemaları, uzun dokümanlar, ortak örnekler ve değişmeyen konuşma başlangıçları bulunabilir.

Yaygın uygulamalarda yeniden kullanım, promptun başlangıçtan itibaren eşleşen bölümüne dayanır. Aynı metnin farklı isteklerin herhangi bir yerinde bulunması, tek başına yeterli değildir. İçeriğin öncesindeki bağlam ve kullanılan model yapılandırması da önemlidir. 

Prompt Caching Nasıl Çalışır?

Genel süreç, önbelleğin oluşturulması ve sonraki isteklerde uygun eşleşmenin bulunması üzerinden ilerler.

İlk İstek İşlenir

Kullanılabilir bir önbellek kaydı yoksa model giriş içeriğini normal biçimde işler. Sistem talimatları, belgeler ve kullanıcı mesajı hesaplamaya katılır.

Bu ilk işlem, önbelleğin oluşturulması için gereken başlangıç maliyetini meydana getirir.

Sabit Bölüm Önbelleğe Alınır

Sistem, yeniden kullanılabilecek giriş bölümüne ait hesaplama durumlarını saklar. Saklanacak bölüm otomatik belirlenebilir veya kullanılan hizmetin desteklediği açık önbellek sınırlarıyla işaretlenebilir.

Yeni İsteğin Başlangıcı Kontrol Edilir

Sonraki isteğin başlangıcı mevcut kayıtlarla karşılaştırılır. Geçerli ve uyumlu bir eşleşme varsa ilgili hesaplamalar yeniden kullanılır.

Kalan Giriş İşlenir

Önbellekte olmayan bölüm hesaplanır. Bu bölüm yalnızca yeni kullanıcı mesajından oluşmak zorunda değildir. Değişen belgeler, araç çıktıları veya yeni konuşma mesajları da işlenebilir.

Yeni Yanıt Üretilir

Model, güncel giriş bağlamına göre cevap oluşturur. Önceki hesaplamalardan yararlanılması, cevap üretme aşamasını ortadan kaldırmaz.

Prefill ve Decode Arasındaki Fark Nedir?

Prompt Caching’in performans etkisini anlamak için çıkarımın iki aşamasını ayırmak gerekir.

Prefill, modele gönderilen giriş tokenlarının işlendiği aşamadır. Uzun talimatlar ve belgeler bu aşamanın maliyetini artırabilir.

Decode, modelin yanıt tokenlarını ürettiği aşamadır. Otoregresif modellerde yeni tokenlar, önceki tokenlara bağlı olarak oluşturulur.

Prompt Caching’in doğrudan kazancı, ortak giriş bölümünün prefill hesaplamalarını azaltmasıdır. Yeni cevap tokenlarının üretimi yine gerekir.

Bu nedenle uzun giriş ve kısa cevap kullanılan bir uygulamada belirgin kazanım görülebilir. Çok uzun cevapların üretildiği bir uygulamada ise toplam yanıt süresindeki iyileşme daha sınırlı olabilir. 

Prompt Caching Neden Önemlidir?

Birçok yapay zekâ uygulaması, aynı bağlamı çok sayıda istekte kullanır. Değişmeyen içeriğin sürekli yeniden hesaplanması, kullanıcıya ek bir fayda sağlamadan kaynak tüketebilir.

Prompt Caching, bu tekrarları azaltarak özellikle uzun girişlerin sık kullanıldığı uygulamalarda verimlilik sağlayabilir.

Örneğin 20.000 tokenlık ortak bir belge üzerinden farklı sorular sorulduğunu düşünelim. Uygun önbellek koşulları sağlandığında belgenin eşleşen bölümünün hesaplamaları sonraki sorularda tekrar kullanılabilir.

Ancak belge güncellenirse, prompt düzeni değişirse veya önbellek kaydı kullanılamaz hâle gelirse ilgili bölüm yeniden işlenebilir. Bu nedenle “ortak içerik yalnızca bir kez hesaplanır” ifadesi her koşulda geçerli değildir.

API Maliyetini Her Zaman Azaltır mı?

Hayır. Tasarruf, önbelleğin nasıl ücretlendirildiğine ve kaç kez yeniden kullanıldığına bağlıdır.

Bazı hizmetler önbellekten okunan giriş tokenlarını daha düşük fiyatla ücretlendirir. Buna karşılık önbellek oluşturma veya daha uzun saklama süresi için ayrı ücret uygulanabilir.

Maliyet kalemi Dikkat edilmesi gereken nokta
Önbellek oluşturma İlk işlemde ek maliyet oluşabilir
Önbellekten okuma Daha düşük giriş ücreti uygulanabilir
Yeni giriş tokenları Normal giriş fiyatlandırması devam edebilir
Yanıt tokenları Çıktı üretim maliyeti devam eder

Aynı içerik yalnızca bir kez kullanılacaksa önbellekleme ekonomik avantaj sağlamayabilir. Kısa aralıklarla çok sayıda tekrar varsa toplam maliyet düşebilir.

Bu nedenle değerlendirme, yalnızca önbellekten okuma fiyatına bakılarak yapılmamalıdır. Kayıt oluşturma maliyeti, tekrar sıklığı ve saklama süresi birlikte hesaplanmalıdır. 

Prompt Caching ile KV Cache Arasındaki Fark

KV Cache, Transformer dikkat mekanizmasının oluşturduğu key ve value temsillerini saklar. Model, sonraki tokenları üretirken önceki tokenların bu temsillerini baştan hesaplamak zorunda kalmaz.

Prompt Caching ise girişe ait hesaplama durumlarının sonraki isteklerde yeniden kullanılmasını sağlayan mekanizmayı ifade eder.

Birçok uygulamada Prompt Caching, KV Cache’in saklanması ve eşleşen giriş için tekrar kullanılması üzerine kurulur. Dolayısıyla iki kavram tamamen bağımsız değildir.

“KV Cache yalnızca tek istekte çalışır” ifadesi de fazla sınırlayıcıdır. Uygun bir yönetim mekanizmasıyla KV verileri istekler arasında yeniden kullanılabilir. 

Prompt Caching ile Prefix Caching Aynı mı?

Bu terimler birçok uygulamada yakın anlamda kullanılır.

Prefix Caching, özellikle promptun ortak başlangıç bölümüne ait hesaplamaların yeniden kullanılmasını vurgular.

Prompt Caching, daha genel bir özellik adı olabilir. Yaygın uygulamaları da başlangıç eşleşmesine dayanır.

Araştırmalarda yapılandırılmış prompt modüllerinin hesaplamalarını yeniden kullanmayı hedefleyen farklı yöntemler de bulunur. “Prompt Cache: Modular Attention Reuse for Low-Latency Inference” çalışması, bu tür modüler yeniden kullanım yaklaşımlarına örnektir.

Bu nedenle bir sistemin nasıl çalıştığını anlamak için özellik adının yanında eşleşme ve yeniden kullanım kuralları da incelenmelidir. 

Prompt Değişirse Önbellek Ne Olur?

Değişikliğin konumu önemlidir.

Başlangıç eşleşmesine dayanan bir sistemde promptun ilk bölümü değişirse, sonraki içerik aynı olsa bile yeniden kullanım azalabilir.

Değişiklik ortak başlangıcın sonrasında yapılıyorsa önceki bölüm kullanılmaya devam edebilir. Kullanılabilecek uzunluk, önbellek sınırlarına ve uygulamanın teknik kurallarına bağlıdır.

Anlam benzerliği yeterli değildir. “Yanıtları kısa yaz” ile “Kısa cevap ver” benzer anlam taşısa da aynı giriş dizisi değildir.

Araç tanımlarının sıralanması, belgelerin düzeni ve mesaj yapısı gibi ayrıntılar da eşleşmeyi etkileyebilir.

Daha Verimli Prompt Düzeni Nasıl Oluşturulur?

Önek eşleşmesine dayanan uygulamalarda sabit içerik önce, değişken içerik sonra yerleştirilebilir.

Örneğin bir belge analiz sisteminde ortak talimatlar ve belge başlangıçta, kullanıcının sorusu ise sonda bulunabilir.

İçerik Düzenleme yaklaşımı
Sabit sistem talimatları Ortak başlangıçta tutulabilir
Değişmeyen araç tanımları Tutarlı biçimde sunulabilir
Ortak belgeler ve örnekler Sıralaması korunabilir
Kullanıcı sorusu Sabit bölümün ardından eklenebilir
İstek kimliği veya zaman bilgisi Gerekliyse değişken bölümde tutulabilir

Bu düzenleme, uygulamanın doğruluğunu koruyarak yapılmalıdır. Önbellek oranını artırmak amacıyla gerekli güvenlik talimatlarını kaldırmak veya güncel bilgileri yanlış biçimde sabitlemek uygun değildir.

Nerelerde Kullanılabilir?

AI Agent Sistemleri

Agent uygulamaları aynı görev tanımlarını, çalışma kurallarını ve araç açıklamalarını birçok adımda kullanabilir. Ortak başlangıçların yeniden kullanılması, tekrarlayan giriş hesaplamalarını azaltabilir.

RAG Uygulamaları

Aynı belgeler aynı başlangıç bağlamında tekrar kullanılıyorsa kazanım sağlanabilir. Ancak her soruda farklı belgeler getiren bir RAG sisteminde uzun bir ortak bölüm oluşmayabilir.

Kurumsal Asistanlar

Şirket politikaları, yanıt şablonları ve ortak başvuru belgeleri uygun içerikler olabilir. Bu bilgiler değiştiğinde önbellek eşleşmesi de yeniden değerlendirilmelidir.

Kod Üretme Araçları

Sabit proje kuralları ve tekrar kullanılan kod bağlamı, farklı görevlerde yeniden işlenmeden değerlendirilebilir.

Çok Turlu Sohbetler

Yeni mesajlar eklenirken önceki konuşmanın başlangıcı korunuyorsa hesaplamaların bir bölümü tekrar kullanılabilir. Eski mesajları düzenlemek veya konuşmayı özetlemek eşleşmeyi değiştirebilir.

Prompt Caching ile Response Cache Arasındaki Fark

Response Cache, daha önce oluşturulmuş cevabı saklar ve uygun bir istekte yeniden sunar.

Prompt Caching, giriş tarafındaki hesaplamaları yeniden kullanır. Model yeni yanıt üretmeye devam eder.

Özellik Prompt Caching Response Cache
Saklanan veri Girişe ait hesaplama durumları Önceden üretilmiş cevap
Yeni yanıt üretimi Devam eder Eşleşme durumunda gerekmeyebilir
Temel amaç Giriş işleme yükünü azaltmak Cevabı doğrudan yeniden sunmak
Başlıca koşul Uyumlu giriş eşleşmesi Önceki cevabın yeni istek için geçerli olması

Aynı ortak başlangıcı kullanan farklı sorular, Prompt Caching etkin olsa da farklı cevaplar alabilir.

Avantajları

Daha Hızlı İlk Yanıt

Uzun ortak girişin yeniden hesaplanmaması, ilk token gecikmesini azaltabilir. Sunucu yoğunluğu ve diğer işlem maliyetleri de sonucu etkiler.

Daha Düşük Tekrarlayan Hesaplama

Değişmeyen içerik sık kullanıldığında gereksiz giriş işlemleri azaltılabilir.

Daha Ekonomik API Kullanımı

Önbellekten okuma için indirim uygulayan hizmetlerde, yeterli tekrar sağlandığında toplam maliyet düşebilir.

Daha Verimli Altyapı

Giriş işleme yükünün azaldığı uygulamalarda mevcut kaynaklar daha fazla isteği karşılayabilir. Kazanım, gerçek iş yüküne bağlıdır.

Karşılaşılan Zorluklar

Saklama Süresi

Önbellek kayıtları kalıcı olmayabilir. Süre dolduğunda, bellek baskısı oluştuğunda veya hizmet koşulları değiştiğinde yeniden hesaplama gerekebilir.

Minimum Uzunluk Koşulları

Bazı hizmetler kısa girişleri önbelleğe almayabilir. Uygunluk koşulları model ve sağlayıcıya göre değişir.

Düşük Eşleşme Oranı

Prompt başlangıçları sık değişiyorsa yeniden kullanım azalır. Özelliğin etkin olması tek başına tasarruf garantisi değildir.

Güvenlik ve İzolasyon

Önbelleğin hangi kullanıcılar veya uygulamalar arasında paylaşılabildiği açık olmalıdır. Erişim kontrolü, saklama koşulları ve zamanlama üzerinden bilgi çıkarma riskleri birlikte değerlendirilmelidir.

Sağlayıcı Farklılıkları

Otomatik eşleşme, açık önbellek sınırları, ücretlendirme ve saklama politikaları farklı olabilir. Bir hizmetin davranışı diğerine doğrudan genellenmemelidir.

Performans Nasıl Ölçülmeli?

Prompt Caching’in faydası gerçek kullanım verileriyle değerlendirilmelidir.

Önbellekten okunan token sayısı, kayıt oluşturma maliyeti, ilk token gecikmesi, toplam yanıt süresi ve toplam ücret birlikte incelenmelidir.

İlk istekte kazanım oluşmayabilir. Sonraki isteklerde avantaj görülebilir; ancak kayıt silindiğinde veya giriş değiştiğinde ilgili bölüm yeniden hesaplanır.

Ayrıca önbelleğe alınmış tokenlar mantıksal olarak girişin parçası olmaya devam eder. Prompt Caching, modelin bağlam penceresini kendiliğinden büyütmez.

Sık Sorulan Sorular

Prompt Caching nedir?

Tekrar kullanılan giriş bölümlerinin hesaplama durumlarını saklayıp uygun sonraki isteklerde yeniden kullanan çıkarım optimizasyonudur.

Her isteği daha ucuz hâle getirir mi?

Hayır. Tasarruf; eşleşme oranına, tekrar sayısına, saklama süresine ve fiyatlandırmaya bağlıdır.

Yalnızca yeni kullanıcı mesajı mı işlenir?

Önbellekte bulunmayan bütün giriş bölümleri işlenir. Değişen belgeler ve araç çıktıları da bu kapsama girebilir.

Önceki cevap tekrar mı gönderilir?

Hayır. Prompt Caching giriş hesaplamalarını yeniden kullanır; model yeni cevap üretir.

Kalıcı hafıza sağlar mı?

Hayır. Geçici hesaplama durumlarının yeniden kullanılmasıdır. Model eğitimi veya kalıcı kullanıcı hafızasıyla aynı değildir.

Önbellekteki tokenlar bağlam sınırına dâhil mi?

Genellikle evet. Yeniden hesaplanmamaları, giriş bağlamından çıkarıldıkları anlamına gelmez.

Cevap kalitesini artırır mı?

Doğrudan kaliteyi artıran bir eğitim yöntemi değildir. Temel amacı, uyumlu hesaplamaları yeniden kullanarak işlem yükünü azaltmaktır.

Kaynaklar: Anthropic resmî teknik dokümantasyonu — Prompt Caching; Anthropic — Reducing Cost and Improving Performance with Claude Platform; vLLM resmî teknik dokümantasyonu — Automatic Prefix Caching; Prompt Cache: Modular Attention Reuse for Low-Latency Inference.

Editör Notu

Bu içerik, kamuya açık model hizmeti dokümantasyonları, akademik çalışmalar ve resmî teknik kaynaklardan yararlanılarak hazırlanmış bir araştırma ve değerlendirme yazısıdır. İçerikte yer alan değerlendirmeler editoryal yorum niteliğindedir. Prompt Caching desteği, eşleşme koşulları, saklama süreleri, fiyatlandırma ve performans kazanımları; modele, sağlayıcıya, yazılım sürümüne ve istek yapılandırmasına göre değişebilir.