SFT Nedir? Büyük Dil Modelleri Örnek Yanıtlarla Nasıl Özelleştiriliyor?
Supervised Fine-Tuning (SFT), önceden eğitilmiş bir modelin seçilmiş girdi ve hedef çıktı örnekleriyle uyarlanmasını sağlar. Türkçede gözetimli ince ayar olarak adlandırılır.
Amaç, modele belirli bir görevin nasıl yapılacağını örnekler üzerinden göstermektir. Bu görev bir soruyu yanıtlamak, belgeyi özetlemek, destek talebini sınıflandırmak veya yapılandırılmış veri üretmek olabilir.
Ancak SFT, modele yalnızca doğru cevaplar öğreten kusursuz bir süreç değildir. Model, eğitim örneklerindeki yararlı davranışlarla birlikte hataları ve istenmeyen kalıpları da öğrenebilir. Bu nedenle veri kalitesi, eğitim yönteminin kendisi kadar önemlidir.
SFT Nedir?
SFT, önceden eğitilmiş modelin, hedef çıktıları bulunan örneklerle ek eğitimden geçirilmesidir.
Bir örnekte kullanıcı talimatı ve beklenen cevap yer alabilir. Başka bir örnekte metin ile kategori etiketi veya belge ile hedef özet bulunabilir.
Eğitim sırasında modelin hedef çıktıyı üretme olasılığını artıracak şekilde parametreler güncellenir. Tam ince ayarda bütün ağırlıklar, LoRA gibi yöntemlerde ise seçilmiş adaptasyon bileşenleri eğitilebilir.
SFT verilerinin tamamının insanlar tarafından sıfırdan hazırlanması zorunlu değildir. Uzman örnekleri, düzenlenmiş kayıtlar ve doğrulanmış sentetik veriler kullanılabilir. Önemli olan, örneklerin hedeflenen davranışı güvenilir biçimde göstermesidir.
Ön Eğitim ile SFT Arasındaki Fark
Ön eğitim, geniş veri koleksiyonlarından dil, bilgi ve farklı görevlerle ilişkili örüntülerin öğrenilmesini sağlar. Bu aşamayı yalnızca “dili öğrenmek” şeklinde açıklamak eksik kalır.
SFT ise daha belirli davranışları öne çıkarmaya odaklanır. Modelin mevcut yetenekleri, örneklerle hedef uygulamaya uyarlanır.
| Özellik | Ön eğitim | SFT |
|---|---|---|
| Temel amaç | Geniş ölçekli örüntüler ve yetenekler kazanmak | Belirli görev veya yanıt davranışına uyum sağlamak |
| Veri yapısı | Büyük ve çeşitli veri koleksiyonları | Girdi ve hedef çıktı içeren seçilmiş örnekler |
| Kullanım örneği | Genel metin ve kod örüntülerini öğrenmek | Talimata uygun özet veya sınıflandırma üretmek |
| Başlıca risk | Kaynak verilerdeki hatalar ve önyargılar | Dar, hatalı veya tutarsız örneklere aşırı uyum |
SFT genellikle önceden eğitilmiş bir model üzerinde uygulanır. Ancak her uygulamanın ayrı bir SFT aşamasına ihtiyacı yoktur. Hazır bir talimat modeli, uygun istemlerle yeterli sonuç verebilir.
SFT Nasıl Çalışır?
Hedef Davranış Belirlenir
Önce modelden ne beklendiği açıkça tanımlanır.
“Daha iyi cevap versin” ölçülmesi zor bir hedeftir. “Destek taleplerini beş kategoriye ayırsın” veya “Verilen belgeyi yeni bilgi eklemeden özetlesin” daha somut hedeflerdir.
Uygun Temel Model Seçilir
Modelin dili, lisansı, görev yetenekleri ve donanım gereksinimleri değerlendirilir.
İnce ayar, temel modelin bütün sınırlamalarını ortadan kaldırmaz. Hedef göreve uygun bir başlangıç modeli seçmek önemlidir.
Eğitim Örnekleri Hazırlanır
Girdiler ve beklenen çıktılar oluşturulur. Örneklerin gerçek kullanım biçimini temsil etmesi gerekir.
Kullanıcıların kısa, eksik veya hatalı yazılmış talepleri bulunuyorsa eğitim verisinin yalnızca kusursuz cümlelerden oluşması yeterli olmayabilir.
Model Eğitilir
Model, girdiyi kullanarak hedef çıktıyı üretmeye yönlendirilir.
Otoregresif dil modellerinde yaygın hedef, beklenen çıktı tokenlarının olasılığını artırmaktır. Sohbet eğitiminde hangi tokenların kayba dâhil edildiği önemlidir; kullanılan düzen, yalnızca asistan yanıtlarını veya farklı bölümleri değerlendirebilir.
Sonuçlar Bağımsız Verilerle Ölçülür
Eğitimde kullanılmayan örneklerle görev başarısı kontrol edilir. Modelin yalnızca benzer kalıpları tekrar edip etmediği ve yeni durumlara nasıl tepki verdiği incelenir.
Bir Destek Sistemi Üzerinden SFT Örneği
Bir şirket, gelen müşteri mesajlarını ilgili ekibe yönlendirmek istiyor olsun. Modelden uzun açıklama değil, belirli bir kategori ve kısa gerekçe üretmesi beklenebilir.
| Kullanıcı mesajı | Hedef çıktı |
|---|---|
| “Siparişim hâlâ gelmedi.” | Teslimat |
| “Kartımdan iki kez ödeme alınmış.” | Ödeme |
| “Ürün çalışmıyor, ne yapmalıyım?” | Teknik destek |
| “Aldığım ürünü geri göndermek istiyorum.” | İade |
Bu örnekler başlangıç için yararlı olsa da gerçek kullanım daha karmaşıktır. “Ürün gelmedi ama ödeme de iki kez çekilmiş” mesajı iki ihtiyacı birlikte içerir.
Eğitim verisi bu tür durumları kapsamıyorsa model, isteği yanlış biçimde tek kategoriye zorlayabilir. Dolayısıyla örnek sayısı kadar örneklerin kapsamı da önemlidir.
Kaliteli SFT Verisi Nasıl Olmalı?
Doğru ve Tutarlı
Aynı tür girdilere çelişkili hedefler verilmemelidir. Belirlenen kurallar bütün veri kümesinde tutarlı uygulanmalıdır.
Kullanım Senaryosunu Temsil Eden
Örnekler, gerçek kullanıcıların dilini ve görev çeşitliliğini yansıtmalıdır.
Gereksiz Tekrarlardan Arındırılmış
Aynı kalıbın çok sayıda küçük varyasyonu, gerçek çeşitlilik sağlamayabilir. Tekrarlar bazı davranışları gereğinden fazla güçlendirebilir.
Eksik Bilgi Durumlarını Kapsayan
Model yalnızca cevap vermeyi değil, yeterli bilgi olmadığında bunu belirtmeyi de öğrenmelidir.
Biçim ile İçeriği Birlikte Koruyan
İstenen JSON yapısına uyan fakat yanlış alanlar dolduran bir örnek kaliteli değildir. Biçim doğruluğu ve içerik doğruluğu ayrı kontrol edilmelidir.
Sentetik örnekler de bu ölçütlerden muaf değildir. Üretici modelin hazırladığı cevaplar doğrulanmadan hedef çıktı kabul edilmemelidir.
SFT ile LoRA Arasındaki İlişki
SFT, eğitim hedefini ve örneklerden öğrenme yaklaşımını anlatır.
LoRA, modelin hangi parametrelerinin nasıl uyarlanacağını belirleyen verimli bir yöntemdir.
Bu nedenle iki kavram alternatif değildir. SFT, LoRA veya QLoRA gibi yöntemlerle uygulanabilir.
| Kavram | Yanıtladığı temel soru |
|---|---|
| SFT | Model hangi örnek çıktılardan öğreniyor? |
| Tam ince ayar | Bütün model ağırlıkları mı güncelleniyor? |
| LoRA | Güncellemeler küçük adaptasyon matrisleriyle mi öğreniliyor? |
| QLoRA | Adaptör eğitimi kuantize temel model üzerinde mi yapılıyor? |
Daha düşük eğitim belleği ihtiyacı, veri hazırlama ve değerlendirme gereksinimlerini azaltmaz.
SFT ile RLHF ve DPO Arasındaki Fark
SFT’de modele hedef çıktı örnekleri gösterilir.
RLHF, insan değerlendirmelerinden türetilen ödül sinyalleriyle model davranışını geliştirebilir.
DPO, tercih edilen ve edilmeyen cevap çiftlerinden yararlanarak doğrudan tercih optimizasyonu uygular.
| Yaklaşım | Yaygın eğitim sinyali |
|---|---|
| SFT | Girdi için beklenen çıktı |
| Klasik RLHF | İnsan tercihlerinden öğrenilen ödül |
| DPO | Tercih edilen ve edilmeyen yanıt çiftleri |
DPO yalnızca “iki doğru cevaptan daha iyisini seçmeyi” öğretmez. Tercih edilmeyen yanıt yanlış, eksik veya talimata aykırı olabilir.
Ön eğitim, SFT ve tercih optimizasyonu birlikte kullanılabilir. Ancak Pretraining → SFT → DPO veya RLHF sırası bütün modeller için zorunlu bir eğitim şeması değildir.
SFT ile RAG Arasındaki Fark
SFT, model parametrelerini güncelleyerek davranış uyarlaması yapar.
RAG, yanıt sırasında gerekli bilgiyi dış kaynaklardan getirip modele sunar.
Sık değişen fiyatları veya şirket politikalarını yalnızca SFT ile öğretmeye çalışmak, güncelleme yükü oluşturabilir. Bu bilgiler dış sistemlerden getirilebilir.
Buna karşılık modelin belirli bir yanıt biçimine uyması veya özel bir sınıflandırma yapması için SFT değerlendirilebilir.
İki yaklaşım birlikte kullanılabilir: Model istenen biçimde cevap vermeyi öğrenirken cevabın bilgileri güncel kaynaklardan alınabilir.
SFT Nerelerde Yararlı Olabilir?
Sohbet uygulamalarında, belirli iletişim biçimleri ve talimat takibi geliştirilebilir.
Belge işlemede, özetleme, bilgi çıkarma ve sınıflandırma görevleri öğretilebilir.
Kod üretiminde, belirli çıktı yapıları veya görev örnekleri üzerinden uyarlama yapılabilir. Kodun doğruluğu için testler ayrıca gereklidir.
Kurumsal sistemlerde, destek kategorileri ve standart rapor biçimleri gibi tutarlı görevler ele alınabilir.
Araç kullanan ajanlarda, uygun veriyle yapılandırılmış araç çağrıları öğretilebilir. Ancak erişim yetkileri ve işlem güvenliği uygulama tarafından yönetilmelidir.
Başlıca Riskler ve Sınırlamalar
Aşırı Uyum
Model, eğitim örneklerini iyi taklit ederken yeni girdilerde başarısız olabilir.
Genel Yeteneklerde Gerileme
Çok dar bir veri kümesine uyarlama, bazı önceki yetenekleri olumsuz etkileyebilir. Bu nedenle yalnızca hedef görev değil, korunması gereken yetenekler de test edilmelidir.
Yanlış Bilginin Öğrenilmesi
Hatalı hedefler, modelin yanlış cevapları daha tutarlı üretmesine yol açabilir.
Üslubun İçeriğin Önüne Geçmesi
Akıcı ve düzenli örnekler, bilgi doğruluğu kontrol edilmeden kullanılırsa model iyi görünen fakat hatalı cevaplara uyarlanabilir.
Veri Sızıntısı
Eğitim ve test kümelerinde aynı veya çok benzer örnekler bulunması, performansı olduğundan yüksek gösterebilir.
Donanım ve Eğitim Maliyeti
Model büyüklüğü, bağlam uzunluğu ve eğitim yöntemi kaynak ihtiyacını etkiler. SFT’nin uygulanabilir olması, maliyetinin düşük olduğu anlamına gelmez.
SFT Başarısı Nasıl Ölçülmeli?
Önce, ince ayarsız modelin aynı görevi ne kadar iyi yaptığı ölçülmelidir. Ardından SFT’nin sağladığı değişim karşılaştırılabilir.
Sınıflandırmada doğru kategori oranı, bilgi çıkarmada alan doğruluğu, yapılandırılmış çıktıda şema uyumu gibi göreve özel ölçütler kullanılabilir.
Metin üretiminde ise kaynaklara bağlılık, talimat takibi ve anlamın korunması değerlendirilmelidir.
Eğitim kaybının düşmesi, gerçek kullanım başarısının arttığını tek başına göstermez.
Belirsiz girdiler, alışılmadık ifadeler ve eğitimde görülmeyen durumlar değerlendirme kümesinde yer almalıdır.
Sık Sorulan Sorular
SFT verilerini mutlaka insanlar mı hazırlamalı?
Hayır. Sentetik veya mevcut kayıtlardan türetilmiş örnekler kullanılabilir. Ancak doğruluk, izinler ve kalite kontrolü gerekir.
Kaç örnek gerekir?
Evrensel bir sayı yoktur. Görevin çeşitliliği, temel modelin yetenekleri ve örneklerin kalitesi belirleyicidir.
SFT modeli güncel tutar mı?
Yalnızca eğitimde kullanılan bilgiler üzerinden değişiklik sağlar. Sonradan oluşan bilgiler için yeni eğitim veya dış kaynak erişimi gerekebilir.
Her uygulamada SFT yapılmalı mı?
Hayır. İyi hazırlanmış talimatlar, uygun bir hazır model veya RAG yeterli olabilir. İnce ayar ihtiyacı ölçümle belirlenmelidir.
Kaynaklar: Long Ouyang ve diğerleri — Training Language Models to Follow Instructions with Human Feedback; Jason Wei ve diğerleri — Finetuned Language Models Are Zero-Shot Learners; Hugging Face — TRL SFTTrainer ve PEFT teknik dokümantasyonu; Stanford Alpaca — An Instruction-Following LLaMA Model.
Editör Notu
Bu içerik, gözetimli ince ayar ve talimat tabanlı model eğitimi üzerine teknik yaklaşımları ele alan bir araştırma ve değerlendirme yazısıdır. İçerikte yer alan değerlendirmeler editoryal yorum niteliğindedir. SFT’nin görev başarısı, doğruluk ve talimat takibi üzerindeki etkileri; temel modele, örneklerin kalitesine, veri çeşitliliğine ve eğitim yapılandırmasına göre değişebilir. Hedef çıktılardan öğrenmek, modelin bütün cevaplarının doğru olacağını veya eğitimde görülmeyen durumlara hatasız genelleneceğini garanti etmez.