DPO Nedir? Yapay Zekâ Modelleri Tercih Edilen Yanıtları Nasıl Öğreniyor?
DPO (Direct Preference Optimization), tercih edilen ve edilmeyen yanıt örneklerinden yararlanarak model davranışını geliştiren bir eğitim yöntemidir. İlk kez 2023 yılında yayımlanan araştırmayla tanıtılmıştır. Klasik ödül modeli ve pekiştirmeli öğrenme sürecini sadeleştirerek tercih verilerinden doğrudan öğrenmeyi amaçlar.
DPO Nedir?
Direct Preference Optimization, Türkçeye “Doğrudan Tercih Optimizasyonu” olarak çevrilebilir. Aynı isteğe verilen iki yanıt arasındaki tercih bilgisini kullanarak modelin parametrelerini günceller.
Örneğin bir kullanıcı kısa ve anlaşılır bir açıklama istediğinde, doğru ama gereksiz derecede uzun bir yanıt yerine açık ve özlü bir yanıt tercih edilebilir. DPO, bu tür karşılaştırmalardan öğrenebilir.
Standart DPO’da ayrı bir ödül modeli eğitilmesi veya PPO gibi bir pekiştirmeli öğrenme algoritmasıyla optimizasyon yapılması gerekmez. Tercihler, doğrudan modelin eğitiminde kullanılan kayıp fonksiyonuna dahil edilir.
DPO Nasıl Çalışır?
Tipik bir DPO eğitim kaydı üç temel parçadan oluşur:
-
İstek: Kullanıcının sorusu veya talimatı.
-
Tercih edilen yanıt: Karşılaştırmada daha uygun bulunan cevap.
-
Tercih edilmeyen yanıt: Aynı isteğe verilen, daha az uygun bulunan cevap.
Eğitim sürecinde modelin bu yanıtlara verdiği olasılıklar hesaplanır. Ardından tercih edilen yanıtın, diğer yanıta göre daha avantajlı hâle gelmesini sağlayacak güncellemeler yapılır.
Bu karşılaştırma, standart DPO’da referans modelin olasılıkları da dikkate alınarak gerçekleştirilir. Dolayısıyla yöntemi yalnızca “iyi cevabın olasılığını artır, kötü cevabın olasılığını azalt” şeklinde açıklamak eksik kalır. Temel hedef, referansa göre hesaplanan göreli tercih farkını iyileştirmektir.
Referans Model Ne İşe Yarar?
Referans model, eğitilen modelin davranışını karşılaştırmak için kullanılan başlangıç noktasıdır. Genellikle eğitim öncesindeki modelin sabit tutulan bir sürümüdür.
DPO’daki beta parametresi, referans modele göre sapmayı düzenleyen hedefin önemli ayarlarından biridir. Uygun değer, veri kümesine ve eğitim amacına göre değerlendirilmelidir.
Ayrı bir ödül modeli kullanılmaması, hesaplama veya bellek maliyetinin tamamen ortadan kalktığı anlamına gelmez. Eğitilen modelin yanı sıra referans olasılıklarının hesaplanması da kaynak gerektirir.
DPO ile Klasik RLHF Arasındaki Fark Nedir?
Yaygın kullanılan ödül modeli ve PPO tabanlı RLHF sürecinde önce tercih verilerinden bir ödül modeli eğitilir. Ardından dil modeli, bu ödülü artıracak biçimde pekiştirmeli öğrenmeyle güncellenir.
Standart DPO, tercih çiftlerinden doğrudan öğrenerek bu ayrı ödül modeli ve RL döngüsünü kaldırır. Hazırlanmış bir veri kümesiyle çalışabilir; eğitim sırasında sürekli yeni yanıtlar üretmesi gerekmez.
Bu fark, uygulamayı sadeleştirebilir. Ancak DPO’nun bütün RLHF yaklaşımlarından her koşulda daha başarılı olduğu söylenemez. Özgün çalışmadaki olumlu sonuçlar, değerlendirilen görev ve deney koşulları kapsamında okunmalıdır.
Tercihleri Mutlaka İnsanlar mı Belirler?
Tercih verileri insan değerlendirmelerinden elde edilebilir. Bunun yanında yapay zekâ değerlendiricileri veya göreve özgü puanlama yöntemleri de kullanılabilir.
Burada önemli olan, tercihin hangi ölçüte göre belirlendiğidir. Bir yanıt daha uzun veya daha kendinden emin olduğu için tercih ediliyorsa model, doğruluk yerine bu özellikleri öğrenebilir.
Bu nedenle “tercih edilen yanıt” ile “kesin doğru yanıt” aynı şey değildir.
Online DPO Nedir?
Online DPO, eğitim sırasında mevcut modelden yeni yanıtlar üretilen ve bu yanıtlar için yeni tercih değerlendirmeleri yapılan yaklaşımdır.
Standart çevrim dışı DPO, önceden hazırlanmış yanıt çiftleri üzerinde çalışırken online yaklaşım verileri eğitim boyunca yenileyebilir. Değerlendirme için bir ödül modeli veya başka bir değerlendirici kullanılabilir.
Online DPO hâlihazırda kullanılan bir yöntemdir. Hugging Face TRL dokümantasyonu bu yaklaşım için eğitim araçları sunmaktadır. Yeni yanıt üretimi ve değerlendirme aşamaları ise ek hesaplama maliyeti getirir.
Avantajları ve Sınırları Nelerdir?
DPO, tercih verileriyle model uyarlamak isteyen ekipler için daha sade bir eğitim süreci sunabilir. Sohbet yanıtlarının üslubunu, talimatlara uygunluğunu ve belirli görevlerdeki davranışını geliştirmek amacıyla değerlendirilebilir.
Buna karşılık şu noktalar önemlidir:
-
Veri kalitesi: Yanlış veya tutarsız tercihler istenmeyen davranışları güçlendirebilir.
-
Kapsam: Eğitim örneklerinde bulunmayan durumlarda başarı garanti değildir.
-
Aşırı uyum: Model, dar bir yanıt tarzına gereğinden fazla uyarlanabilir.
-
Değerlendirme: Tercih başarısının yanında doğruluk, güvenlik ve görev performansı da ölçülmelidir.
Eğitim kaybının düşmesi, modelin bütün kullanım senaryolarında daha iyi hâle geldiğini tek başına göstermez.
Sık Sorulan Sorular
DPO modeli sıfırdan mı eğitir?
Genellikle önceden eğitilmiş bir modelin davranışını tercih verileriyle uyarlamak için kullanılır.
DPO, SFT ile aynı mı?
Hayır. SFT, örnek yanıtları üretmeyi öğretir. DPO ise yanıtlar arasındaki tercih karşılaştırmalarından yararlanır. İki yöntem aynı eğitim sürecinin farklı aşamalarında kullanılabilir.
DPO yanlış bilgi üretimini tamamen engeller mi?
Hayır. Tercih eğitimi, doğruluk veya güvenlik garantisi sağlamaz.
DPO, RLHF’nin tamamen yerini alacak mı?
Böyle bir kesinlik yoktur. Yöntem seçimi; veri, görev, hesaplama bütçesi ve değerlendirme sonuçlarına bağlıdır.
DPO’nun temel katkısı, yanıtlar arasındaki tercih bilgisini doğrudan model eğitimine taşımasıdır. Sağladığı sadelik, kaliteli veri ve bağımsız değerlendirme ihtiyacını ortadan kaldırmaz.
Kaynaklar: Rafael Rafailov ve diğerleri — Direct Preference Optimization: Your Language Model Is Secretly a Reward Model; Hugging Face TRL — DPO Trainer ve Online DPO Trainer teknik dokümantasyonları.
Editör Notu
Bu içerik, kamuya açık yapay zekâ hizalama araştırmaları ve resmî teknik dokümantasyonlardan yararlanılarak hazırlanmış bir araştırma ve değerlendirme yazısıdır. İçerikte yer alan değerlendirmeler editoryal yorum niteliğindedir. DPO’nun performansı ve eğitim maliyeti; kullanılan modele, tercih verilerinin kalitesine ve eğitim ayarlarına göre değişebilir.