Yapay Zeka

PEFT Nedir? Büyük Yapay Zekâ Modelleri Daha Az Parametre Güncellenerek Nasıl Özelleştiriliyor?

Modelin bütün parametrelerini güncelleyen tam ince ayar (Full Fine-Tuning), özellikle büyük modellerde yüksek GPU belleği, hesaplama gücü ve depolama kapasitesi gerektirebilir. Bu durum, model özelleştirmeyi sınırlı kaynaklarla çalışan ekipler için zorlaştırır.

PEFT (Parameter-Efficient Fine-Tuning), bu maliyeti azaltmayı amaçlayan ince ayar yöntemlerinin genel adıdır. Temel yaklaşım, önceden eğitilmiş modelin ağırlıklarının büyük bölümünü korurken sınırlı sayıda parametreyi eğiterek modeli hedef göreve uyarlamaktır. 

PEFT Nedir?

Parameter-Efficient Fine-Tuning, Türkçeye parametre açısından verimli ince ayar olarak çevrilebilir. Modelin bütün ağırlıklarını güncellemek yerine küçük bir parametre kümesini eğiten veya modele az sayıda eğitilebilir parametre ekleyen yöntemleri kapsar.

Buradaki önemli ayrım, modelin büyüklüğü ile eğitilen parametre sayısı arasındadır. PEFT, modelin toplam parametre sayısını mutlaka azaltmaz; eğitim sırasında güncellenen parametre sayısını azaltır.

Örneğin milyarlarca parametreli bir model, PEFT sonrasında da benzer büyüklükte kalabilir. Ancak hedef göreve uyarlanması için yalnızca küçük adaptasyon bileşenleri eğitilebilir.

PEFT adı, yöntem ailesinin yanında Hugging Face tarafından geliştirilen ve bu yöntemlerin uygulanmasını kolaylaştıran yazılım kütüphanesini de ifade eder. 

PEFT ile Model Sıfırdan mı Eğitilir?

Hayır. PEFT, önceden eğitilmiş bir modelin özelleştirilmesinde kullanılır.

Ön eğitim (Pretraining) sırasında model, geniş veri kümelerinden dil yapısını ve genel örüntüleri öğrenir. İnce ayar (Fine-Tuning) aşamasında ise bu model belirli bir görev, alan veya yanıt biçimi için uyarlanır.

Örneğin genel amaçlı bir dil modelinden müşteri sorularına belirli bir kurumsal üslupla cevap vermesi, ürün açıklamalarını standart bir şablonda hazırlaması veya belgeleri önceden belirlenmiş kategorilere ayırması istenebilir.

PEFT, bu tür davranışların daha az eğitilebilir parametreyle kazandırılmasını hedefler. Tam ince ayar da sıfırdan eğitim değildir; önceden eğitilmiş modelin bütün ağırlıklarının güncellendiği bir özelleştirme sürecidir.

PEFT Nasıl Çalışır?

Uygulamanın ayrıntıları seçilen yönteme göre değişir. Ancak genel süreç, temel modelin seçilmesi, verilerin hazırlanması, eğitilecek parametrelerin belirlenmesi ve sonuçların değerlendirilmesi üzerinden ilerler.

Temel Model Seçilir

İlk adım, hedef göreve uygun bir model belirlemektir. Llama, Gemma veya Qwen gibi model ailelerinden uygun bir sürüm değerlendirilebilir.

Seçimde yalnızca parametre sayısına bakılmaz. Modelin dil desteği, lisansı, bağlam uzunluğu, görev başarısı ve mevcut donanıma uygunluğu da önemlidir.

En büyük model her zaman en iyi tercih değildir. Daha küçük bir model, iyi hazırlanmış verilerle belirli bir uygulamanın ihtiyaçlarını karşılayabilir.

Eğitim Verileri Hazırlanır

Modelin öğrenmesi beklenen davranış örneklerle gösterilir. Müşteri hizmetleri için soru-cevap çiftleri, sınıflandırma için metin-kategori eşleşmeleri, yapılandırılmış çıktı üretimi için örnek girişler ve beklenen yanıtlar hazırlanabilir.

Verilerin doğru ve tutarlı olması gerekir. Aynı soruya çelişkili cevaplar veren örnekler, modelin davranışını olumsuz etkileyebilir.

Eğitilecek Parametreler Belirlenir

Temel modelin ağırlıklarının büyük bölümü dondurulur. Dondurmak, bu ağırlıkların eğitim sırasında güncellenmemesi anlamına gelir.

Yönteme göre ek matrisler, küçük modüller, öğrenilebilir vektörler veya belirli mevcut parametreler eğitilir. Bu nedenle bütün PEFT yöntemlerini “modele küçük bir katman eklemek” şeklinde açıklamak yeterli değildir.

İnce Ayar Yapılır

Eğitim örnekleri modele verilir ve seçilmiş parametreler güncellenir. Amaç, modelin hedef görevde istenen davranışı göstermesidir.

Az sayıda parametrenin eğitilmesi, verilerin veya eğitim ayarlarının önemini azaltmaz. Öğrenme oranı, eğitim süresi ve örneklerin çeşitliliği sonucu etkiler.

Sonuçlar Değerlendirilir ve Kaydedilir

Model, eğitim sırasında görmediği örneklerle test edilir. Yanıt doğruluğu, biçim tutarlılığı ve gerçek kullanım başarısı incelenir.

Birçok PEFT uygulamasında temel modelin tamamı yerine öğrenilen adaptör parametreleri kaydedilebilir. Ancak adaptör dosyası genellikle tek başına çalışan bağımsız bir model değildir; uyumlu temel modele ihtiyaç duyar.

Başlıca PEFT Yöntemleri

LoRA: Düşük Dereceli Adaptasyon

LoRA (Low-Rank Adaptation), temel model ağırlıklarını dondururken seçilen ağırlık matrislerine yönelik güncellemeleri daha küçük, eğitilebilir matrislerle temsil eder.

Büyük bir matrisin bütün değerlerini ayrı ayrı güncellemek yerine değişim, düşük dereceli bir yapı üzerinden öğrenilir. Böylece eğitilebilir parametre sayısı azalır.

LoRA araştırmasında bazı model ve görevlerde tam ince ayarla karşılaştırılabilir sonuçlar gösterilmiştir. Ancak bu başarı, her uygulamada aynı sonucun alınacağını garanti etmez. Uygun koşullarda öğrenilen LoRA güncellemeleri temel ağırlıklarla birleştirilebilir. 

QLoRA: Kuantizasyon ile LoRA’nın Birleşimi

QLoRA, LoRA tabanlı ince ayarı düşük bitli kuantizasyonla birleştirir. Kuantizasyon, model ağırlıklarının daha düşük sayısal hassasiyetle temsil edilerek bellekte daha az yer kaplamasını sağlar.

Özgün QLoRA yaklaşımında temel model, dondurulmuş 4 bitlik ağırlıklarla tutulur ve LoRA adaptörleri eğitilir. Bu sayede büyük modellerin ince ayarı için gereken bellek azaltılabilir.

Araştırmada, belirli deney koşullarında 65 milyar parametreli bir modelin tek bir 48 GB GPU üzerinde ince ayarlanabildiği gösterilmiştir. Bu sonuç, bütün modellerin veya eğitim ayarlarının aynı donanıma sığacağı anlamına gelmez. 

Adapters: Küçük Eğitilebilir Modüller

Klasik adapter yaklaşımında modelin belirli noktalarına küçük sinir ağı modülleri yerleştirilir. Temel ağırlıklar korunurken bu modüller hedef göreve göre eğitilir.

Aynı temel model için farklı görev adaptörleri saklanabilir. Ancak ek modüllerin çalışma maliyeti, kullanılan mimariye ve uygulamaya bağlıdır.

Prompt Tuning: Öğrenilebilir Sanal Tokenlar

Prompt Tuning, kullanıcının elle yazdığı komut metnini düzenlemekten farklıdır. Model girişine eklenen, sürekli vektörlerden oluşan öğrenilebilir temsiller eğitilir.

Bu temsillerin sıradan kelimeler olarak okunması gerekmez. Eğitim sırasında hedef göreve yardımcı olacak biçimde ayarlanırlar. 

Prefix Tuning: Öğrenilebilir Önek Temsilleri

Prefix Tuning, yalnızca giriş metninin başına birkaç kelime eklemek değildir. Transformer katmanlarının dikkat hesaplamalarına katılan öğrenilebilir önek temsillerini kullanır.

Prompt Tuning ile ortak noktası, temel model yerine küçük bir temsil kümesinin eğitilmesidir. Ancak öğrenilen temsillerin modele uygulandığı noktalar farklıdır. 

IA³: Aktivasyonları Ölçeklendirme

IA³, öğrenilebilir vektörlerle dikkat mekanizmasındaki anahtar ve değer aktivasyonlarını, ayrıca ileri beslemeli ağın belirli aktivasyonlarını ölçeklendirir.

Amaç, az sayıda ek parametreyle modelin bilgi işleme davranışını hedef göreve uyarlamaktır. 

PEFT ile Full Fine-Tuning Arasındaki Fark

Özellik Tam ince ayar PEFT
Güncellenen parametreler Modelin bütün ağırlıkları Küçük bir parametre kümesi veya ek bileşenler
Eğitim belleği Genellikle daha yüksek Genellikle daha düşük
Göreve özel depolama Tam model ağırlıkları saklanabilir Küçük adaptör dosyaları saklanabilir
Özelleştirme kapsamı Bütün ağırlıklara doğrudan müdahale Seçilen yöntemin sağladığı kapsam
Başarı Model, veri ve göreve bağlı Model, veri, görev ve yöntem ayarlarına bağlı

PEFT’nin daha ekonomik olması, her koşulda daha hızlı veya daha başarılı olması anlamına gelmez. Hangi yaklaşımın uygun olduğu, gerçek uygulama üzerinde yapılan değerlendirmelerle belirlenmelidir.

Daha Az Parametre Eğitmek Neden Bellek Tasarrufu Sağlar?

Eğitim sırasında GPU belleğinde yalnızca model ağırlıkları bulunmaz. Ara hesaplamalar, gradyanlar ve optimizasyon algoritmasının tuttuğu ek bilgiler de yer kaplar.

Daha az parametrenin güncellenmesi, özellikle gradyanlar ve optimizasyon durumları için gereken belleği azaltabilir. QLoRA gibi yaklaşımlarda kuantizasyon, temel ağırlıkların kapladığı alanı da küçültür.

Ancak dondurulmuş model hesaplamaya katılmaya devam eder. Eğitilebilir parametrelerin çok küçük bir orana düşmesi, toplam hesaplama maliyetinin aynı oranda düşeceği anlamına gelmez.

Model büyüklüğü, bağlam uzunluğu ve batch boyutu hâlâ önemli bellek gereksinimleri oluşturabilir.

PEFT Nerelerde Kullanılabilir?

Kurumsal Asistanlar ve Chatbotlar

Yanıtların marka diline uyarlanması, destek taleplerinin sınıflandırılması ve belirli çıktı şablonlarının öğretilmesi için kullanılabilir.

Örneğin bir müşteri asistanına kısa, tutarlı ve belirli bir biçimde cevap verme davranışı kazandırılabilir.

Belge İşleme

Belgelerin özetlenmesi, kategorilere ayrılması veya metinlerden belirli alanların çıkarılması gibi görevlerde değerlendirilebilir.

Burada yalnızca akıcı metin üretimi değil, kaynak belgeye bağlılık ve çıktı tutarlılığı da ölçülmelidir.

Sağlık, Hukuk ve Finans

Alan terminolojisine ve görev biçimine uyarlama yapılabilir. Ancak ince ayar uygulanması, modelin verdiği bilgilerin doğruluğunu kendiliğinden garanti etmez.

Yerel Model Çalışmaları

Uygun büyüklükteki modellerin sınırlı donanımla özelleştirilmesini kolaylaştırabilir. Bununla birlikte her modelin ev bilgisayarında eğitilebileceği söylenemez.

PEFT ile RAG Arasındaki Fark Nedir?

PEFT, eğitim yoluyla modelin davranışını uyarlamaya yöneliktir. RAG (Retrieval-Augmented Generation) ise yanıt oluşturulurken dış kaynaklardan ilgili bilgileri getirip modele sunar.

Bir mağazanın müşteri asistanını düşünelim. Kurumsal üslup ve yanıt biçimi için ince ayar kullanılabilir. Güncel fiyat, stok ve kampanya bilgileri ise dış sistemlerden getirilebilir.

Bu iki yaklaşım birlikte kullanılabilir. Sık değişen bilgileri sürekli model ağırlıklarına öğretmek yerine ihtiyaç anında güncel kaynağa erişmek daha uygun olabilir.

PEFT Kullanırken Karşılaşılan Zorluklar

Her Görevde Aynı Başarı Elde Edilmez

Bazı görevlerde küçük adaptasyon bileşenleri yeterli olabilirken bazı uygulamalarda daha kapsamlı ağırlık güncellemeleri gerekebilir.

Veri Kalitesi Belirleyicidir

Yanlış, tekrar eden veya dengesiz örnekler istenmeyen davranışlar öğretebilir. Parametre verimliliği, veri hazırlığının yerini tutmaz.

Adaptör Uyumluluğu Korunmalıdır

Adaptörün hangi temel model ve sürüm için oluşturulduğu kayıt altına alınmalıdır. Farklı modeller arasında uyumluluk varsayılmamalıdır.

Aşırı Öğrenme Oluşabilir

Küçük bir eğitim kümesine fazla uyum sağlayan model, yeni örneklerde başarısız olabilir. Eğitim ve değerlendirme verileri ayrılmalıdır.

Dağıtım Performansı Ölçülmelidir

Küçük adaptör dosyaları dağıtımı kolaylaştırabilir; ancak temel modelin bellek ve hesaplama ihtiyacı devam eder. Eğitimde sağlanan tasarruf, çıkarımda aynı oranda hızlanma anlamına gelmez.

LoRA ile PEFT Aynı Şey mi?

Hayır. PEFT bir yöntem ailesidir; LoRA bu ailedeki yöntemlerden biridir.

LoRA’nın yanında adapter yöntemleri, Prompt Tuning, Prefix Tuning ve IA³ gibi farklı yaklaşımlar bulunur.

Dolayısıyla her LoRA uygulaması bir PEFT yaklaşımıdır, ancak her PEFT yöntemi LoRA değildir. Yöntem seçimi; göreve, model mimarisine, donanıma ve hedeflenen performansa göre yapılmalıdır.

Sık Sorulan Sorular

PEFT nedir?

Önceden eğitilmiş modelleri, sınırlı sayıda parametreyi güncelleyerek veya az sayıda eğitilebilir parametre ekleyerek özelleştiren yöntemlerin genel adıdır.

PEFT modelin boyutunu küçültür mü?

Tek başına mutlaka küçültmez. Temel hedef, güncellenen parametre sayısını azaltmaktır. Bellekte kaplanan alanı azaltmak için kuantizasyon gibi ek teknikler kullanılabilir.

PEFT her zaman tam ince ayardan daha iyi midir?

Hayır. Sonuçlar modele, göreve, verilere ve eğitim ayarlarına bağlıdır. Bazı uygulamalarda tam ince ayar daha başarılı olabilir.

PEFT için ne kadar GPU belleği gerekir?

Tek bir evrensel değer yoktur. Temel modelin büyüklüğü, sayısal hassasiyet, bağlam uzunluğu, batch boyutu ve seçilen yöntem bellek ihtiyacını etkiler.

Adaptör dosyası tek başına kullanılabilir mi?

Genellikle hayır. Oluşturulduğu temel modelin uyumlu sürümüne de ihtiyaç duyar.

PEFT yalnızca dil modellerinde mi kullanılır?

Hayır. Parametre açısından verimli uyarlama yaklaşımları, dil modellerinin yanında görüntü ve çok modlu model uygulamalarında da değerlendirilebilir. 

Kaynaklar: Hugging Face — PEFT Documentation, Prompt Tuning, Prefix Tuning ve IA³ teknik dokümantasyonu; Edward J. Hu ve diğerleri — LoRA: Low-Rank Adaptation of Large Language Models; Tim Dettmers ve diğerleri — QLoRA: Efficient Finetuning of Quantized LLMs.

Editör Notu

Bu içerik, kamuya açık akademik çalışmalar ve resmî teknik dokümantasyonlardan yararlanılarak hazırlanmış bir araştırma ve değerlendirme yazısıdır. İçerikte yer alan değerlendirmeler editoryal yorum niteliğindedir. PEFT yöntemlerinin bellek kullanımı, eğitim süresi ve model başarısı; temel modele, veri kümesine, donanıma, yazılım sürümüne ve eğitim yapılandırmasına göre değişebilir.