Yapay Zeka

IA³ Nedir? Büyük Dil Modelleri Küçük Ölçekleme Vektörleriyle Nasıl Uyarlanıyor?

IA³ (Infused Adapter by Inhibiting and Amplifying Inner Activations), bu yaklaşımı küçük, öğrenilebilir ölçekleme vektörleriyle uygular. Modelin temel ağırlıkları eğitim sırasında sabit tutulurken belirli iç aktivasyonların etkisi değiştirilir.

Yöntem, Haokun Liu ve çalışma arkadaşlarının 2022’de yayımladığı “Few-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than In-Context Learning” başlıklı araştırmada tanıtılmıştır. Makalenin yazarları, University of North Carolina at Chapel Hill bilgisayar bilimi bölümündendir.

IA³ Nedir?

IA³, önceden eğitilmiş bir modelin belirli iç hesaplamalarını öğrenilebilir çarpanlarla yeniden ölçeklendiren ince ayar yöntemidir.

Buradaki “aktivasyon”, model bir girdiyi işlerken katmanlarında oluşan ara sayısal değerleri ifade eder. IA³, bu değerlerin bazı bileşenlerini güçlendirerek veya zayıflatarak modelin görev üzerindeki davranışını değiştirmeyi hedefler.

Standart uygulamada ana model ağırlıkları dondurulur. Eğitim sırasında eklenen ölçekleme vektörleri güncellenir; modelin tamamı için ayrı ağırlık güncellemeleri öğrenilmez.

Hangi Aktivasyonlar Ölçeklendirilir?

Özgün IA³ yaklaşımı, Transformer mimarisinde üç tür bileşene odaklanır:

  • Key (anahtar) temsilleri: Attention mekanizmasında hangi bilgilere odaklanılacağını etkileyen temsiller.

  • Value (değer) temsilleri: Attention sonucuna taşınan bilgileri içeren temsiller.

  • Feed-forward ara aktivasyonları: İleri beslemeli ağın ara hesaplamalarında oluşan değerler.

Encoder-decoder mimarilerinde ilgili attention yapıları da kapsama girebilir. IA³, modelin tamamına yalnızca üç sayı eklemek anlamına gelmez. Hedeflenen katmanlarda, ilgili boyutlarla uyumlu vektörler kullanılır.

Basitleştirilmiş bir örnekte [2, 4, 6] aktivasyonu, [1, 0.5, 1.5] ölçekleme vektörüyle bileşen bazında çarpıldığında [2, 2, 9] olur. Gerçek modellerde bu işlem çok daha büyük temsiller üzerinde gerçekleştirilir.

Bu çarpanların her biri, insanlar tarafından adlandırılmış belirli bir kavrama karşılık gelmek zorunda değildir.

IA³ ile Eğitim Nasıl Yapılır?

Uygulama genel olarak şu adımlardan oluşur:

  1. Başlangıç modeli seçilir: Göreve uygun, önceden eğitilmiş model yüklenir.

  2. Eğitim verisi hazırlanır: Girdiler ve beklenen çıktılar düzenlenir.

  3. Hedef katmanlar belirlenir: Ölçekleme vektörlerinin yerleştirileceği modüller seçilir.

  4. Temel ağırlıklar dondurulur: Standart kurulumda yalnızca IA³ parametreleri eğitilir.

  5. Eğitim yürütülür: Tahmin hatasına göre ölçekleme değerleri güncellenir.

  6. Sonuçlar değerlendirilir: Eğitimde kullanılmayan örneklerle görev başarısı ölçülür.

Hugging Face PEFT’in IA³ rehberi, bu süreci bir metinden metne model üzerinde duygu sınıflandırması örneğiyle gösterir. Dolayısıyla yöntem yalnızca sohbet yanıtlarını özelleştirmek için kullanılmaz.

LoRA ile IA³ Arasındaki Fark Nedir?

Her iki yöntem de temel modeli sabit tutarak az sayıda ek parametre eğitmeyi amaçlar. Ancak öğrenilen değişikliğin yapısı farklıdır.

Özellik IA³ LoRA
Öğrenilen yapı Ölçekleme vektörleri Düşük ranklı matrisler
Temel yaklaşım Seçilmiş aktivasyonları çarparak yeniden ölçeklendirme Ağırlık dönüşümüne öğrenilebilir ek güncelleme
Parametre sayısını etkileyen unsurlar Hedef katmanlar ve vektör boyutları Hedef katmanlar, matris boyutları ve rank
Göreve uyarlama biçimi Mevcut özelliklerin etkisini ayarlama Düşük ranklı ağırlık değişiklikleri öğrenme

LoRA’da öğrenilebilir matrislerin çarpımı, temel ağırlık matrisine eklenen güncellemeyi temsil eder. IA³ ise çarpımsal ölçekleme kullanır. Benzer kapsamlı kurulumlarda IA³ daha az eğitilebilir parametre kullanabilir; ancak kesin karşılaştırma yapılandırmaya bağlıdır.

Daha az parametre, her görevde daha iyi sonuç anlamına gelmez. İki yöntemin kalitesi, aynı model ve veri üzerinde karşılaştırılmalıdır.

Bellek Kullanımı Ne Kadar Azalır?

IA³’ün temel avantajlarından biri, eğitilen parametrelere ait gradyanların ve optimizer durumlarının küçülmesidir. Göreve özel güncellemelerin saklanması da tam model kopyalarına göre daha az alan gerektirebilir.

Ancak temel model hâlâ hesaplamanın içindedir. Ağırlıkların bellekte tutulması, ileri geçiş ve eğitim için gerekli ara hesaplamalar devam eder.

Bu nedenle eğitilebilir parametre sayısının çok azalması, toplam GPU belleğinin veya eğitim süresinin aynı oranda azalacağı anlamına gelmez. Sonuç; model boyutu, metin uzunluğu, batch boyutu, veri hassasiyeti ve kullanılan eğitim altyapısına bağlıdır.

Küçük Adaptör, Küçük Model Anlamına mı Gelir?

Hayır. IA³ adaptör dosyası, temel modelin yerine geçen bağımsız bir dil modeli değildir.

PEFT kayıtları genellikle adaptör parametrelerini ve yapılandırmasını içerir. Çalıştırma sırasında uyumlu temel modele de ihtiyaç duyulur. Bu nedenle model sürümünün ve adaptörün hangi modele ait olduğunun korunması önemlidir.

Örneğin aynı temel model için farklı görev adaptörleri saklamak, her görev adına modelin tamamını ayrı ayrı depolamaktan daha ekonomik olabilir.

Uygun uygulamalarda adaptörün etkisi temel ağırlıklara birleştirilebilir. Ancak birleştirme desteği, yöntem ve kullanılan yapılandırmaya göre kontrol edilmelidir. Birleştirilmiş model kaydedildiğinde dosya artık yalnızca küçük adaptör parametrelerinden oluşmaz.

Araştırma Sonuçları Nasıl Yorumlanmalı?

IA³’ü tanıtan çalışma, T-Few adlı daha kapsamlı bir eğitim yaklaşımı da sunmuştur. T-Few; IA³’ün yanında T0 başlangıç modelini ve belirli eğitim kayıplarını kullanır.

Bu nedenle çalışmadaki bütün performans kazanımlarını yalnızca ölçekleme vektörlerine bağlamak doğru değildir. Belirli deneylerde elde edilen başarılar, her modelde ve her görevde aynı sonucun alınacağını göstermez.

Kurumsal sınıflandırma, alan uyarlaması veya belirli çıktı biçimlerini öğrenme gibi uygulamalarda IA³ değerlendirilebilir. Seçim yapılırken görev başarısı, bellek tüketimi, eğitim süresi ve adaptör boyutu birlikte ölçülmelidir.

Sık Sorulan Sorular

IA³ için eğitim verisi gerekir mi?

Evet. Ölçekleme vektörleri, eğitim örnekleri üzerinden öğrenilir. Yöntem, yalnızca sisteme talimat eklemekten farklıdır.

IA³ modeli sıkıştırır mı?

Doğrudan model sıkıştırma yöntemi değildir. Eğitilen ve göreve özel saklanan parametre miktarını azaltır; temel modelin boyutunu kendiliğinden küçültmez.

IA³, LoRA’nın yerine geçer mi?

Bazı uygulamalarda alternatif olabilir. Hangisinin uygun olduğu, görev ve kaynak sınırlarıyla birlikte değerlendirilmelidir.

IA³ kullanmak modelin doğruluğunu garanti eder mi?

Hayır. Veri kalitesi, başlangıç modelinin yetenekleri ve eğitim ayarları sonucu etkiler. Yanlış veya yetersiz örneklerle yapılan uyarlama, istenmeyen davranışlar da oluşturabilir.

IA³’ün değeri, büyük bir modeli göreve uyarlamak için gereken değişikliği küçük bir parametre kümesinde temsil edebilmesidir. Yöntemin başarısı, bu sınırlı uyarlamanın hedef görevi ne ölçüde karşılayabildiğine bağlıdır.

Kaynaklar: Haokun Liu ve çalışma arkadaşları — Few-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than In-Context Learning, NeurIPS 2022; Hugging Face PEFT — IA³ API Reference, IA³ Task Guide, LoRA dokümantasyonu ve PEFT Checkpoint Format rehberi.

Editör Notu

Bu içerik, kamuya açık parametre verimli ince ayar araştırmaları ve resmî teknik dokümantasyonlardan yararlanılarak hazırlanmış bir araştırma ve değerlendirme yazısıdır. İçerikte yer alan değerlendirmeler editoryal yorum niteliğindedir. IA³’ün performansı ve kaynak tasarrufu; başlangıç modeline, eğitim verisine, hedef katmanlara ve kullanılan yazılım altyapısına göre değişebilir.