Yapay Zeka

Hybrid Search Nedir? Yapay Zekâ Anahtar Kelimeleri ve Anlamı Nasıl Birlikte Kullanıyor?

Hybrid Search (Hibrit Arama), anahtar kelime tabanlı arama ile vektör tabanlı anlamsal aramayı birlikte kullanır. Böylece sorgudaki belirli ifadeler ve kavramsal benzerlikler, sonuçların seçilmesinde birlikte değerlendirilebilir.

Bu yaklaşım; kurumsal belge arama, ürün katalogları ve RAG (Retrieval-Augmented Generation) uygulamalarında farklı sorgu türlerini karşılamak için kullanılabilir.

Hybrid Search Nedir?

Hybrid Search, farklı bilgi erişim yöntemlerinden gelen sonuçları birleştiren arama yaklaşımıdır. Yapay zekâ uygulamalarında yaygın örneği, BM25 gibi sözcüksel arama yöntemleriyle embedding tabanlı vektör aramasının birlikte çalışmasıdır.

Anahtar kelime araması, sorgudaki terimlerle belgelerdeki terimler arasındaki eşleşmeleri değerlendirir. Vektör araması ise sorgu ve belgelerin sayısal temsilleri arasındaki benzerliği kullanır.

Hibrit arama, bu iki kanaldan gelen adayları ortak bir sonuç listesinde toplar. Weaviate gibi sistemler, her iki aramayı paralel yürütüp sonuçları birleştirebilir.

Neden İki Arama Yöntemine İhtiyaç Duyulur?

“E-4001 bağlantı hatası” sorgusunu düşünelim.

Anahtar kelime araması, hata kodunun geçtiği teknik belgeleri bulmaya yardımcı olabilir. Anlamsal arama ise bağlantı sorununu farklı ifadelerle açıklayan içerikleri öne çıkarabilir.

Yalnızca anlamsal benzerliğe bakıldığında, farklı bir hata kodunu anlatan belge de yüksek puan alabilir. Yalnızca sözcük eşleşmesine bakıldığında ise aynı sorunu farklı kelimelerle açıklayan içerikler kaçırılabilir.

Bununla birlikte ayrım mutlak değildir. Anahtar kelime sistemleri eş anlamlı sözlükleri ve sorgu genişletme teknikleri kullanabilir. Vektör modelleri de bazı özel isimleri ve kodları başarıyla temsil edebilir. Hibrit arama, iki yöntemin birbirini tamamlamasından yararlanmayı amaçlar.

Hybrid Search Nasıl Çalışır?

Tipik bir belge arama uygulamasında süreç şöyle ilerler:

  1. İçerikler hazırlanır: Belgeler gerektiğinde parçalara ayrılır; başlık, tarih ve belge kimliği gibi bilgiler korunur.

  2. İndeksler oluşturulur: Metinler sözcüksel arama için indekslenir, içeriklerin embedding’leri vektör aramasına hazırlanır.

  3. Sorgu işlenir: Kullanıcının metni anahtar kelime aramasında kullanılır; ayrıca uyumlu modelle sorgu embedding’i oluşturulur.

  4. Adaylar getirilir: Her arama kanalı kendi sıralanmış sonuç listesini üretir.

  5. Sonuçlar birleştirilir: Aynı kayıtlar kimlikleri üzerinden eşleştirilir ve ortak sıralama hazırlanır.

  6. Sonuçlar sunulur: Belgeler kullanıcıya gösterilir veya RAG sisteminde modele bağlam olarak aktarılır.

Bu yapı için mutlaka iki ayrı ürün kurulması gerekmez. Örneğin Azure AI Search, metin ve vektör sorgularını tek arama isteğinde birlikte çalıştırabilir.

Arama Sonuçları Nasıl Birleştirilir?

BM25 puanıyla vektör benzerlik puanı aynı şeyi ölçmez ve aynı ölçekte olmak zorunda değildir. Bu nedenle ham puanları doğrudan toplamak, kanallardan birinin gereğinden fazla etkili olmasına yol açabilir.

Sıralama Tabanlı Birleştirme: RRF

Reciprocal Rank Fusion (RRF), belgelerin ham puanlarından ziyade her listedeki sıralarını kullanır.

Bir belge farklı arama listelerinde üst sıralarda bulunuyorsa, birleşik sıralamada güçlü bir konuma gelebilir. Bu yaklaşım, farklı puan ölçeklerini doğrudan karşılaştırma ihtiyacını azaltır.

Puan Normalizasyonu ve Ağırlıklandırma

Başka bir yaklaşım, puanları karşılaştırılabilir ölçeğe dönüştürerek ağırlıklı biçimde birleştirmektir.

Örneğin ürün kodlarının önemli olduğu bir uygulamada sözcüksel aramaya, açıklayıcı doğal dil sorgularında ise anlamsal aramaya daha fazla ağırlık verilebilir. Weaviate’in göreli puan birleştirme yöntemi, normalizasyon kullanarak sonuçlar arasındaki puan farklarını da değerlendirmeye katar.

Her veri kümesi için geçerli tek bir doğru ağırlık yoktur.

Hibrit Arama Tam Eşleşmeyi Garanti Eder mi?

Hayır. Anahtar kelime araması da metnin nasıl indekslendiğine bağlıdır. Noktalama işaretleri, büyük-küçük harf dönüşümleri ve kelimelere ayırma işlemleri sonuçları etkileyebilir.

Ürün numarası veya hata kodunun birebir eşleşmesi gerekiyorsa, bu değerlerin uygun ayrı alanlarda tutulması ve tam eşleşme sorguları ya da filtrelerle aranması gerekebilir. Elasticsearch’te keyword alanları, bu tür yapılandırılmış değerlerin aranması için kullanılabilir.

Örneğin kullanıcı belirli bir ürünün kılavuzunu istiyorsa, yalnızca benzerlik puanına güvenmek yerine ürün kimliğini zorunlu filtre olarak uygulamak daha uygun olabilir.

Hybrid Search ile Reranking Arasındaki Fark Nedir?

Hybrid Search, farklı arama kanallarından aday toplar ve sonuçları birleştirir.

Reranking (yeniden sıralama) ise getirilen adayları sorguyla ilişkileri açısından tekrar değerlendirir. Bu aşamada daha ayrıntılı bir model kullanılabilir.

İki yöntem birlikte çalışabilir. Azure AI Search’te anlamsal yeniden sıralama, RRF ile birleştirilen sonuçların ardından uygulanabilir. Ancak yeniden sıralama, aday listesine hiç girmemiş bir belgeyi kendiliğinden bulamaz.

RAG Sistemlerine Ne Kazandırır?

RAG uygulamalarında yanıtın kalitesi, modele hangi belgelerin getirildiğinden etkilenir. Hibrit arama; teknik terimleri, özel adları ve farklı biçimde ifade edilmiş açıklamaları birlikte değerlendirmeye yardımcı olabilir.

Ancak daha iyi belge getirmek, doğru yanıt garantisi değildir. Belgeler güncelliğini yitirmiş olabilir, yanlış bilgi içerebilir veya model tarafından hatalı yorumlanabilir.

Bu nedenle arama kalitesi ile üretilen yanıtın doğruluğu ayrı ayrı değerlendirilmelidir.

Karşılaşılan Zorluklar Nelerdir?

  • İndekslerin güncelliği: Metin ve vektör kayıtlarının aynı belge sürümünü temsil etmesi gerekir.

  • Aday sayısı: Çok az aday ilgili belgeleri kaçırabilir; çok fazla aday işlem yükünü artırabilir.

  • Gecikme ve maliyet: Embedding üretimi, iki arama kanalı ve yeniden sıralama ek kaynak gerektirebilir.

  • Yetkilendirme: Kullanıcının erişemeyeceği belgeler, hiçbir arama kanalından modele aktarılmamalıdır.

  • Ölçüm: Başarı, gerçek kullanım senaryolarını temsil eden sorgularla değerlendirilmelidir.

Karşılaştırmalarda yalnızca nihai yanıtın akıcılığına bakmak yeterli değildir. İlgili belgelerin bulunma oranı, üst sıralardaki sonuçların uygunluğu, gecikme ve maliyet birlikte incelenmelidir.

Sık Sorulan Sorular

Hybrid Search her zaman daha başarılı mıdır?

Hayır. Yalnızca ürün kimliği arayan bir uygulamada tam eşleşme yeterli olabilir. Kazanç, veri ve sorgu türüne bağlıdır.

Hibrit arama için LLM gerekir mi?

Hayır. Arama ve sonuç birleştirme, yanıt üreten bir büyük dil modeli olmadan da çalışabilir.

İki yöntemin ağırlığı eşit mi olmalıdır?

Hayır. Ağırlıklar ve birleştirme yöntemi, değerlendirme sonuçlarına göre seçilmelidir.

Hibrit aramanın değeri, farklı bilgi erişim yöntemlerini aynı ihtiyaç için birlikte kullanabilmesidir. Başarılı bir uygulama; doğru indeksleme, uygun birleştirme ve düzenli kalite ölçümü gerektirir.

Kaynaklar: Microsoft Learn — Hybrid Search Overview ve Relevance Scoring in Hybrid Search Using Reciprocal Rank Fusion; Weaviate — Hybrid Search dokümantasyonu ve Hybrid Search Explained; Elasticsearch — Keyword Type Family dokümantasyonu.

Editör Notu

Bu içerik, kamuya açık bilgi erişim araştırmaları ve resmî teknik dokümantasyonlardan yararlanılarak hazırlanmış bir araştırma ve değerlendirme yazısıdır. İçerikte yer alan değerlendirmeler editoryal yorum niteliğindedir. Hibrit aramanın performansı; veri kümesine, sorgulara, embedding modeline, indeksleme yöntemine ve sıralama ayarlarına göre değişebilir.