Hypothetical Document Embeddings (HyDE) (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

Hypothetical Document Expansion (HyDE) — vektörel retrieval ve retrieval‑augmented generation (RAG) yöntemini iyileştirmeye yönelik bir yöntemdir; bu yöntemde büyük dil modeli (LLM), özgün sorguya dayanarak bir "hipotetik belge" üretir; ardından bu metin bir encoder tarafından vektörleştirilir ve arama, elde edilen vektöre yakınlık temelinde gerçek belgeler arasında gerçekleştirilir. Bu yaklaşım, LLM tarafından kodlanan "ilgililik örüntülerini" kullanmayı ve bunları yoğun embedding'ler aracılığıyla bir derlem üzerinde "temellendirmeyi" mümkün kılar[1].

Tanım ve Sezgi

HyDE, arama görevini iki aşamaya ayırır:

(1) LLM, sorguya yönelik bir "ilgili yanıt örneği" (hypothetical document) oluşturarak ilgililik özelliklerini modeller;

(2) kontrastif bir encoder (örn. Contriever), bu metni bir vektöre dönüştürür; bu vektör aracılığıyla indeksten gerçek belgeler elde edilir. Üretilen metin olgusal hatalar içerebilir; ancak önemli olan, encoder tarafından yakalanan tematik ve terminolojik örüntülerdir[2].

Tarihçe ve Kaynaklar

Aramayı sentetik metinlerle genişletme fikri, sorgu genişletme ve sözde-ilgili geri bildirim (PRF) üzerine yapılan çalışmalara dayanır: Rocchio algoritması ve ilgililik dil modelleri[3][4]. Yoğun retrieval için kontrastif eğitimli encoder'lar (Contriever)[5] ve Dense Passage Retrieval (DPR)[6] kullanılmıştır. BEIR benchmark'ı, zero‑shot değerlendirmeyi standart hale getirmiştir[7]. Bu bağlamda HyDE, encoder'ı yeniden eğitmeye gerek kalmaksızın LLM aracılığıyla sıfır atış moduna ilgililik bilgisini "taşımanın" bir yolu olarak önerilmiştir[8].

Yöntem ve Biçimselleştirme

Belge derleminin 𝒟={d1,,dN} olduğunu ve bir metin encoder'ının E:textn, belgeler için vektörel gösterimler 𝐯d=E(d) tanımladığını varsayalım. Yakınlık ölçümü için kosinüs benzerliği ya da skaler çarpım kullanılır; önemli bir not: **skaler çarpım, yalnızca her iki vektörün L2‑normu bire eşit olduğunda kosinüs benzerliğiyle örtüşür** (𝐮=𝐯=1)[9].

HyDE, sorgu gösterimini LLM tarafından üretilen bir "hipotetik belge" aracılığıyla yeniden tanımlar. Biçimsel olarak:

(1) Генерация гипотетического текста:d~=G(q;inst),(2) Эмбеддинг гипотетического текста:𝐯h=E(d~),(3) Поиск ближайших соседей:k(q)=TopKd𝒟S(𝐯h,𝐯d),

burada Ginst talimatına sahip LLM (örneğin: "Şu soruyu yanıtlayan bir paragraf yaz…"), S — benzerlik ölçüsü (normalizasyonlu kosinüs veya IP), k(q) ise maksimum benzerliğe sahip k belgeden oluşan kümedir[10][11].

Mühendislik uygulamalarında çoğunlukla **birden fazla** hipotetik metin üretilir ve bunların gösterimleri toplanır; bu da kararlılığı artırır:

d~(j)=G(q;inst,ξj),𝐯h=1mj=1mE(d~(j)),

burada ξj — stokastik kod çözme parametreleridir (örn. temperature/top‑p). Bu tür ensemble yaklaşımı, orta düzeyde gecikme artışıyla Recall'ı iyileştirir[12].

HyDE Temel Pipeline'ı

# 1) prompt(query) -> hypothetical_doc
# 2) embed(hypothetical_doc) -> v_h
# 3) retrieve(index, v_h, k) -> candidates
# 4) (optional) rerank(query, candidates) -> topN
# 5) (для RAG) stuff / map-reduce / refine на topN

Diğer Yöntemlerle İlişki (QE, doc2query, PRF)

  • QE (sorgu genişletme) sorguya terimler ekler; HyDE bunun yerine yoğun encoder'larla daha uyumlu olan tüm bir "yarı-belge" üretir[13].
  • doc2query / docTTTTTquery indeksleme öncesinde sentetik sorgularla belgeleri genişletir[14][15]; HyDE sorguyu anında genişletir ve yeniden indeksleme gerektirmez.
  • PRF (Rocchio, Relevance LM), sorgu vektörünü en iyi sonuçlara göre günceller; HyDE "ilgililik örüntüsünü" doğrudan LLM'den çıkarır ve ardından derlem üzerinde retrieval aracılığıyla "temellendirir"[16].

RAG ve Yeniden Sıralamaya Entegrasyon

RAG'da HyDE, retrieval'ın ilk aşaması olarak uygulanır: hipotetik belge → embedding → k aday. Ardından yeniden sıralama uygulanır: BERT sınıfı cross-encoder'lar[17] veya geç etkileşimli ColBERT[18]. Liste birleştirme için (örn. hibrit BM25+vector) tipik olarak RRF (reciprocal rank fusion) kullanılır: RRF(d)=r1k+rankr(d),k60. RRF yöntemi, birleştirilmiş sıralamaların genel kalitesini tutarlı biçimde artırır[19].

Benchmark Değerlendirmesi (BEIR ve Diğerleri)

Özgün çalışma, HyDE'yi TREC DL'19/20 (web araması) ve BEIR koleksiyonlarının bir alt kümesinde (Scifact, ArguAna, TREC‑COVID, FiQA, DBPedia, TREC‑NEWS, Climate‑FEVER) sıfır atış modunda değerlendirmektedir. Sonuçların bir kısmı — 2023‑07 itibarıyla:

TREC DL19/20 (web araması) — mAP / nDCG@10 / Recall@1k
Yöntem DL19 DL20 Kaynak
BM25 30.1 / 50.6 / 75.0 28.6 / 48.0 / 78.6 [20]
Contriever (unsup.) 24.0 / 44.5 / 74.6 24.0 / 42.1 / 75.4 [21]
HyDE (Contriever+LLM) 41.8 / 61.3 / 88.0 38.2 / 57.9 / 84.4 [22]
DPR (ft) 36.5 / 62.2 / 76.9 41.8 / 65.3 / 81.4 [23]
ANCE (ft) 37.1 / 64.5 / 75.5 40.8 / 64.6 / 77.6 [24]
BEIR (veri kümesi seçkisi) — nDCG@10 / Recall@100
Yöntem Scifact ArguAna TREC‑COVID FiQA DBPedia TREC‑NEWS Climate‑FEVER Kaynak
BM25 67.9 / 92.5 39.7 / 93.2 59.5 / 49.8 23.6 / 54.0 31.8 / 46.8 39.5 / 44.7 16.5 / 42.5 [25]
Contriever 64.9 / 92.6 37.9 / 90.1 27.3 / 17.2 24.5 / 56.2 29.2 / 45.3 34.8 / 42.3 15.5 / 44.1 [26]
HyDE 69.1 / 96.4 46.6 / 97.9 59.3 / 41.4 27.3 / 62.1 36.8 / 47.2 44.0 / 50.9 22.3 / 53.0 [27]

HyDE ayrıca Mr.TyDi çok dilli veri kümelerinde (sw/ko/ja/bn) mContriever'a kıyasla MRR@100 değerini de iyileştirmektedir[28].

Pratik Öneriler

HyDE'nin ne zaman kullanılacağı
  • Sıfır atış/aktarım modları (ilgililik etiketi yok; alan "benzemezliği" eğitim derlemlerine kıyasla)[29].
  • Kabul edilebilir bir hassasiyet düzeyinde Recall@k artışı gerektiğinde — HyDE çoğunlukla vektör uzayındaki ilgili bölgeleri "açar"[30].
Tipik Ayarlar
  • LLM ve prompt: "Şu soruyu yanıtlayan bir paragraf yaz…" talimatı; orta düzey stokastisite (örn. temperature≈0.7)[31].
  • Hipotetik metin sayısı: 1–5; embedding'lerin ortalaması alınması kararlılığı artırır[32].
  • Embedding modeli: Fine-tuning olmaksızın (m)Contriever; fine-tuning uygulanmış encoder'lar da kullanılabilir (HyDE etkisi korunur)[33].
  • Embedding normalizasyonu: L2‑norm; iç çarpım kosinüs ile eşdeğerdir[34].
  • Hibrit retrieval: ardından yeniden sıralama ile BM25+vector[35].
  • Yeniden sıralayıcı: Cross-Encoder (BERT re‑ranker)[36] veya ColBERT[37].
  • Farklı stratejilerin sonuçlarını birleştirme: RRF (k≈60)[38].
Kalite/Maliyet İzleme
  • Retrieval: nDCG@k, Recall@k, MRR; uçtan uca RAG: EM/F1 veya groundedness metrikleri (RAGAS/TruLens)[39][40].
  • Maliyet/gecikme: LLM üretimi ve (varsa) yeniden sıralama baskın unsurdur; "hipotetik" metin sayısı ve yanıt uzunluğuyla optimize edilir[41].

Sınırlamalar ve Açık Sorular

  • Hipotetik metnin halüsinasyonları: LLM olgusal hatalar üretebilir; encoder ve derlem aracılığıyla "temellendirme" riski azaltır ancak tamamen ortadan kaldırmaz[42].
  • Alan ve dil kısıtlamaları: HyDE'nin sağladığı kazanım, son derece uzmanlaşmış alanlarda ve düşük kaynaklı dillerde azalmaktadır[43].
  • Gecikme ve maliyet: LLM üretimi ek gecikme ve token maliyeti getirir; bu durum çevrimiçi senaryolar ve uzun "hipotetik" metinler için kritik öneme sahiptir[44].
  • Etik ve önyargılar: Güvenli LLM'lerin ve filtrelemenin kullanılması tercih edilir[45].

Yöntemlerin Karşılaştırma Tablosu

HyDE ve İlgili Yaklaşımların Karşılaştırması
Yöntem Sınıf Metnin üretildiği yer Encoder/İndeks Yeniden sıralayıcı (2. aşama) Tipik metrikler (örnek) Maliyet/Gecikme Kaynaklar
HyDE Query→hypo‑doc Sorgu tarafında (LLM → paragraf) (m)Contriever; ANN BERT re‑rank / ColBERT / RRF DL19 nDCG@10≈61.3; DL20≈57.9; ArguAna nDCG@10≈46.6 + LLM üretimi; + yeniden sıralama (isteğe bağlı) [46]
BM25 Sözcüksel Ters çevrilmiş indeks İsteğe bağlı bkz. tablo (yukarıda) Düşük (lexical) [47]
DPR / ANCE Yoğun (ft) Bi‑encoder; ANN İsteğe bağlı DL19 nDCG@10≈62–65 Orta (LLM yok) [48][49]
doc2query / docTTTTTquery Belge genişletme Koleksiyon tarafında (indeksleme öncesi) BM25/sparse+expanded İsteğe bağlı MS MARCO'da BM25 iyileştirmeleri Yüksek çevrimdışı üretim; hızlı çevrimiçi [50][51]
PRF (Rocchio, RLM) Geri bildirime dayalı QE Sorgu (en iyi sonuçlara göre) Herhangi biri İsteğe bağlı Recall artışı/sapma riskleri + ek retrieval geçişi [52]

Ayrıca bakınız

  • BM25
  • Vektörel gösterimlerle arama
  • RAG
  • Sözde-ilgili geri bildirim
  • BEIR

Dış bağlantılar

  • HyDE deposu: github.com/texttron/hyde.
  • Belgelendirme: Haystack — HyDE: docs.haystack.deepset.ai.
  • Belgelendirme: LangChain — HyDE Retriever: docs.langchain.com.

Kaynakça

  • Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
  • Robertson, S.; Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in IR, 3(4), 333–389. DOI:10.1561/1500000019.

Notlar

  1. Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023. pp. 1762–1777. DOI:10.18653/v1/2023.acl-long.99. arXiv:2212.10496
  2. Gao, L. et al. (2023). ACL 2023, §3.2. DOI:10.18653/v1/2023.acl-long.99.
  3. Rocchio, J. (1971). ‘‘Relevance Feedback in Information Retrieval’’. In: Salton, G. (ed.) The SMART Retrieval System. Prentice‑Hall, pp. 313–323. ISBN 978‑0138145255.
  4. Lavrenko, V.; Croft, W. B. (2001). ‘‘Relevance‑Based Language Models’’. SIGIR. DOI:10.1145/383952.383972.
  5. Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning’’. arXiv:2112.09118.
  6. Karpukhin, V. et al. (2020). ‘‘Dense Passage Retrieval for Open‑Domain QA’’. EMNLP. DOI:10.18653/v1/2020.emnlp-main.550.
  7. Thakur, N. et al. (2021). ‘‘BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of Information Retrieval Models’’. NeurIPS Datasets Track. arXiv:2104.08663.
  8. Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
  9. Milvus Docs. ‘‘Similarity Metrics’’ — при L2‑нормализации векторов внутр. произведение эквивалентно косинусу. URL: https://milvus.io/docs/v2.2.x/metric.md
  10. Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023, §3–4. arXiv:2212.10496. DOI:10.18653/v1/2023.acl-long.99.
  11. Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever)’’. arXiv:2112.09118.
  12. Gao, L. et al. (2023). Прил. (ablation): влияние числа гипотетических текстов и параметров генерации. arXiv:2212.10496.
  13. Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
  14. Nogueira, R. et al. (2019). ‘‘Document Expansion by Query Prediction’’ (doc2query). arXiv:1904.08375.
  15. Nogueira, R.; Lin, J. (2019). ‘‘From doc2query to docTTTTTquery’’ (tech report). PDF
  16. Rocchio, J. (1971); Lavrenko & Croft (2001), см. выше.
  17. Nogueira, R.; Cho, K. (2019). ‘‘Passage Re‑ranking with BERT’’. arXiv:1901.04085.
  18. Khattab, O.; Zaharia, M. (2020). ‘‘ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT’’. SIGIR. DOI:10.1145/3397271.3401075; arXiv:2004.12832.
  19. Cormack, G. V.; Clarke, C. L. A.; Büttcher, S. (2009). ‘‘Reciprocal Rank Fusion Outperforms Condorcet and Nearly Optimally Combines Rankings’’. SIGIR. DOI:10.1145/1571941.1572114.
  20. Gao, L. et al. (2023). Табл. 1. DOI:10.18653/v1/2023.acl-long.99.
  21. Izacard, G. et al. (2022); сводные метрики — в Gao et al., 2023, табл. 1. arXiv:2112.09118.
  22. Gao, L. et al. (2023). Табл. 1.
  23. Karpukhin, V. et al. (2020); сводные — в Gao et al., 2023.
  24. Xiong, L. et al. (2021). ICLR. arXiv:2007.00808.
  25. Thakur, N. et al. (2021); сводные — в Gao et al., 2023, табл. 2. arXiv:2104.08663.
  26. Izacard, G. et al. (2022); сводные — в Gao et al., 2023, табл. 2.
  27. Gao, L. et al. (2023). Табл. 2.
  28. Gao, L. et al. (2023). Табл. 3. DOI:10.18653/v1/2023.acl-long.99.
  29. Gao, L. et al. (2023). §4–5.
  30. Gao, L. et al. (2023). §4.2–4.3.
  31. Gao, L. et al. (2023). §4.1.
  32. Haystack Docs. ‘‘Hypothetical Document Embeddings (HyDE)’’ (инженерная справка). docs.haystack.deepset.ai
  33. Gao, L. et al. (2023). Табл. 6.
  34. Milvus Docs. ‘‘Similarity Metrics’’.
  35. Haystack × Milvus Integration (официальная док.). haystack.deepset.ai
  36. Nogueira, R.; Cho, K. (2019). arXiv:1901.04085.
  37. Khattab, O.; Zaharia, M. (2020). DOI:10.1145/3397271.3401075.
  38. Cormack, G. V. et al. (2009). DOI:10.1145/1571941.1572114.
  39. Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge Univ. Press. ISBN 978‑0521865715.
  40. Es, S. et al. (2023). ‘‘RAGAS: Automated Evaluation of Retrieval‑Augmented Generation’’. arXiv:2309.15217.
  41. Gao, L. et al. (2023). §5.
  42. Gao, L. et al. (2023). §3.2; §4.1. DOI:10.18653/v1/2023.acl-long.99.
  43. Gao, L. et al. (2023). Табл. 3; §4.4.
  44. Gao, L. et al. (2023). §4–5.
  45. Ouyang, L. et al. (2022). ‘‘Training language models to follow instructions with human feedback (InstructGPT)’’. NeurIPS. arXiv:2203.02155.
  46. Gao, L. et al. (2023). Табл. 1–2.
  47. Robertson, S.; Zaragoza, H. (2009). ‘‘The Probabilistic Relevance Framework: BM25 and Beyond’’. Found. Trends IR. DOI:10.1561/1500000019.
  48. Karpukhin, V. et al. (2020). DOI:10.18653/v1/2020.emnlp-main.550.
  49. Xiong, L. et al. (2021). arXiv:2007.00808.
  50. Nogueira, R. et al. (2019). arXiv:1904.08375.
  51. Nogueira, R.; Lin, J. (2019). tech report.
  52. Rocchio, J. (1971). SMART; Lavrenko & Croft (2001) SIGIR.