Hypothetical Document Embeddings (HyDE) (ID)

From Systems analysis Wiki
Jump to navigation Jump to search

Hypothetical Document Expansion (HyDE) — metode peningkatan vector retrieval dan retrieval‑augmented generation (RAG), di mana large language model (LLM) berdasarkan kueri awal menghasilkan «dokumen hipotetis»; kemudian teks tersebut divektorisasi oleh encoder, dan pencarian dilakukan di antara dokumen nyata berdasarkan kedekatan dengan vektor yang diperoleh. Pendekatan ini memungkinkan penggunaan «pola relevansi» yang dikodekan oleh LLM, dan «membumikannya» pada korpus menggunakan dense embedding[1].

Definisi dan Intuisi

HyDE mengdekomposisi tugas pencarian menjadi dua tahap:

(1) LLM membuat «contoh jawaban yang relevan» (hypothetical document) terhadap kueri, sehingga memodelkan ciri-ciri relevansi;

(2) encoder kontrastif (mis., Contriever) mengubah teks tersebut menjadi vektor, yang digunakan untuk mengambil dokumen nyata dari indeks. Teks yang dihasilkan mungkin mengandung kesalahan faktual, namun yang penting adalah pola tematik dan terminologis yang ditangkap oleh encoder[2].

Sejarah dan Sumber

Gagasan memperluas pencarian dengan teks sintetis berakar pada karya-karya tentang perluasan kueri dan pseudo-relevance feedback (PRF): algoritma Rocchio dan language model relevansi[3][4]. Untuk dense retrieval digunakan encoder yang dilatih secara kontrastif (Contriever)[5] dan Dense Passage Retrieval (DPR)[6]. Benchmark BEIR menstandarkan evaluasi zero‑shot[7]. Dalam konteks inilah HyDE diusulkan sebagai cara untuk «membawa» pengetahuan tentang relevansi ke dalam mode zero-shot melalui LLM tanpa fine-tuning encoder[8].

Metode dan Formalisasi

Misalkan korpus dokumen 𝒟={d1,,dN}, dan encoder teks E:textn mendefinisikan representasi vektor dokumen 𝐯d=E(d). Untuk mengukur kedekatan digunakan cosine similarity atau dot product; catatan penting: **dot product sama dengan cosine similarity hanya jika kedua vektor memiliki L2‑norm satuan** (𝐮=𝐯=1)[9].

HyDE mendefinisikan ulang representasi kueri melalui «dokumen hipotetis» yang dihasilkan oleh LLM. Secara formal:

(1) Генерация гипотетического текста:d~=G(q;inst),(2) Эмбеддинг гипотетического текста:𝐯h=E(d~),(3) Поиск ближайших соседей:k(q)=TopKd𝒟S(𝐯h,𝐯d),

di mana G — LLM dengan instruksi inst (misalnya: «Tulis sebuah paragraf yang menjawab pertanyaan …»), S — ukuran kemiripan (cosine atau IP dengan normalisasi), dan k(q) — himpunan dari k dokumen dengan kemiripan maksimum[10][11].

Dalam praktik rekayasa, sering kali dihasilkan **beberapa** teks hipotetis dan representasinya diagregasi, yang meningkatkan stabilitas:

d~(j)=G(q;inst,ξj),𝐯h=1mj=1mE(d~(j)),

di mana ξj — parameter decoding stokastik (mis., temperature/top‑p). Ensembling semacam ini meningkatkan Recall dengan pertumbuhan latency yang moderat[12].

Pipeline Dasar HyDE

# 1) prompt(query) -> hypothetical_doc
# 2) embed(hypothetical_doc) -> v_h
# 3) retrieve(index, v_h, k) -> candidates
# 4) (optional) rerank(query, candidates) -> topN
# 5) (для RAG) stuff / map-reduce / refine на topN

Hubungan dengan Metode Lain (QE, doc2query, PRF)

  • QE (perluasan kueri) menambahkan term pada kueri; HyDE sebaliknya menghasilkan seluruh «kuasi-dokumen», yang lebih sesuai dengan dense encoder[13].
  • doc2query / docTTTTTquery memperluas dokumen dengan kueri sintetis sebelum pengindeksan[14][15]; HyDE memperluas kueri secara langsung (on the fly), tanpa memerlukan re-indexing.
  • PRF (Rocchio, Relevance LM) memperbarui vektor kueri berdasarkan hasil teratas; HyDE mengekstrak «pola relevansi» langsung dari LLM, lalu «membumikannya» melalui retrieval dari korpus[16].

Integrasi dalam RAG dan Reranking

Dalam RAG, HyDE digunakan sebagai tahap pertama retrieval: dokumen hipotetis → embedding → k kandidat. Selanjutnya digunakan reranking: cross-encoder kelas BERT[17] atau late interaction ColBERT[18]. Untuk penggabungan daftar (mis., hybrid BM25+vector), umumnya digunakan RRF (reciprocal rank fusion): RRF(d)=r1k+rankr(d),k60. Metode RRF secara konsisten meningkatkan kualitas keseluruhan peringkat gabungan[19].

Evaluasi pada Benchmark (BEIR dan lainnya)

Karya asli mengevaluasi HyDE dalam mode zero-shot pada TREC DL'19/20 (pencarian web) dan pada subset koleksi BEIR (Scifact, ArguAna, TREC‑COVID, FiQA, DBPedia, TREC‑NEWS, Climate‑FEVER). Fragmen hasil — per 2023‑07:

TREC DL19/20 (pencarian web) — mAP / nDCG@10 / Recall@1k
Metode DL19 DL20 Sumber
BM25 30.1 / 50.6 / 75.0 28.6 / 48.0 / 78.6 [20]
Contriever (unsup.) 24.0 / 44.5 / 74.6 24.0 / 42.1 / 75.4 [21]
HyDE (Contriever+LLM) 41.8 / 61.3 / 88.0 38.2 / 57.9 / 84.4 [22]
DPR (ft) 36.5 / 62.2 / 76.9 41.8 / 65.3 / 81.4 [23]
ANCE (ft) 37.1 / 64.5 / 75.5 40.8 / 64.6 / 77.6 [24]
BEIR (pilihan dataset) — nDCG@10 / Recall@100
Metode Scifact ArguAna TREC‑COVID FiQA DBPedia TREC‑NEWS Climate‑FEVER Sumber
BM25 67.9 / 92.5 39.7 / 93.2 59.5 / 49.8 23.6 / 54.0 31.8 / 46.8 39.5 / 44.7 16.5 / 42.5 [25]
Contriever 64.9 / 92.6 37.9 / 90.1 27.3 / 17.2 24.5 / 56.2 29.2 / 45.3 34.8 / 42.3 15.5 / 44.1 [26]
HyDE 69.1 / 96.4 46.6 / 97.9 59.3 / 41.4 27.3 / 62.1 36.8 / 47.2 44.0 / 50.9 22.3 / 53.0 [27]

HyDE juga meningkatkan MRR@100 pada dataset multibahasa Mr.TyDi (sw/ko/ja/bn) dibandingkan mContriever[28].

Rekomendasi Praktis

Kapan menggunakan HyDE
  • Mode zero-shot/transfer (tidak ada label relevansi; «ketidakmiripan» domain dengan korpus pelatihan)[29].
  • Diperlukan peningkatan Recall@k dengan presisi yang dapat diterima — HyDE sering «membuka» area relevan dalam ruang vektor[30].
Pengaturan tipikal
  • LLM dan prompt: instruksi «Tulis sebuah paragraf yang menjawab pertanyaan …»; stokastisitas moderat (mis., temperature≈0.7)[31].
  • Jumlah teks hipotetis: 1–5; rata-rata embedding meningkatkan stabilitas[32].
  • Embedder: (m)Contriever tanpa fine-tuning; encoder yang sudah di-fine-tune juga dapat digunakan (efek HyDE tetap terjaga)[33].
  • Normalisasi embedding: L2‑norm; dot product ekuivalen dengan cosine[34].
  • Hybrid retrieval: BM25+vector dengan reranking berikutnya[35].
  • Reranker: Cross-Encoder (BERT re‑ranker)[36] atau ColBERT[37].
  • Penggabungan hasil dari berbagai strategi: RRF (k≈60)[38].
Pemantauan kualitas/biaya
  • Retrieval: nDCG@k, Recall@k, MRR; end‑to‑end RAG: EM/F1 atau metrik groundedness (RAGAS/TruLens)[39][40].
  • Biaya/latency: didominasi oleh pembuatan LLM dan (jika ada) reranking; dioptimalkan dengan jumlah «teks hipotetis» dan panjang jawaban[41].

Keterbatasan dan Pertanyaan Terbuka

  • Halusinasi teks hipotetis: LLM dapat memasukkan kesalahan faktual; «pembumian» melalui encoder dan korpus mengurangi risiko, namun tidak sepenuhnya menghilangkannya[42].
  • Keterbatasan domain/bahasa: keuntungan HyDE berkurang pada domain yang sangat terspesialisasi dan pada bahasa dengan sumber daya rendah[43].
  • Latency dan biaya: pembuatan LLM menambah keterlambatan dan biaya token; kritis untuk skenario online dan «teks hipotetis» yang panjang[44].
  • Etika dan bias: sebaiknya menggunakan LLM yang aman dan filter konten[45].

Tabel Perbandingan Metode

Perbandingan HyDE dan pendekatan terkait
Metode Kelas Tempat teks dihasilkan Encoder/indeks Reranker (tahap ke-2) Metrik tipikal (contoh) Biaya/latency Sumber
HyDE Query→hypo‑doc Di sisi kueri (LLM → paragraf) (m)Contriever; ANN BERT re‑rank / ColBERT / RRF DL19 nDCG@10≈61.3; DL20≈57.9; ArguAna nDCG@10≈46.6 + pembuatan LLM; + reranking (opsional) [46]
BM25 Leksikal Indeks terbalik Opsional lihat tabel (di atas) Rendah (lexical) [47]
DPR / ANCE Dense (ft) Bi‑encoder; ANN Opsional DL19 nDCG@10≈62–65 Sedang (tanpa LLM) [48][49]
doc2query / docTTTTTquery Ekspansi dokumen Di sisi koleksi (sebelum pengindeksan) BM25/sparse+expanded Opsional Peningkatan BM25 pada MS MARCO Pembuatan offline tinggi; online cepat [50][51]
PRF (Rocchio, RLM) QE berbasis feedback Kueri (berdasarkan hasil teratas) Apa saja Opsional Peningkatan Recall/risiko drift + satu putaran retrieval tambahan [52]

Lihat Juga

  • BM25
  • Pencarian berbasis representasi vektor,
  • RAG
  • Pseudo-relevance feedback
  • BEIR

Daftar Pustaka

  • Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
  • Robertson, S.; Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in IR, 3(4), 333–389. DOI:10.1561/1500000019.

Tautan

  • Repositori HyDE: github.com/texttron/hyde.
  • Dokumentasi: Haystack — HyDE: docs.haystack.deepset.ai.
  • Dokumentasi: LangChain — HyDE Retriever: docs.langchain.com.

Catatan

  1. Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023. pp. 1762–1777. DOI:10.18653/v1/2023.acl-long.99. arXiv:2212.10496
  2. Gao, L. et al. (2023). ACL 2023, §3.2. DOI:10.18653/v1/2023.acl-long.99.
  3. Rocchio, J. (1971). ‘‘Relevance Feedback in Information Retrieval’’. In: Salton, G. (ed.) The SMART Retrieval System. Prentice‑Hall, pp. 313–323. ISBN 978‑0138145255.
  4. Lavrenko, V.; Croft, W. B. (2001). ‘‘Relevance‑Based Language Models’’. SIGIR. DOI:10.1145/383952.383972.
  5. Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning’’. arXiv:2112.09118.
  6. Karpukhin, V. et al. (2020). ‘‘Dense Passage Retrieval for Open‑Domain QA’’. EMNLP. DOI:10.18653/v1/2020.emnlp-main.550.
  7. Thakur, N. et al. (2021). ‘‘BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of Information Retrieval Models’’. NeurIPS Datasets Track. arXiv:2104.08663.
  8. Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
  9. Milvus Docs. ‘‘Similarity Metrics’’ — при L2‑нормализации векторов внутр. произведение эквивалентно косинусу. URL: https://milvus.io/docs/v2.2.x/metric.md
  10. Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023, §3–4. arXiv:2212.10496. DOI:10.18653/v1/2023.acl-long.99.
  11. Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever)’’. arXiv:2112.09118.
  12. Gao, L. et al. (2023). Прил. (ablation): влияние числа гипотетических текстов и параметров генерации. arXiv:2212.10496.
  13. Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
  14. Nogueira, R. et al. (2019). ‘‘Document Expansion by Query Prediction’’ (doc2query). arXiv:1904.08375.
  15. Nogueira, R.; Lin, J. (2019). ‘‘From doc2query to docTTTTTquery’’ (tech report). PDF
  16. Rocchio, J. (1971); Lavrenko & Croft (2001), см. выше.
  17. Nogueira, R.; Cho, K. (2019). ‘‘Passage Re‑ranking with BERT’’. arXiv:1901.04085.
  18. Khattab, O.; Zaharia, M. (2020). ‘‘ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT’’. SIGIR. DOI:10.1145/3397271.3401075; arXiv:2004.12832.
  19. Cormack, G. V.; Clarke, C. L. A.; Büttcher, S. (2009). ‘‘Reciprocal Rank Fusion Outperforms Condorcet and Nearly Optimally Combines Rankings’’. SIGIR. DOI:10.1145/1571941.1572114.
  20. Gao, L. et al. (2023). Табл. 1. DOI:10.18653/v1/2023.acl-long.99.
  21. Izacard, G. et al. (2022); сводные метрики — в Gao et al., 2023, табл. 1. arXiv:2112.09118.
  22. Gao, L. et al. (2023). Табл. 1.
  23. Karpukhin, V. et al. (2020); сводные — в Gao et al., 2023.
  24. Xiong, L. et al. (2021). ICLR. arXiv:2007.00808.
  25. Thakur, N. et al. (2021); сводные — в Gao et al., 2023, табл. 2. arXiv:2104.08663.
  26. Izacard, G. et al. (2022); сводные — в Gao et al., 2023, табл. 2.
  27. Gao, L. et al. (2023). Табл. 2.
  28. Gao, L. et al. (2023). Табл. 3. DOI:10.18653/v1/2023.acl-long.99.
  29. Gao, L. et al. (2023). §4–5.
  30. Gao, L. et al. (2023). §4.2–4.3.
  31. Gao, L. et al. (2023). §4.1.
  32. Haystack Docs. ‘‘Hypothetical Document Embeddings (HyDE)’’ (инженерная справка). docs.haystack.deepset.ai
  33. Gao, L. et al. (2023). Табл. 6.
  34. Milvus Docs. ‘‘Similarity Metrics’’.
  35. Haystack × Milvus Integration (официальная док.). haystack.deepset.ai
  36. Nogueira, R.; Cho, K. (2019). arXiv:1901.04085.
  37. Khattab, O.; Zaharia, M. (2020). DOI:10.1145/3397271.3401075.
  38. Cormack, G. V. et al. (2009). DOI:10.1145/1571941.1572114.
  39. Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge Univ. Press. ISBN 978‑0521865715.
  40. Es, S. et al. (2023). ‘‘RAGAS: Automated Evaluation of Retrieval‑Augmented Generation’’. arXiv:2309.15217.
  41. Gao, L. et al. (2023). §5.
  42. Gao, L. et al. (2023). §3.2; §4.1. DOI:10.18653/v1/2023.acl-long.99.
  43. Gao, L. et al. (2023). Табл. 3; §4.4.
  44. Gao, L. et al. (2023). §4–5.
  45. Ouyang, L. et al. (2022). ‘‘Training language models to follow instructions with human feedback (InstructGPT)’’. NeurIPS. arXiv:2203.02155.
  46. Gao, L. et al. (2023). Табл. 1–2.
  47. Robertson, S.; Zaragoza, H. (2009). ‘‘The Probabilistic Relevance Framework: BM25 and Beyond’’. Found. Trends IR. DOI:10.1561/1500000019.
  48. Karpukhin, V. et al. (2020). DOI:10.18653/v1/2020.emnlp-main.550.
  49. Xiong, L. et al. (2021). arXiv:2007.00808.
  50. Nogueira, R. et al. (2019). arXiv:1904.08375.
  51. Nogueira, R.; Lin, J. (2019). tech report.
  52. Rocchio, J. (1971). SMART; Lavrenko & Croft (2001) SIGIR.