Hypothetical Document Embeddings (HyDE) (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

Hypothetical Document Expansion (HyDE) — een methode voor het verbeteren van vectorretrieval en retrieval‑augmented generation (RAG), waarbij een groot taalmodel (LLM) op basis van de oorspronkelijke zoekopdracht een 'hypothetisch document' genereert; vervolgens wordt deze tekst gevectoriseerd door een encoder, en wordt de zoekopdracht uitgevoerd in een corpus van echte documenten op basis van nabijheid tot de verkregen vector. De aanpak maakt het mogelijk 'relevantiepatronen' te benutten die door de LLM zijn gecodeerd, en deze te 'verankeren' aan het corpus met behulp van dichte embeddings[1].

Definitie en intuïtie

HyDE ontleedt de zoektaak in twee fasen:

(1) De LLM maakt een 'voorbeeld van een relevant antwoord' (hypothetical document) bij de zoekopdracht, waarmee de relevantiekenmerken worden gemodelleerd;

(2) een contrastieve encoder (bijv. Contriever) vertaalt deze tekst naar een vector, waarmee echte documenten uit de index worden opgehaald. De gegenereerde tekst kan feitelijke fouten bevatten, maar de thematische en terminologische patronen die de encoder oppikt zijn van belang[2].

Geschiedenis en bronnen

Het idee om zoekopdrachten uit te breiden met synthetische teksten gaat terug op onderzoek naar query-uitbreiding en pseudo-relevantie feedback (PRF): het Rocchio-algoritme en taalmodellen voor relevantie[3][4]. Voor dense retrieval werden contrastief getrainde encoders (Contriever)[5] en Dense Passage Retrieval (DPR)[6] gebruikt. De benchmark BEIR heeft de zero‑shot-evaluatie gestandaardiseerd[7]. Tegen deze achtergrond werd HyDE voorgesteld als een manier om relevantiekennis in de zero-shot-modus te introduceren via een LLM, zonder de encoder bij te trainen[8].

Methode en formalisering

Laat het documentcorpus 𝒟={d1,,dN} zijn, en laat de tekstencoder E:textn vectorrepresentaties van documenten 𝐯d=E(d) definiëren. Voor het meten van nabijheid wordt cosinus-gelijkenis of het scalair product gebruikt; een belangrijke kanttekening: **het scalair product komt overeen met de cosinus-gelijkenis alleen wanneer beide vectoren een eenheids-L2-norm hebben** (𝐮=𝐯=1)[9].

HyDE herdefiniëert de representatie van een zoekopdracht via een 'hypothetisch document' dat door een LLM is gegenereerd. Formeel:

(1) Генерация гипотетического текста:d~=G(q;inst),(2) Эмбеддинг гипотетического текста:𝐯h=E(d~),(3) Поиск ближайших соседей:k(q)=TopKd𝒟S(𝐯h,𝐯d),

waar G — LLM met instructie inst (bijvoorbeeld: 'Schrijf een alinea die de vraag beantwoordt …'), S — een gelijkenismaat (cosinus of IP met normalisatie), en k(q) — de verzameling van k documenten met de maximale gelijkenis[10][11].

In de ingenieurspraktijk worden vaak **meerdere** hypothetische teksten gegenereerd en worden hun representaties samengevoegd, wat de robuustheid verhoogt:

d~(j)=G(q;inst,ξj),𝐯h=1mj=1mE(d~(j)),

waar ξj — stochastische decoderingsparameters (bijv. temperature/top‑p). Dergelijke ensemblering verbetert de Recall bij een gematigde toename van de latentie[12].

Basisconveyorband van HyDE

# 1) prompt(query) -> hypothetical_doc
# 2) embed(hypothetical_doc) -> v_h
# 3) retrieve(index, v_h, k) -> candidates
# 4) (optional) rerank(query, candidates) -> topN
# 5) (для RAG) stuff / map-reduce / refine на topN

Relatie met andere methoden (QE, doc2query, PRF)

  • QE (query-uitbreiding) voegt termen toe aan de zoekopdracht; HyDE genereert in plaats daarvan een volledig 'quasi-document', wat beter aansluit bij dichte encoders[13].
  • doc2query / docTTTTTquery breiden documenten uit met synthetische zoekopdrachten vóór het indexeren[14][15]; HyDE breidt de zoekopdracht direct uit, zonder herindexering te vereisen.
  • PRF (Rocchio, Relevance LM) werkt de zoekvector bij op basis van de topresultaten; HyDE haalt het 'relevantiepatroon' rechtstreeks uit de LLM en 'verankt' het vervolgens via retrieval in het corpus[16].

Integratie in RAG en herrangschikking

In RAG wordt HyDE toegepast als eerste retrivalfase: hypothetisch document → embedding → k kandidaten. Vervolgens wordt herrangschikking toegepast: cross-encoders van BERT-klasse[17] of late interactie ColBERT[18]. Voor het samenvoegen van lijsten (bijv. hybride BM25+vector) wordt doorgaans RRF (reciprocal rank fusion) gebruikt: RRF(d)=r1k+rankr(d),k60. De RRF-methode verhoogt consistent de algehele kwaliteit van gecombineerde rangschikkingen[19].

Evaluatie op benchmarks (BEIR en andere)

Het oorspronkelijke werk evalueert HyDE in de zero-shot-modus op TREC DL'19/20 (webzoekopdrachten) en op een selectie van BEIR-collecties (Scifact, ArguAna, TREC‑COVID, FiQA, DBPedia, TREC‑NEWS, Climate‑FEVER). Een fragment van de resultaten — stand van zaken per 2023‑07:

TREC DL19/20 (webzoekopdrachten) — mAP / nDCG@10 / Recall@1k
Methode DL19 DL20 Bron
BM25 30.1 / 50.6 / 75.0 28.6 / 48.0 / 78.6 [20]
Contriever (unsup.) 24.0 / 44.5 / 74.6 24.0 / 42.1 / 75.4 [21]
HyDE (Contriever+LLM) 41.8 / 61.3 / 88.0 38.2 / 57.9 / 84.4 [22]
DPR (ft) 36.5 / 62.2 / 76.9 41.8 / 65.3 / 81.4 [23]
ANCE (ft) 37.1 / 64.5 / 75.5 40.8 / 64.6 / 77.6 [24]
BEIR (selectie van datasets) — nDCG@10 / Recall@100
Methode Scifact ArguAna TREC‑COVID FiQA DBPedia TREC‑NEWS Climate‑FEVER Bron
BM25 67.9 / 92.5 39.7 / 93.2 59.5 / 49.8 23.6 / 54.0 31.8 / 46.8 39.5 / 44.7 16.5 / 42.5 [25]
Contriever 64.9 / 92.6 37.9 / 90.1 27.3 / 17.2 24.5 / 56.2 29.2 / 45.3 34.8 / 42.3 15.5 / 44.1 [26]
HyDE 69.1 / 96.4 46.6 / 97.9 59.3 / 41.4 27.3 / 62.1 36.8 / 47.2 44.0 / 50.9 22.3 / 53.0 [27]

HyDE verbetert ook MRR@100 op meertalige datasets Mr.TyDi (sw/ko/ja/bn) ten opzichte van mContriever[28].

Praktische aanbevelingen

Wanneer HyDE toe te passen
  • Zero-shot/transfermodi (geen relevantielabels; domeinverschil ten opzichte van trainingskorpora)[29].
  • Wanneer verhoging van Recall@k gewenst is bij aanvaardbare nauwkeurigheid — HyDE 'opent' vaak relevante gebieden van de vectorruimte[30].
Typische instellingen
  • LLM en prompt: instructie 'Schrijf een alinea die de vraag beantwoordt …'; gematigde stochasticiteit (bijv. temperature≈0.7)[31].
  • Aantal hypothetische teksten: 1–5; het middelen van embeddings verhoogt de robuustheid[32].
  • Embedder: (m)Contriever zonder fine-tuning; gebruik van fine-getuned encoders is ook mogelijk (het HyDE-effect blijft behouden)[33].
  • Normalisatie van embeddings: L2-norm; het inwendig product is equivalent aan cosinus[34].
  • Hybride retrieval: BM25+vector gevolgd door herrangschikking[35].
  • Herrangschikker: Cross-Encoder (BERT re‑ranker)[36] of ColBERT[37].
  • Samenvoegen van resultaten van verschillende strategieën: RRF (k≈60)[38].
Monitoring van kwaliteit/kosten
  • Retrieval: nDCG@k, Recall@k, MRR; end‑to‑end RAG: EM/F1 of groundedness-metrieken (RAGAS/TruLens)[39][40].
  • Kosten/latentie: worden gedomineerd door LLM-generatie en (indien aanwezig) herrangschikking; te optimaliseren via het aantal 'hypothetische teksten' en de responslengte[41].

Beperkingen en open vragen

  • Hallucinaties in de hypothetische tekst: de LLM kan feitelijke fouten introduceren; 'verankering' via de encoder en het corpus vermindert het risico, maar elimineert het niet volledig[42].
  • Domein- en taalbeperkingen: de winst van HyDE neemt af in sterk gespecialiseerde domeinen en voor laagresourcetalen[43].
  • Latentie en kosten: LLM-generatie voegt vertraging en tokenkosten toe; dit is kritiek voor online-scenario's en lange 'hypothetische teksten'[44].
  • Ethiek en vertekening: het verdient aanbeveling veilige LLM's en filtering te gebruiken[45].

Vergelijkingstabel van methoden

Vergelijking van HyDE en verwante benaderingen
Methode Klasse Waar tekst wordt gegenereerd Encoder/index Herrangschikker (2e fase) Typische metrieken (voorbeeld) Kosten/latentie Bronnen
HyDE Query→hypo‑doc Aan de zijde van de zoekopdracht (LLM → alinea) (m)Contriever; ANN BERT re‑rank / ColBERT / RRF DL19 nDCG@10≈61.3; DL20≈57.9; ArguAna nDCG@10≈46.6 + LLM-generatie; + herrangschikking (opt.) [46]
BM25 Lexicaal Geïnverteerde index Optioneel zie tabel (hierboven) Laag (lexicaal) [47]
DPR / ANCE Dense (ft) Bi-encoder; ANN Optioneel DL19 nDCG@10≈62–65 Gemiddeld (zonder LLM) [48][49]
doc2query / docTTTTTquery Documentuitbreiding Aan de zijde van de collectie (vóór indexering) BM25/sparse+expanded Optioneel Verbeteringen van BM25 op MS MARCO Hoge offline-generatie; snelle online [50][51]
PRF (Rocchio, RLM) QE via feedback Zoekopdracht (via topresultaten) Willekeurig Optioneel Toename van Recall/risico op drift + extra retrivalstap [52]

Zie ook

  • BM25
  • Zoeken op vectorrepresentaties,
  • RAG
  • Pseudo-relevantie feedback
  • BEIR

Literatuur

  • Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
  • Robertson, S.; Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in IR, 3(4), 333–389. DOI:10.1561/1500000019.
  • Repository van HyDE: github.com/texttron/hyde.
  • Documentatie: Haystack — HyDE: docs.haystack.deepset.ai.
  • Documentatie: LangChain — HyDE Retriever: docs.langchain.com.

Noten

  1. Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023. pp. 1762–1777. DOI:10.18653/v1/2023.acl-long.99. arXiv:2212.10496
  2. Gao, L. et al. (2023). ACL 2023, §3.2. DOI:10.18653/v1/2023.acl-long.99.
  3. Rocchio, J. (1971). ‘‘Relevance Feedback in Information Retrieval’’. In: Salton, G. (ed.) The SMART Retrieval System. Prentice‑Hall, pp. 313–323. ISBN 978‑0138145255.
  4. Lavrenko, V.; Croft, W. B. (2001). ‘‘Relevance‑Based Language Models’’. SIGIR. DOI:10.1145/383952.383972.
  5. Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning’’. arXiv:2112.09118.
  6. Karpukhin, V. et al. (2020). ‘‘Dense Passage Retrieval for Open‑Domain QA’’. EMNLP. DOI:10.18653/v1/2020.emnlp-main.550.
  7. Thakur, N. et al. (2021). ‘‘BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of Information Retrieval Models’’. NeurIPS Datasets Track. arXiv:2104.08663.
  8. Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
  9. Milvus Docs. ‘‘Similarity Metrics’’ — при L2‑нормализации векторов внутр. произведение эквивалентно косинусу. URL: https://milvus.io/docs/v2.2.x/metric.md
  10. Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023, §3–4. arXiv:2212.10496. DOI:10.18653/v1/2023.acl-long.99.
  11. Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever)’’. arXiv:2112.09118.
  12. Gao, L. et al. (2023). Прил. (ablation): влияние числа гипотетических текстов и параметров генерации. arXiv:2212.10496.
  13. Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
  14. Nogueira, R. et al. (2019). ‘‘Document Expansion by Query Prediction’’ (doc2query). arXiv:1904.08375.
  15. Nogueira, R.; Lin, J. (2019). ‘‘From doc2query to docTTTTTquery’’ (tech report). PDF
  16. Rocchio, J. (1971); Lavrenko & Croft (2001), см. выше.
  17. Nogueira, R.; Cho, K. (2019). ‘‘Passage Re‑ranking with BERT’’. arXiv:1901.04085.
  18. Khattab, O.; Zaharia, M. (2020). ‘‘ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT’’. SIGIR. DOI:10.1145/3397271.3401075; arXiv:2004.12832.
  19. Cormack, G. V.; Clarke, C. L. A.; Büttcher, S. (2009). ‘‘Reciprocal Rank Fusion Outperforms Condorcet and Nearly Optimally Combines Rankings’’. SIGIR. DOI:10.1145/1571941.1572114.
  20. Gao, L. et al. (2023). Табл. 1. DOI:10.18653/v1/2023.acl-long.99.
  21. Izacard, G. et al. (2022); сводные метрики — в Gao et al., 2023, табл. 1. arXiv:2112.09118.
  22. Gao, L. et al. (2023). Табл. 1.
  23. Karpukhin, V. et al. (2020); сводные — в Gao et al., 2023.
  24. Xiong, L. et al. (2021). ICLR. arXiv:2007.00808.
  25. Thakur, N. et al. (2021); сводные — в Gao et al., 2023, табл. 2. arXiv:2104.08663.
  26. Izacard, G. et al. (2022); сводные — в Gao et al., 2023, табл. 2.
  27. Gao, L. et al. (2023). Табл. 2.
  28. Gao, L. et al. (2023). Табл. 3. DOI:10.18653/v1/2023.acl-long.99.
  29. Gao, L. et al. (2023). §4–5.
  30. Gao, L. et al. (2023). §4.2–4.3.
  31. Gao, L. et al. (2023). §4.1.
  32. Haystack Docs. ‘‘Hypothetical Document Embeddings (HyDE)’’ (инженерная справка). docs.haystack.deepset.ai
  33. Gao, L. et al. (2023). Табл. 6.
  34. Milvus Docs. ‘‘Similarity Metrics’’.
  35. Haystack × Milvus Integration (официальная док.). haystack.deepset.ai
  36. Nogueira, R.; Cho, K. (2019). arXiv:1901.04085.
  37. Khattab, O.; Zaharia, M. (2020). DOI:10.1145/3397271.3401075.
  38. Cormack, G. V. et al. (2009). DOI:10.1145/1571941.1572114.
  39. Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge Univ. Press. ISBN 978‑0521865715.
  40. Es, S. et al. (2023). ‘‘RAGAS: Automated Evaluation of Retrieval‑Augmented Generation’’. arXiv:2309.15217.
  41. Gao, L. et al. (2023). §5.
  42. Gao, L. et al. (2023). §3.2; §4.1. DOI:10.18653/v1/2023.acl-long.99.
  43. Gao, L. et al. (2023). Табл. 3; §4.4.
  44. Gao, L. et al. (2023). §4–5.
  45. Ouyang, L. et al. (2022). ‘‘Training language models to follow instructions with human feedback (InstructGPT)’’. NeurIPS. arXiv:2203.02155.
  46. Gao, L. et al. (2023). Табл. 1–2.
  47. Robertson, S.; Zaragoza, H. (2009). ‘‘The Probabilistic Relevance Framework: BM25 and Beyond’’. Found. Trends IR. DOI:10.1561/1500000019.
  48. Karpukhin, V. et al. (2020). DOI:10.18653/v1/2020.emnlp-main.550.
  49. Xiong, L. et al. (2021). arXiv:2007.00808.
  50. Nogueira, R. et al. (2019). arXiv:1904.08375.
  51. Nogueira, R.; Lin, J. (2019). tech report.
  52. Rocchio, J. (1971). SMART; Lavrenko & Croft (2001) SIGIR.