Hypothetical Document Embeddings (HyDE) (SV)
Hypothetical Document Expansion (HyDE) — en metod för att förbättra vektorsökning och retrieval-augmented generation (RAG), där en stor språkmodell (LLM) utifrån en ursprunglig fråga genererar ett "hypotetiskt dokument"; därefter vektorialiseras denna text av en encoder, och sökning sker bland verkliga dokument baserat på likhet med den resulterande vektorn. Metoden gör det möjligt att utnyttja "relevansmönster" kodade av LLM och "förankra" dem mot ett korpus med hjälp av täta embeddings[1].
Definition och intuition
HyDE dekomponerar sökuppgiften i två steg:
(1) LLM skapar ett "exempel på ett relevant svar" (hypothetical document) till frågan och modellerar därigenom relevansdrag;
(2) en kontrastiv encoder (t.ex. Contriever) omvandlar denna text till en vektor, med hjälp av vilken verkliga dokument hämtas från ett index. Den genererade texten kan innehålla faktafel, men de tematiska och terminologiska mönster som encodern fångar upp är det väsentliga[2].
Historia och källor
Idén att utvidga sökning med syntetiska texter har rötter i forskning om frågeexpansion och pseudo-relevansåterkoppling (PRF): Rocchios algoritm och språkmodeller för relevans[3][4]. För tät sökning användes kontrastivt tränade encoders (Contriever)[5] och Dense Passage Retrieval (DPR)[6]. Benchmarken BEIR standardiserade zero-shot-utvärdering[7]. Mot denna bakgrund föreslogs HyDE som ett sätt att "föra in" relevanskännedom i zero-shot-läget via LLM utan att finjustera encodern[8].
Metod och formalisering
Låt dokumentkorpusen vara , och låt textencodern definiera vektorrepresentationer av dokument . För att mäta likhet används antingen kosinuslikhet eller skalärprodukt; en viktig anmärkning: **skalärprodukten sammanfaller med kosinuslikheten endast då båda vektorerna har L2-norm lika med ett** ()[9].
HyDE omdefinierar frågerepresentationen via ett "hypotetiskt dokument" genererat av LLM. Formellt:
där är en LLM med instruktionen (till exempel: "Skriv ett stycke som svarar på frågan …"), är ett likhetsmått (cosinus eller IP med normalisering) och är mängden av de dokument med högst likhet[10][11].
I ingenjörspraxis genererar man ofta **flera** hypotetiska texter och aggregerar deras representationer, vilket ökar robustheten:
där är stokastiska avkodningsparametrar (t.ex. temperature/top-p). Sådan ensembling förbättrar Recall vid en måttlig ökning av latens[12].
Grundläggande HyDE-pipeline
# 1) prompt(query) -> hypothetical_doc # 2) embed(hypothetical_doc) -> v_h # 3) retrieve(index, v_h, k) -> candidates # 4) (optional) rerank(query, candidates) -> topN # 5) (для RAG) stuff / map-reduce / refine на topN
Relation till andra metoder (QE, doc2query, PRF)
- QE (frågeexpansion) lägger till termer i frågan; HyDE genererar i stället ett helt "kvasi-dokument", vilket bättre stämmer överens med täta encoders[13].
- doc2query / docTTTTTquery utvidgar dokument med syntetiska frågor före indexering[14][15]; HyDE utvidgar frågan i realtid och kräver ingen omindexering.
- PRF (Rocchio, Relevance LM) uppdaterar frågevektorn baserat på toppresultat; HyDE hämtar "relevansmönstret" direkt från LLM och "förankrar" det sedan via korpussökning[16].
Integration i RAG och omrangordning
I RAG tillämpas HyDE som det första sökskedet: hypotetiskt dokument → embedding → k kandidater. Därefter används omrangordning: korsenkodrar av BERT-klass[17] eller sen interaktion med ColBERT[18]. För sammanslagning av listor (t.ex. hybrid BM25+vektor) tillämpas typiskt RRF (reciprocal rank fusion): Metoden RRF förbättrar på ett stabilt sätt den samlade kvaliteten hos kombinerade rangordningar[19].
Utvärdering på benchmarks (BEIR m.fl.)
Det ursprungliga arbetet utvärderar HyDE i zero-shot-läge på TREC DL'19/20 (webbsökning) och på ett urval av BEIR-samlingar (Scifact, ArguAna, TREC-COVID, FiQA, DBPedia, TREC-NEWS, Climate-FEVER). Utdrag ur resultaten — per 2023-07:
| Metod | DL19 | DL20 | Källa |
|---|---|---|---|
| BM25 | 30.1 / 50.6 / 75.0 | 28.6 / 48.0 / 78.6 | [20] |
| Contriever (unsup.) | 24.0 / 44.5 / 74.6 | 24.0 / 42.1 / 75.4 | [21] |
| HyDE (Contriever+LLM) | 41.8 / 61.3 / 88.0 | 38.2 / 57.9 / 84.4 | [22] |
| DPR (ft) | 36.5 / 62.2 / 76.9 | 41.8 / 65.3 / 81.4 | [23] |
| ANCE (ft) | 37.1 / 64.5 / 75.5 | 40.8 / 64.6 / 77.6 | [24] |
| Metod | Scifact | ArguAna | TREC-COVID | FiQA | DBPedia | TREC-NEWS | Climate-FEVER | Källa |
|---|---|---|---|---|---|---|---|---|
| BM25 | 67.9 / 92.5 | 39.7 / 93.2 | 59.5 / 49.8 | 23.6 / 54.0 | 31.8 / 46.8 | 39.5 / 44.7 | 16.5 / 42.5 | [25] |
| Contriever | 64.9 / 92.6 | 37.9 / 90.1 | 27.3 / 17.2 | 24.5 / 56.2 | 29.2 / 45.3 | 34.8 / 42.3 | 15.5 / 44.1 | [26] |
| HyDE | 69.1 / 96.4 | 46.6 / 97.9 | 59.3 / 41.4 | 27.3 / 62.1 | 36.8 / 47.2 | 44.0 / 50.9 | 22.3 / 53.0 | [27] |
HyDE förbättrar också MRR@100 på flerspråkiga datamängder Mr.TyDi (sw/ko/ja/bn) jämfört med mContriever[28].
Praktiska rekommendationer
- När HyDE bör användas
- Zero-shot/överföringslägen (inga relevansetiketter finns; domänen liknar inte träningskorpusen)[29].
- När ökad Recall@k eftersträvas vid acceptabel precision — HyDE "öppnar" ofta relevanta regioner i vektorrymden[30].
- Typiska inställningar
- LLM och prompt: instruktionen "Skriv ett stycke som svarar på frågan …"; måttlig stokasticitet (t.ex. temperature≈0.7)[31].
- Antal hypotetiska texter: 1–5; medelvärdesbildning av embeddings ökar robustheten[32].
- Embedder: (m)Contriever utan finjustering; finjusterade encoders kan också användas (HyDE-effekten kvarstår)[33].
- Normalisering av embeddings: L2-norm; skalärprodukt är ekvivalent med kosinus[34].
- Hybridsökning: BM25+vektor med efterföljande omrangordning[35].
- Omrangordnare: Cross-Encoder (BERT re-ranker)[36] eller ColBERT[37].
- Sammanslagning av resultat från olika strategier: RRF (k≈60)[38].
- Uppföljning av kvalitet och kostnad
- Sökning: nDCG@k, Recall@k, MRR; end-to-end RAG: EM/F1 eller groundedness-mätvärden (RAGAS/TruLens)[39][40].
- Kostnad/latens: domineras av LLM-generering och (om tillämpligt) omrangordning; optimeras genom antal "hypotetiker" och svarslängd[41].
Begränsningar och öppna frågor
- Hallucinationer i den hypotetiska texten: LLM kan introducera faktafel; "förankring" via encoder och korpus minskar risken men eliminerar den inte helt[42].
- Domän- och språkbegränsningar: vinsten med HyDE minskar i snäva specialdomäner och för lågresursspråk[43].
- Latens och kostnad: LLM-generering tillför fördröjning och tokenkostnad; kritiskt för realtidsscenarier och långa "hypotetiker"[44].
- Etik och bias: det är att föredra att använda säkra LLM och filtrering[45].
Jämförelsetabell över metoder
| Metod | Klass | Var texten genereras | Encoder/index | Omrangordnare (steg 2) | Typiska mätvärden (exempel) | Kostnad/latens | Källor |
|---|---|---|---|---|---|---|---|
| HyDE | Fråga→hypo-doc | På frågesidan (LLM → stycke) | (m)Contriever; ANN | BERT re-rank / ColBERT / RRF | DL19 nDCG@10≈61.3; DL20≈57.9; ArguAna nDCG@10≈46.6 | + LLM-generering; + omrangordning (valfritt) | [46] |
| BM25 | Lexikal | — | Inverterat index | Valfritt | se tabell (ovan) | Låg (lexikal) | [47] |
| DPR / ANCE | Tät (ft) | — | Bi-encoder; ANN | Valfritt | DL19 nDCG@10≈62–65 | Medel (utan LLM) | [48][49] |
| doc2query / docTTTTTquery | Dokumentexpansion | På samlingssidan (före indexering) | BM25/sparse+expanded | Valfritt | Förbättringar av BM25 på MS MARCO | Hög offlinegenerering; snabb online | [50][51] |
| PRF (Rocchio, RLM) | QE via återkoppling | Fråga (via toppresultat) | Valfri | Valfritt | Ökad Recall/risk för drift | + extra sökomgång | [52] |
Se även
- BM25
- Sökning via vektorrepresentationer,
- RAG
- Pseudo-relevansåterkoppling
- BEIR
Litteratur
- Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978-0521865715.
- Robertson, S.; Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in IR, 3(4), 333–389. DOI:10.1561/1500000019.
Länkar
- HyDE-repositorium: github.com/texttron/hyde.
- Dokumentation: Haystack — HyDE: docs.haystack.deepset.ai.
- Dokumentation: LangChain — HyDE Retriever: docs.langchain.com.
Noter
- ↑ Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023. pp. 1762–1777. DOI:10.18653/v1/2023.acl-long.99. arXiv:2212.10496
- ↑ Gao, L. et al. (2023). ACL 2023, §3.2. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Rocchio, J. (1971). ‘‘Relevance Feedback in Information Retrieval’’. In: Salton, G. (ed.) The SMART Retrieval System. Prentice‑Hall, pp. 313–323. ISBN 978‑0138145255.
- ↑ Lavrenko, V.; Croft, W. B. (2001). ‘‘Relevance‑Based Language Models’’. SIGIR. DOI:10.1145/383952.383972.
- ↑ Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning’’. arXiv:2112.09118.
- ↑ Karpukhin, V. et al. (2020). ‘‘Dense Passage Retrieval for Open‑Domain QA’’. EMNLP. DOI:10.18653/v1/2020.emnlp-main.550.
- ↑ Thakur, N. et al. (2021). ‘‘BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of Information Retrieval Models’’. NeurIPS Datasets Track. arXiv:2104.08663.
- ↑ Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
- ↑ Milvus Docs. ‘‘Similarity Metrics’’ — при L2‑нормализации векторов внутр. произведение эквивалентно косинусу. URL: https://milvus.io/docs/v2.2.x/metric.md
- ↑ Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023, §3–4. arXiv:2212.10496. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever)’’. arXiv:2112.09118.
- ↑ Gao, L. et al. (2023). Прил. (ablation): влияние числа гипотетических текстов и параметров генерации. arXiv:2212.10496.
- ↑ Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
- ↑ Nogueira, R. et al. (2019). ‘‘Document Expansion by Query Prediction’’ (doc2query). arXiv:1904.08375.
- ↑ Nogueira, R.; Lin, J. (2019). ‘‘From doc2query to docTTTTTquery’’ (tech report). PDF
- ↑ Rocchio, J. (1971); Lavrenko & Croft (2001), см. выше.
- ↑ Nogueira, R.; Cho, K. (2019). ‘‘Passage Re‑ranking with BERT’’. arXiv:1901.04085.
- ↑ Khattab, O.; Zaharia, M. (2020). ‘‘ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT’’. SIGIR. DOI:10.1145/3397271.3401075; arXiv:2004.12832.
- ↑ Cormack, G. V.; Clarke, C. L. A.; Büttcher, S. (2009). ‘‘Reciprocal Rank Fusion Outperforms Condorcet and Nearly Optimally Combines Rankings’’. SIGIR. DOI:10.1145/1571941.1572114.
- ↑ Gao, L. et al. (2023). Табл. 1. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Izacard, G. et al. (2022); сводные метрики — в Gao et al., 2023, табл. 1. arXiv:2112.09118.
- ↑ Gao, L. et al. (2023). Табл. 1.
- ↑ Karpukhin, V. et al. (2020); сводные — в Gao et al., 2023.
- ↑ Xiong, L. et al. (2021). ICLR. arXiv:2007.00808.
- ↑ Thakur, N. et al. (2021); сводные — в Gao et al., 2023, табл. 2. arXiv:2104.08663.
- ↑ Izacard, G. et al. (2022); сводные — в Gao et al., 2023, табл. 2.
- ↑ Gao, L. et al. (2023). Табл. 2.
- ↑ Gao, L. et al. (2023). Табл. 3. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Gao, L. et al. (2023). §4–5.
- ↑ Gao, L. et al. (2023). §4.2–4.3.
- ↑ Gao, L. et al. (2023). §4.1.
- ↑ Haystack Docs. ‘‘Hypothetical Document Embeddings (HyDE)’’ (инженерная справка). docs.haystack.deepset.ai
- ↑ Gao, L. et al. (2023). Табл. 6.
- ↑ Milvus Docs. ‘‘Similarity Metrics’’.
- ↑ Haystack × Milvus Integration (официальная док.). haystack.deepset.ai
- ↑ Nogueira, R.; Cho, K. (2019). arXiv:1901.04085.
- ↑ Khattab, O.; Zaharia, M. (2020). DOI:10.1145/3397271.3401075.
- ↑ Cormack, G. V. et al. (2009). DOI:10.1145/1571941.1572114.
- ↑ Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge Univ. Press. ISBN 978‑0521865715.
- ↑ Es, S. et al. (2023). ‘‘RAGAS: Automated Evaluation of Retrieval‑Augmented Generation’’. arXiv:2309.15217.
- ↑ Gao, L. et al. (2023). §5.
- ↑ Gao, L. et al. (2023). §3.2; §4.1. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Gao, L. et al. (2023). Табл. 3; §4.4.
- ↑ Gao, L. et al. (2023). §4–5.
- ↑ Ouyang, L. et al. (2022). ‘‘Training language models to follow instructions with human feedback (InstructGPT)’’. NeurIPS. arXiv:2203.02155.
- ↑ Gao, L. et al. (2023). Табл. 1–2.
- ↑ Robertson, S.; Zaragoza, H. (2009). ‘‘The Probabilistic Relevance Framework: BM25 and Beyond’’. Found. Trends IR. DOI:10.1561/1500000019.
- ↑ Karpukhin, V. et al. (2020). DOI:10.18653/v1/2020.emnlp-main.550.
- ↑ Xiong, L. et al. (2021). arXiv:2007.00808.
- ↑ Nogueira, R. et al. (2019). arXiv:1904.08375.
- ↑ Nogueira, R.; Lin, J. (2019). tech report.
- ↑ Rocchio, J. (1971). SMART; Lavrenko & Croft (2001) SIGIR.