Hypothetical Document Embeddings (HyDE) (EL)
Hypothetical Document Expansion (HyDE) — μέθοδος βελτίωσης του διανυσματικού retrieval και του retrieval‑augmented generation (RAG), κατά την οποία ένα μεγάλο γλωσσικό μοντέλο (LLM) παράγει ένα «υποθετικό έγγραφο» βάσει του αρχικού ερωτήματος· στη συνέχεια, αυτό το κείμενο διανυσματοποιείται από έναν encoder και η αναζήτηση πραγματοποιείται μεταξύ πραγματικών εγγράφων με βάση την εγγύτητα προς το διάνυσμα που προκύπτει. Η προσέγγιση επιτρέπει τη χρήση «μοτίβων συνάφειας» κωδικοποιημένων από το LLM και την «αγκύρωσή» τους στο σώμα κειμένων μέσω πυκνών embeddings[1].
Ορισμός και διαίσθηση
Το HyDE αποσυνθέτει το πρόβλημα αναζήτησης σε δύο στάδια:
(1) Το LLM δημιουργεί ένα «παράδειγμα συναφούς απάντησης» (hypothetical document) για το ερώτημα, μοντελοποιώντας έτσι τα χαρακτηριστικά συνάφειας·
(2) ένας contrastive encoder (π.χ. Contriever) μετατρέπει αυτό το κείμενο σε διάνυσμα, με βάση το οποίο ανακτώνται πραγματικά έγγραφα από τον δείκτη. Το παραγόμενο κείμενο ενδέχεται να περιέχει πραγματολογικά σφάλματα, ωστόσο αυτό που έχει σημασία είναι τα θεματικά και ορολογικά μοτίβα που συλλαμβάνει ο encoder[2].
Ιστορία και πηγές
Η ιδέα επέκτασης της αναζήτησης με συνθετικά κείμενα ανάγεται σε εργασίες σχετικές με την επέκταση ερωτημάτων και την ψευδο-συναφή ανατροφοδότηση (PRF): τον αλγόριθμο Rocchio και τα γλωσσικά μοντέλα συνάφειας[3][4]. Για το πυκνό retrieval χρησιμοποιήθηκαν contrastively εκπαιδευμένοι encoders (Contriever)[5] και Dense Passage Retrieval (DPR)[6]. Το benchmark BEIR τυποποίησε την αξιολόγηση σε zero‑shot συνθήκες[7]. Στο πλαίσιο αυτό προτάθηκε το HyDE ως τρόπος «εισαγωγής» γνώσης συνάφειας μέσω LLM στη λειτουργία μηδενικού πλαισίου, χωρίς πρόσθετη εκπαίδευση του encoder[8].
Μέθοδος και φορμαλισμός
Έστω σώμα εγγράφων και encoder κειμένων που ορίζει διανυσματικές αναπαραστάσεις εγγράφων . Για τη μέτρηση εγγύτητας χρησιμοποιείται είτε η ομοιότητα συνημιτόνου είτε το εσωτερικό γινόμενο· σημαντική παρατήρηση: **το εσωτερικό γινόμενο ισούται με την ομοιότητα συνημιτόνου μόνο όταν και τα δύο διανύσματα έχουν μοναδιαία L2‑νόρμα** ()[9].
Το HyDE επαναορίζει την αναπαράσταση του ερωτήματος μέσω ενός «υποθετικού εγγράφου» που παράγεται από το LLM. Τυπικά:
όπου — LLM με οδηγία (για παράδειγμα: «Γράψε μια παράγραφο που απαντά στην ερώτηση …»), — μέτρο ομοιότητας (συνημίτονο ή IP με κανονικοποίηση), και — σύνολο εγγράφων με μέγιστη ομοιότητα[10][11].
Στην πρακτική μηχανική, συχνά παράγονται **πολλαπλά** υποθετικά κείμενα και οι αναπαραστάσεις τους συνάγονται, γεγονός που αυξάνει την ευρωστία:
όπου — στοχαστικές παράμετροι αποκωδικοποίησης (π.χ. temperature/top‑p). Αυτή η τεχνική ensemble βελτιώνει το Recall με μέτρια αύξηση της λανθάνουσας[12].
Βασικός αγωγός (pipeline) HyDE
# 1) prompt(query) -> hypothetical_doc # 2) embed(hypothetical_doc) -> v_h # 3) retrieve(index, v_h, k) -> candidates # 4) (optional) rerank(query, candidates) -> topN # 5) (для RAG) stuff / map-reduce / refine на topN
Σχέση με άλλες μεθόδους (QE, doc2query, PRF)
- QE (επέκταση ερωτήματος) προσθέτει όρους στο ερώτημα· το HyDE αντ' αυτού παράγει ολόκληρο ένα «quasi-έγγραφο», κάτι που εναρμονίζεται καλύτερα με τους πυκνούς encoders[13].
- doc2query / docTTTTTquery επεκτείνουν τα έγγραφα με συνθετικά ερωτήματα πριν από την ευρετηρίαση[14][15]· το HyDE επεκτείνει το ερώτημα εν κινήσει, χωρίς να απαιτεί επανευρετηρίαση.
- PRF (Rocchio, Relevance LM) ενημερώνει το διάνυσμα ερωτήματος βάσει των κορυφαίων αποτελεσμάτων· το HyDE εξάγει το «μοτίβο συνάφειας» απευθείας από το LLM και στη συνέχεια το «αγκυρώνει» μέσω retrieval από το σώμα κειμένων[16].
Ενσωμάτωση σε RAG και επαναταξινόμηση
Στο RAG, το HyDE εφαρμόζεται ως πρώτο στάδιο retrieval: υποθετικό έγγραφο → embedding → k υποψήφια. Στη συνέχεια εφαρμόζεται επαναταξινόμηση: cross-encoders κλάσης BERT[17] ή late interaction ColBERT[18]. Για τη συγχώνευση λιστών (π.χ. υβριδικό BM25+vector) εφαρμόζεται συνήθως RRF (reciprocal rank fusion): Η μέθοδος RRF βελτιώνει σταθερά τη συνολική ποιότητα των συνδυασμένων ταξινομήσεων[19].
Αξιολόγηση σε benchmarks (BEIR κ.ά.)
Η πρωτότυπη εργασία αξιολογεί το HyDE σε zero-shot συνθήκες στα TREC DL'19/20 (αναζήτηση ιστού) και σε υποσύνολο συλλογών BEIR (Scifact, ArguAna, TREC‑COVID, FiQA, DBPedia, TREC‑NEWS, Climate‑FEVER). Απόσπασμα αποτελεσμάτων — κατάσταση στις 2023‑07:
| Μέθοδος | DL19 | DL20 | Πηγή |
|---|---|---|---|
| BM25 | 30.1 / 50.6 / 75.0 | 28.6 / 48.0 / 78.6 | [20] |
| Contriever (unsup.) | 24.0 / 44.5 / 74.6 | 24.0 / 42.1 / 75.4 | [21] |
| HyDE (Contriever+LLM) | 41.8 / 61.3 / 88.0 | 38.2 / 57.9 / 84.4 | [22] |
| DPR (ft) | 36.5 / 62.2 / 76.9 | 41.8 / 65.3 / 81.4 | [23] |
| ANCE (ft) | 37.1 / 64.5 / 75.5 | 40.8 / 64.6 / 77.6 | [24] |
| Μέθοδος | Scifact | ArguAna | TREC‑COVID | FiQA | DBPedia | TREC‑NEWS | Climate‑FEVER | Πηγή |
|---|---|---|---|---|---|---|---|---|
| BM25 | 67.9 / 92.5 | 39.7 / 93.2 | 59.5 / 49.8 | 23.6 / 54.0 | 31.8 / 46.8 | 39.5 / 44.7 | 16.5 / 42.5 | [25] |
| Contriever | 64.9 / 92.6 | 37.9 / 90.1 | 27.3 / 17.2 | 24.5 / 56.2 | 29.2 / 45.3 | 34.8 / 42.3 | 15.5 / 44.1 | [26] |
| HyDE | 69.1 / 96.4 | 46.6 / 97.9 | 59.3 / 41.4 | 27.3 / 62.1 | 36.8 / 47.2 | 44.0 / 50.9 | 22.3 / 53.0 | [27] |
Το HyDE βελτιώνει επίσης το MRR@100 σε πολύγλωσσα σύνολα Mr.TyDi (sw/ko/ja/bn) σε σχέση με το mContriever[28].
Πρακτικές συστάσεις
- Πότε να εφαρμόζεται το HyDE
- Λειτουργία μηδενικού πλαισίου (zero-shot) ή μεταφοράς (δεν υπάρχουν ετικέτες συνάφειας· ο τομέας «διαφέρει» από τα σώματα εκπαίδευσης)[29].
- Απαιτείται αύξηση του Recall@k με αποδεκτή ακρίβεια — το HyDE συχνά «ανοίγει» συναφείς περιοχές του διανυσματικού χώρου[30].
- Τυπικές ρυθμίσεις
- LLM και prompt: οδηγία «Γράψε μια παράγραφο που απαντά στην ερώτηση …»· μέτρια στοχαστικότητα (π.χ. temperature≈0.7)[31].
- Αριθμός υποθετικών κειμένων: 1–5· ο μέσος όρος των embeddings αυξάνει την ευρωστία[32].
- Embedder: (m)Contriever χωρίς fine-tuning· είναι δυνατή η χρήση fine-tuned encoders (το αποτέλεσμα του HyDE διατηρείται)[33].
- Κανονικοποίηση embeddings: L2‑νόρμα· το εσωτερικό γινόμενο ισοδυναμεί με το συνημίτονο[34].
- Υβριδικό retrieval: BM25+vector με επακόλουθη επαναταξινόμηση[35].
- Επαναταξινομητής: Cross-Encoder (BERT re‑ranker)[36] ή ColBERT[37].
- Συγχώνευση αποτελεσμάτων διαφορετικών στρατηγικών: RRF (k≈60)[38].
- Παρακολούθηση ποιότητας/κόστους
- Retrieval: nDCG@k, Recall@k, MRR· end‑to‑end RAG: EM/F1 ή μετρικές groundedness (RAGAS/TruLens)[39][40].
- Κόστος/λανθάνουσα: κυριαρχείται από τη γένεση του LLM και (αν υπάρχει) την επαναταξινόμηση· βελτιστοποιείται μέσω του αριθμού «υποθετικών» και του μήκους απάντησης[41].
Περιορισμοί και ανοιχτά ζητήματα
- Ψευδαισθήσεις υποθετικού κειμένου: το LLM ενδέχεται να εισάγει πραγματολογικά σφάλματα· η «αγκύρωση» μέσω encoder και σώματος κειμένων μειώνει τον κίνδυνο, αλλά δεν τον εξαλείφει πλήρως[42].
- Τομεακοί/γλωσσικοί περιορισμοί: το όφελος του HyDE μειώνεται σε εξειδικευμένους τομείς και σε γλώσσες με χαμηλούς πόρους[43].
- Λανθάνουσα και κόστος: η γένεση LLM προσθέτει καθυστέρηση και κόστος token· είναι κρίσιμο για σενάρια πραγματικού χρόνου και μεγάλα «υποθετικά»[44].
- Ηθική και μεροληψίες: συνιστάται η χρήση ασφαλών LLM και η εφαρμογή φιλτραρίσματος[45].
Συγκριτικός πίνακας μεθόδων
| Μέθοδος | Κλάση | Πού παράγεται το κείμενο | Encoder/δείκτης | Επαναταξινομητής (2ο στάδιο) | Τυπικές μετρικές (παράδειγμα) | Κόστος/λανθάνουσα | Πηγές |
|---|---|---|---|---|---|---|---|
| HyDE | Query→hypo‑doc | Πλευρά ερωτήματος (LLM → παράγραφος) | (m)Contriever; ANN | BERT re‑rank / ColBERT / RRF | DL19 nDCG@10≈61.3; DL20≈57.9; ArguAna nDCG@10≈46.6 | + γένεση LLM; + επαναταξινόμηση (προαιρ.) | [46] |
| BM25 | Λεξικός | — | Ανεστραμμένος δείκτης | Προαιρετικά | βλ. πίν. (ανωτ.) | Χαμηλό (λεξικό) | [47] |
| DPR / ANCE | Πυκνός (ft) | — | Bi‑encoder; ANN | Προαιρετικά | DL19 nDCG@10≈62–65 | Μέτριο (χωρίς LLM) | [48][49] |
| doc2query / docTTTTTquery | Επέκταση εγγράφου | Πλευρά συλλογής (πριν την ευρετηρίαση) | BM25/sparse+expanded | Προαιρετικά | Βελτιώσεις BM25 στο MS MARCO | Υψηλή offline γένεση· γρήγορο online | [50][51] |
| PRF (Rocchio, RLM) | QE βάσει ανατροφοδότησης | Ερώτημα (βάσει κορυφ. αποτελ.) | Οποιοσδήποτε | Προαιρετικά | Αύξηση Recall/κίνδυνοι απόκλισης | + επιπλέον πέρασμα retrieval | [52] |
Δείτε επίσης
- BM25
- Αναζήτηση με διανυσματικές αναπαραστάσεις,
- RAG
- Ψευδο-συναφής ανατροφοδότηση
- BEIR
Βιβλιογραφία
- Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
- Robertson, S.; Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in IR, 3(4), 333–389. DOI:10.1561/1500000019.
Σύνδεσμοι
- Αποθετήριο HyDE: github.com/texttron/hyde.
- Τεκμηρίωση: Haystack — HyDE: docs.haystack.deepset.ai.
- Τεκμηρίωση: LangChain — HyDE Retriever: docs.langchain.com.
Σημειώσεις
- ↑ Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023. pp. 1762–1777. DOI:10.18653/v1/2023.acl-long.99. arXiv:2212.10496
- ↑ Gao, L. et al. (2023). ACL 2023, §3.2. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Rocchio, J. (1971). ‘‘Relevance Feedback in Information Retrieval’’. In: Salton, G. (ed.) The SMART Retrieval System. Prentice‑Hall, pp. 313–323. ISBN 978‑0138145255.
- ↑ Lavrenko, V.; Croft, W. B. (2001). ‘‘Relevance‑Based Language Models’’. SIGIR. DOI:10.1145/383952.383972.
- ↑ Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning’’. arXiv:2112.09118.
- ↑ Karpukhin, V. et al. (2020). ‘‘Dense Passage Retrieval for Open‑Domain QA’’. EMNLP. DOI:10.18653/v1/2020.emnlp-main.550.
- ↑ Thakur, N. et al. (2021). ‘‘BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of Information Retrieval Models’’. NeurIPS Datasets Track. arXiv:2104.08663.
- ↑ Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
- ↑ Milvus Docs. ‘‘Similarity Metrics’’ — при L2‑нормализации векторов внутр. произведение эквивалентно косинусу. URL: https://milvus.io/docs/v2.2.x/metric.md
- ↑ Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023, §3–4. arXiv:2212.10496. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever)’’. arXiv:2112.09118.
- ↑ Gao, L. et al. (2023). Прил. (ablation): влияние числа гипотетических текстов и параметров генерации. arXiv:2212.10496.
- ↑ Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
- ↑ Nogueira, R. et al. (2019). ‘‘Document Expansion by Query Prediction’’ (doc2query). arXiv:1904.08375.
- ↑ Nogueira, R.; Lin, J. (2019). ‘‘From doc2query to docTTTTTquery’’ (tech report). PDF
- ↑ Rocchio, J. (1971); Lavrenko & Croft (2001), см. выше.
- ↑ Nogueira, R.; Cho, K. (2019). ‘‘Passage Re‑ranking with BERT’’. arXiv:1901.04085.
- ↑ Khattab, O.; Zaharia, M. (2020). ‘‘ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT’’. SIGIR. DOI:10.1145/3397271.3401075; arXiv:2004.12832.
- ↑ Cormack, G. V.; Clarke, C. L. A.; Büttcher, S. (2009). ‘‘Reciprocal Rank Fusion Outperforms Condorcet and Nearly Optimally Combines Rankings’’. SIGIR. DOI:10.1145/1571941.1572114.
- ↑ Gao, L. et al. (2023). Табл. 1. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Izacard, G. et al. (2022); сводные метрики — в Gao et al., 2023, табл. 1. arXiv:2112.09118.
- ↑ Gao, L. et al. (2023). Табл. 1.
- ↑ Karpukhin, V. et al. (2020); сводные — в Gao et al., 2023.
- ↑ Xiong, L. et al. (2021). ICLR. arXiv:2007.00808.
- ↑ Thakur, N. et al. (2021); сводные — в Gao et al., 2023, табл. 2. arXiv:2104.08663.
- ↑ Izacard, G. et al. (2022); сводные — в Gao et al., 2023, табл. 2.
- ↑ Gao, L. et al. (2023). Табл. 2.
- ↑ Gao, L. et al. (2023). Табл. 3. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Gao, L. et al. (2023). §4–5.
- ↑ Gao, L. et al. (2023). §4.2–4.3.
- ↑ Gao, L. et al. (2023). §4.1.
- ↑ Haystack Docs. ‘‘Hypothetical Document Embeddings (HyDE)’’ (инженерная справка). docs.haystack.deepset.ai
- ↑ Gao, L. et al. (2023). Табл. 6.
- ↑ Milvus Docs. ‘‘Similarity Metrics’’.
- ↑ Haystack × Milvus Integration (официальная док.). haystack.deepset.ai
- ↑ Nogueira, R.; Cho, K. (2019). arXiv:1901.04085.
- ↑ Khattab, O.; Zaharia, M. (2020). DOI:10.1145/3397271.3401075.
- ↑ Cormack, G. V. et al. (2009). DOI:10.1145/1571941.1572114.
- ↑ Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge Univ. Press. ISBN 978‑0521865715.
- ↑ Es, S. et al. (2023). ‘‘RAGAS: Automated Evaluation of Retrieval‑Augmented Generation’’. arXiv:2309.15217.
- ↑ Gao, L. et al. (2023). §5.
- ↑ Gao, L. et al. (2023). §3.2; §4.1. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Gao, L. et al. (2023). Табл. 3; §4.4.
- ↑ Gao, L. et al. (2023). §4–5.
- ↑ Ouyang, L. et al. (2022). ‘‘Training language models to follow instructions with human feedback (InstructGPT)’’. NeurIPS. arXiv:2203.02155.
- ↑ Gao, L. et al. (2023). Табл. 1–2.
- ↑ Robertson, S.; Zaragoza, H. (2009). ‘‘The Probabilistic Relevance Framework: BM25 and Beyond’’. Found. Trends IR. DOI:10.1561/1500000019.
- ↑ Karpukhin, V. et al. (2020). DOI:10.18653/v1/2020.emnlp-main.550.
- ↑ Xiong, L. et al. (2021). arXiv:2007.00808.
- ↑ Nogueira, R. et al. (2019). arXiv:1904.08375.
- ↑ Nogueira, R.; Lin, J. (2019). tech report.
- ↑ Rocchio, J. (1971). SMART; Lavrenko & Croft (2001) SIGIR.