Hybrid retrieval (EL)

From Systems analysis Wiki
Jump to navigation Jump to search

Hybrid Retrieval (υβριδική ανάκτηση) — κατηγορία μεθόδων ανάκτησης πληροφοριών, στις οποίες συνδυάζονται λεξικά (sparse) και σημασιολογικά (dense/late‑interaction) σήματα για την αύξηση της πληρότητας και της ακρίβειας των αποτελεσμάτων. Τα υβριδικά σχήματα συνδυάζουν τα πλεονεκτήματα της ακριβούς αντιστοίχισης όρων (BM25/TF-IDF) και της διανυσματικής ομοιότητας (bi-encoders, μοντέλα late interaction πολλαπλών διανυσμάτων), ενώ αξιοποιούν ανθεκτικές σε ανομοιόμορφες κλίμακες βαθμολόγησης μεθόδους συγχώνευσης κατατάξεων (π.χ. Reciprocal Rank Fusion, CombSUM/CombMNZ) και επανακατάταξη με cross‑encoders.[1][2][3]

Ορισμός και κίνητρο

Η υβριδική ανάκτηση είναι παράλληλη ή διαδοχική αναζήτηση μέσω δύο (ή περισσότερων) ανεξάρτητων καναλιών σημάτων με επακόλουθη συγχώνευση και/ή επανακατάταξη. Τυπικά κίνητρα: (i) υπέρβαση του «λεξικολογικού χάσματος» (συνώνυμα, αναδιατυπώσεις), (ii) ανθεκτικότητα σε ορθογραφικά λάθη/μορφολογία, (iii) ανάκτηση ειδικών κωδικών/αναγνωριστικών (όπου το sparse μοντέλο υπερέχει), (iv) μεταφορά σε νέους τομείς/γλώσσες (όπου τα dense μοντέλα παρέχουν σημασιολογική γενίκευση).[4][5][6]

Συστατικά της υβριδικής αναζήτησης

Λεξικό (sparse)

  • Κλασικά μοντέλα. TF-IDF και BM25/BM25F — τυπικές βασικές μέθοδοι βασισμένες σε ανεστραμμένους δείκτες· το BM25 θεμελιώνεται σε πιθανοτικό πλαίσιο PRF και χρησιμοποιείται ευρέως ως πρώτο στάδιο κατάταξης.[7]
  • Εκπαιδεύσιμα sparse μοντέλα.
    • SPLADE / SPLADE++/v3. Νευρωνικό sparse μοντέλο που εκπαιδεύει επέκταση και στάθμιση όρων μέσω MLM‑κεφαλής με κανονικοποίηση αραιότητας· εμφανίζει ισχυρά αποτελέσματα και καλή μεταφερσιμότητα (BEIR).[8][9][10]
    • uniCOIL/COIL. Πλαισιοποιημένες ανεστραμμένες λίστες και η απλοποιημένη εκδοχή τους uniCOIL· συμβατές με κλασικούς ανεστραμμένους δείκτες.[11]

Σημασιολογικό (dense/late‑interaction)

  • Bi‑encoder (μονό διάνυσμα). Το ερώτημα και το έγγραφο κωδικοποιούνται από διανυσματικά μοντέλα, η ομοιότητα υπολογίζεται με dot‑product/MIPS. Παραδείγματα: DPR,[12] ANCE,[13] Contriever,[14] GTR,[15] E5.[16]
  • Late‑interaction (πολλαπλά διανύσματα). Μοντελοποιούν αντιστοιχίες σε επίπεδο token κατά την «καθυστερημένη» αλληλεπίδραση: ColBERT/ColBERTv2· ο συμβιβασμός — καλύτερη ακρίβεια με μεγαλύτερο δείκτη/λανθάνοντα χρόνο, που ελαφρύνεται από μηχανικά εργαλεία (PLAID, WARP).[17][18][19]

Σχήματα υβριδοποίησης και συγχώνευσης κατατάξεων

  • Παράλληλη αναζήτηση και ένωση υποψηφίων. Λαμβάνουμε ανεξάρτητα λίστες υποψηφίων (sparse και dense) με τις εσωτερικές βαθμολογίες τους· στη συνέχεια — συγχώνευση κατατάξεων.[20]
  • RRF (Reciprocal Rank Fusion). Τεχνική ανθεκτική σε μη συγκρίσιμες κλίμακες βαθμολόγησης, που αθροίζει αντίστροφες κατατάξεις:

RRF(d)=i=1m1k+ranki(d), όπου συνήθως k60.[21] Υποστηρίζεται σε βιομηχανικές μηχανές αναζήτησης (Elasticsearch/OpenSearch) ως ενσωματωμένος ανακτητής/επεξεργαστής.[22][23]

  • CombSUM/CombMNZ και άλλα. Κλασικές συναρτήσεις «άθροισης βαθμολογιών» (με κανονικοποίηση εφόσον απαιτείται).[24][25][26]
  • Σταθμισμένος γραμμικός συνδυασμός.

S(d)=αSsparse(d)+(1α)Sdense(d), α[0,1]. Η επιλογή α μπορεί να είναι σταθερή ή εκπαιδεύσιμη (ανά συλλογή/ανά ερώτημα).[27]

  • Κανονικοποίηση βαθμολογιών. Για CombSUM/CombMNZ χρησιμοποιούνται συχνά min‑max, z‑score κ.ά. για εναρμόνιση κλιμάκων·[28] εναλλακτικά, το RRF βασίζεται αποκλειστικά σε κατατάξεις.
  • Δυναμική/προσαρμοστική στάθμιση. Δρομολόγηση ερωτημάτων (query routing), χαρακτηριστικά ερωτήματος και μοντέλα LTR για επιλογή/βάρος καναλιών· σύγχρονες εργασίες δείχνουν ότι ένας απλός εκπαιδευμένος συνδυασμός συχνά υπερτερεί του RRF και είναι ελάχιστα ευαίσθητος στην κανονικοποίηση.[29]

Επανακατάταξη και πολυσταδιακά pipelines

Τα υβριδικά συστήματα δομούνται συνήθως ως retrieval → fusion → rerank. Για την επανακατάταξη χρησιμοποιούνται:

  • Cross‑encoders (BERT/T5). Οι πιο ακριβείς, αλλά απαιτητικοί υπολογιστικά: MonoBERT/MonoT5 για επαναδιάταξη των κορυφαίων N υποψηφίων.[30][31]
  • Late‑interaction ως επανακατατακτής. Η οικογένεια ColBERT μπορεί να λειτουργεί και ως επανακατατακτής· σύγχρονοι επιταχυντές (PLAID, WARP) μειώνουν τον λανθάνοντα χρόνο χωρίς απώλεια ποιότητας.[32][33]

Ο συμβιβασμός ποιότητα ↔ λανθάνων χρόνος/κόστος είναι ιδιαίτερα σημαντικός στο RAG και σε αυστηρά SLA (βλ. ουραίες καθυστερήσεις p95/p99).[34]

Αξιολόγηση σε benchmarks

  • BEIR. Ενοποιημένο σύνολο από ετερογενείς συλλογές/εργασίες για αξιολόγηση ανακτητών σε zero‑/out‑of‑domain συνθήκες (π.χ. TREC‑COVID, NFCorpus, NQ, HotpotQA, FiQA‑2018, DBPedia‑entity, ArguAna, Webis‑Touché‑2020, FEVER/Climate‑FEVER, Scidocs, SciFact, CQADupStack κ.ά.).[35]
  • TREC Deep Learning / MS MARCO. Κλασικοί πόροι για εκπαίδευση/αξιολόγηση ανακτητών και επανακατατακτών σε καθεστώς μεγάλων δεδομένων.[36][37][38]
  • Μετρικές ποιότητας. nDCG@k, Recall@k, MRR· για επιδόσεις — latency p50/p95/p99, QPS· για λειτουργία — μνήμη/κόστος (CPU/GPU, δείκτης).[39][40]
  • Ablations. Συνιστάται η καταγραφή της συνεισφοράς κάθε καναλιού/βάρους και της ευαισθησίας στις παραμέτρους k στο RRF και α στον συνδυασμό· αξιολόγηση ανθεκτικότητας σε αναδιατυπώσεις και OOD μετατοπίσεις.[41][42]

Μηχανικές πτυχές και πρακτικές παραγωγής

  • Δείκτες και ANN. FAISS (Flat/HNSW/IVF‑PQ), HNSW, ScaNN για MIPS/κοσινική ομοιότητα.[43][44][45]
  • Στοίβα IR. Lucene/Anserini/Pyserini για sparse/dense και υβριδικά pipelines· «αναπαραγωγιμότητα δύο κλικ» στο BEIR.[46][47]
  • Διανυσματικές βάσεις δεδομένων και μηχανές αναζήτησης. Qdrant, Weaviate, pgvector/PostgreSQL, Vespa, Elasticsearch/OpenSearch διαθέτουν εγγενείς λειτουργίες υβριδικής αναζήτησης (BM25F+vector) και/ή RRF/γραμμικό συνδυασμό.[48][49][50][51][52]
  • Μοτίβο RAG. Αρχιτεκτονική: retrieval → fusion → rerank → πλαίσιο LLM με περιορισμό token και ιχνηλασιμότητα πηγών.[53]
  • Ενημέρωση δεικτών, αποκαθήλωση διπλοτύπων, tokenization. Είναι σημαντική η εναρμόνιση της tokenization μεταξύ BM25 και του διανυσματοποιητή· βαθμονόμηση βαθμολογιών (κανονικοποίηση/κλιμάκωση) πριν τον συνδυασμό.[54]

Περιορισμοί και ανοιχτά ζητήματα

  • Μεταφερσιμότητα και πολυγλωσσία. Τα dense μοντέλα (GTR/E5) βελτιώνουν τη μεταφορά, αλλά είναι ευαίσθητα στον τομέα/γλώσσα· τα sparse μοντέλα (SPLADE) είναι συχνά πιο ανθεκτικά σε OOD συνθήκες.[55][56]
  • Ενσωμάτωση με LLM και παραισθήσεις. Η υβριδική ανάκτηση μειώνει τις παραλείψεις και τον θόρυβο στα πλαίσια RAG, αλλά δεν εξαλείφει πλήρως τις παραισθήσεις· απαιτούνται αυστηροί επανακατατακτές και φιλτράρισμα πηγών.[57]
  • Κόστος και απόρρητο. Αποθήκευση πολυδιανυσματικών δεικτών, συμπίεση, κρυπτογράφηση και on‑prem στοίβα· αξιολόγηση TCO.
  • Τάσεις. HyDE/doc2query/PRF ως επέκταση εγγράφων/ερωτημάτων·[58][59] εκπαίδευση συνδυασμού (per‑query α), αποδοτικότερο late‑interaction (PLAID/WARP), μεγάλα έγγραφα και πολυδιανυσματικοί δείκτες.[60][61]

Συγκριτικός πίνακας μεθόδων

Από τις 2025‑09‑10 (παράδειγμα στη συλλογή BEIR trec‑covid· nDCG@10 / Recall@100):[62]

Σύγκριση μεθόδων στο trec‑covid
Μέθοδος Τύπος (sparse/dense/hybrid) Ιδέα/μοντέλο Σχήμα συγχώνευσης Επανακατατακτής nDCG@10 / R@100 Latency (σχετική) Πηγές
BM25 sparse Ακριβής αντιστοίχιση όρων (PRF/BM25) 0.595 / 0.109 πολύ χαμηλή [63][64]
SPLADE++ (ED) sparse (learned) Αραιή επέκταση/στάθμιση όρων 0.727 / 0.128 χαμηλή–μέτρια [65][66]
Contriever (MS MARCO FT) dense Bi-encoder αντιθετικής εκπαίδευσης 0.596 / 0.091 μέτρια [67][68]
BGE‑base‑en‑v1.5 dense Ισχυρό γενικής χρήσης embedding μοντέλο 0.781 / 0.141 μέτρια [69]
Cohere embed‑english‑v3.0 dense Βιομηχανικό μοντέλο κειμενικού embedding 0.818 / 0.159 μέτρια [70]
BM25 + dense (παράδειγμα: BM25+BGE) hybrid Παράλληλη ανάκτηση + συγχώνευση λιστών RRF (k≈60) ή σταθμισμένος συνδυασμός προαιρ.: MonoT5/ColBERT (ποικίλλει ανά υλοποίηση· συνήθως > καλύτερο μεμονωμένο κανάλι) μέτρια [71][72][73]

Σημείωση: η τελευταία σειρά απεικονίζει το σχήμα· οι ακριβείς τιμές εξαρτώνται από την επιλογή embedding μοντέλου, την κανονικοποίηση και τις παραμέτρους συγχώνευσης (βλ. πηγές και αναπαραγώγιμα scripts Pyserini).

Βιβλιογραφία

  • Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
  • Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval 3(4):333–389. DOI:10.1561/1500000019.
  • Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR. SIGIR.
  • Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  • Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.

Σύνδεσμοι

  • Pyserini / Anserini: github.com/castorini/pyserini • github.com/castorini/anserini
  • FAISS: arXiv:1702.08734
  • Weaviate (Hybrid search): docs.weaviate.io/weaviate/search/hybrid
  • pgvector: github.com/pgvector/pgvector
  • Vespa (Hybrid search tutorial): docs.vespa.ai/en/tutorials/hybrid-search.html

Σημειώσεις

  1. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval, 3(4), 333–389. DOI:10.1561/1500000019.
  2. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods. SIGIR 2009, 758–759. PDF.
  3. Bruch, S., Gai, S., Ingber, A. (2023). An Analysis of Fusion Functions for Hybrid Retrieval. ACM TOIS 42(1):1–35. DOI:10.1145/3596512 • arXiv:2210.11934.
  4. Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715 (см. главы о TF‑IDF, оценке и проблеме vocabulary mismatch).
  5. Izacard, G. et al. (2022). Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever). TACL 10:1089–1108. arXiv:2112.09118.
  6. Wang, L. et al. (2022/2024). Text Embeddings by Weakly‑Supervised Contrastive Pre‑training (E5). arXiv:2212.03533.
  7. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. DOI:10.1561/1500000019.
  8. Formal, T., Piwowarski, B., Clinchant, S. (2021). SPLADE: Sparse Lexical and Expansion Model for First Stage Ranking. arXiv:2107.05720.
  9. Formal, T. et al. (2022). Making Sparse Neural IR Models More Effective. Findings of EMNLP. arXiv:2205.04733.
  10. Formal, T. et al. (2024). SPLADE‑v3: New baselines for SPLADE. arXiv:2403.06789.
  11. Lin, J., Ma, X. (2021). A Few Brief Notes on DeepImpact, COIL, and uniCOIL. arXiv:2106.14807.
  12. Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open‑Domain QA. EMNLP. arXiv:2004.04906.
  13. Xiong, L. et al. (2021). Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval (ANCE). ICLR. arXiv:2007.00808.
  14. Izacard, G. et al. (2022). TACL. arXiv:2112.09118.
  15. Ni, J. et al. (2021/2022). Large Dual Encoders Are Generalizable Retrievers (GTR). EMNLP. arXiv:2112.07899.
  16. Wang, L. et al. (2022/2024). arXiv:2212.03533.
  17. Khattab, O., Zaharia, M. (2020). ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT. SIGIR. arXiv:2004.12832.
  18. Santhanam, K. et al. (2022). ColBERTv2 & PLAID. NAACL/ArXiv. arXiv:2112.01488; arXiv:2205.09707.
  19. Scheerer, J.L. et al. (2025). WARP: An Efficient Engine for Multi‑Vector Retrieval. arXiv:2501.17788.
  20. Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR with Sparse and Dense Representations. SIGIR. PDF.
  21. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). SIGIR. PDF.
  22. Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../reciprocal-rank-fusion.
  23. OpenSearch Docs. Score ranker processor (RRF). (доступ 2025‑09‑10). docs.opensearch.org/.../score-ranker-processor/.
  24. Fox, E.A., Shaw, J.A. (1994). Combination of Multiple Searches. TREC‑2, NIST SP 500‑215, 243–252. PDF.
  25. Lee, J.H. (1997). Analyses of Multiple Evidence Combination. SIGIR, 267–276. DOI:10.1145/258525.258587.
  26. Hsu, D.F., Taksa, I. (2005). Comparing Rank and Score Combination Methods for Data Fusion in IR. (Tech. report). PDF.
  27. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  28. Hsu, D.F., Taksa, I. (2005). см. выше.
  29. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  30. Nogueira, R., Cho, K. (2019). Passage Re‑ranking with BERT. arXiv:1901.04085.
  31. Nogueira, R., Jiang, Z., Lin, J. (2020). Document Ranking with a Pretrained Sequence‑to‑Sequence Model (MonoT5). Findings of EMNLP. arXiv:2003.06713.
  32. Santhanam, K. et al. (2022). arXiv:2205.09707.
  33. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  34. Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.
  35. Thakur, N. et al. (2021). BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of IR Models. NeurIPS Datasets & Benchmarks. arXiv:2104.08663.
  36. Craswell, N. et al. (2020). Overview of the TREC 2019 Deep Learning Track. arXiv:2003.07820.
  37. Craswell, N. et al. (2021). Overview of the TREC 2020 Deep Learning Track. arXiv:2102.07662.
  38. Bajaj, P. et al. (2016). MS MARCO: A Human Generated MAchine Reading COmprehension Dataset. arXiv:1611.09268.
  39. Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  40. Dean, J., Barroso, L.A. (2013). CACM. DOI:10.1145/2408776.2408794.
  41. Bruch, S. et al. (2023). DOI:10.1145/3596512.
  42. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  43. Johnson, J., Douze, M., Jégou, H. (2017). Billion‑scale Similarity Search with GPUs (FAISS). arXiv:1702.08734.
  44. Malkov, Y., Yashunin, D. (2020). HNSW. IEEE TPAMI 42(4):824–836. DOI:10.1109/TPAMI.2018.2889473.
  45. Guo, R. et al. (2020). ScaNN: Efficient Vector Similarity Search at Scale. arXiv:1908.10396.
  46. Yang, P., Fang, H., Lin, J. (2018). Anserini: Reproducible IR Research with Lucene. JDIQ 10(4):1–20. DOI:10.1145/3239571.
  47. Lin, J. et al. (2021). SIGIR. PDF.
  48. Qdrant Docs. Hybrid queries (RRF, DBSF). (доступ 2025‑09‑10). qdrant.tech/.../hybrid-queries/.
  49. Weaviate Docs. Hybrid search. (доступ 2025‑09‑10). docs.weaviate.io/weaviate/search/hybrid.
  50. pgvector GitHub. (доступ 2025‑09‑10). github.com/pgvector/pgvector.
  51. Vespa Docs. Hybrid Text Search Tutorial. (доступ 2025‑09‑10). docs.vespa.ai/.../hybrid-search.html.
  52. Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../rrf.
  53. Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  54. Hsu, D.F., Taksa, I. (2005). см. выше.
  55. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  56. Formal, T. et al. (2021, 2022, 2024). arXiv:2107.05720; 2205.04733; 2403.06789.
  57. Lewis, P. et al. (2020). arXiv:2005.11401.
  58. Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL. arXiv:2212.10496.
  59. Nogueira, R. et al. (2019). Document Expansion by Query Prediction. arXiv:1904.08375; docTTTTTquery. PDF.
  60. Santhanam, K. et al. (2022). arXiv:2205.09707.
  61. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  62. Pyserini BEIR Regressions (доступ 2025‑09‑10): результаты по trec‑covid для BM25/SPLADE/Contriever/BGE/Cohere. castorini.github.io/pyserini/2cr/beir.html.
  63. Robertson, S., Zaragoza, H. (2009). DOI:10.1561/1500000019.
  64. Pyserini BEIR. См. ссылку выше.
  65. Formal, T. et al. (2021, 2022). arXiv:2107.05720; 2205.04733.
  66. Pyserini BEIR.
  67. Izacard, G. et al. (2022). arXiv:2112.09118.
  68. Pyserini BEIR.
  69. Pyserini BEIR.
  70. Pyserini BEIR.
  71. Cormack et al. (2009). SIGIR. RRF.
  72. Bruch et al. (2023). TOIS.
  73. Elastic/OpenSearch RRF Docs.