Hybrid retrieval (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

Hybrid Retrieval (hybride retrieval) — een klasse van methoden voor informatieretrieval waarbij lexicale (sparse) en semantische (dense/late‑interaction) signalen worden gecombineerd om de volledigheid en nauwkeurigheid van de resultaten te verbeteren. Hybride schema's combineren de voordelen van exacte termmatch (BM25/TF-IDF) en vectorgelijkenis (bi-encoders, modellen met late interactie), en maken gebruik van rankingfusiemethoden die bestand zijn tegen score-schaalverschillen (zoals Reciprocal Rank Fusion, CombSUM/CombMNZ) en herrangschikking door cross‑encoders.[1][2][3]

Definitie en motivatie

Hybride retrieval is een parallelle of cascadegewijze zoekopdracht via twee (of meer) onafhankelijke signaalkanalen, gevolgd door fusie en/of herrangschikking. Typische motivaties: (i) overbruggen van de «terminologische kloof» (synoniemen, herformuleringen), (ii) robuustheid tegen typefouten/morfologie, (iii) ophalen van specifieke codes/identificatoren (waar het sparse‑model sterk is), (iv) overdracht naar nieuwe domeinen/talen (waar dense‑modellen semantische generalisatie bieden).[4][5][6]

Componenten van hybride zoekopdrachten

Lexicaal (sparse)

  • Klassieke modellen. TF-IDF en BM25/BM25F — standaard basismethoden op omgekeerde indexen; BM25 is onderbouwd binnen het probabilistische PRF‑kader en wordt breed ingezet als eerste rangschikkingsstap.[7]
  • Aangeleerde sparse.
    • SPLADE / SPLADE++/v3. Een neurale sparse model dat termuitbreiding en -weging aanleert via een MLM‑kop met schaarsheidsregularisatie; toont sterke resultaten en goede overdraagbaarheid (BEIR).[8][9][10]
    • uniCOIL/COIL. Gecontextualiseerde omgekeerde lijsten en hun vereenvoudigde variant uniCOIL; compatibel met klassieke omgekeerde indexen.[11]

Semantisch (dense/late‑interaction)

  • Bi‑encoder (enkelvoudige vector). De zoekopdracht en het document worden gecodeerd door vectormodellen; gelijkenis wordt bepaald via dot‑product/MIPS. Voorbeelden: DPR,[12] ANCE,[13] Contriever,[14] GTR,[15] E5.[16]
  • Late‑interaction (meervoudige vector). Modelleert overeenkomsten op tokenniveau via «late» interactie: ColBERT/ColBERTv2; de afweging — betere nauwkeurigheid bij grotere index/latentie — wordt verzacht door engineeringoplossingen (PLAID, WARP).[17][18][19]

Schema's voor hybridisatie en rankingfusie

  • Parallelle zoekopdracht en samenvoeging van kandidaten. Onafhankelijk worden kandidatenlijsten (sparse en dense) verkregen met hun interne scores; vervolgens vindt rankingfusie plaats.[20]
  • RRF (Reciprocal Rank Fusion). Een techniek die robuust is tegen onvergelijkbare rangschikkingsscores en reciproke rangen optelt:

RRF(d)=i=1m1k+ranki(d), waarbij doorgaans k60.[21] Wordt ondersteund in productiesystemen (Elasticsearch/OpenSearch) als ingebouwde retriever/processor.[22][23]

  • CombSUM/CombMNZ en andere. Klassieke functies voor «scoreoptelling» (indien nodig met normalisatie).[24][25][26]
  • Gewogen lineaire combinatie.

S(d)=αSsparse(d)+(1α)Sdense(d), α[0,1]. De keuze van α kan vast of aangeleerd zijn (per collectie/per zoekopdracht).[27]

  • Scorenormalisatie. Voor CombSUM/CombMNZ worden vaak min‑max, z‑score en andere methoden toegepast om schalen te harmoniseren;[28] als alternatief vertrouwt RRF uitsluitend op rangen.
  • Dynamische/adaptieve weging. Zoekopdrachtroutering (query routing), kenmerken van de zoekopdracht en LTR‑modellen voor kanaalselektie/-weging; recente studies tonen aan dat een eenvoudige aangeleerde combinatie RRF vaak overtreft en weinig gevoelig is voor normalisatie.[29]

Herrangschikking en meerfasige pipelines

Hybride systemen worden doorgaans opgebouwd als retrieval → fusion → rerank. Voor herrangschikking worden toegepast:

  • Cross‑encoders (BERT/T5). De nauwkeurigste maar kostbaarste aanpak: MonoBERT/MonoT5 voor het herordenen van de top‑N kandidaten.[30][31]
  • Late‑interaction als reranker. De ColBERT‑familie kan ook als reranker fungeren; moderne versnellers (PLAID, WARP) verlagen de latentie zonder kwaliteitsverlies.[32][33]

De afweging kwaliteit ↔ latentie/kosten is bijzonder relevant bij RAG en strikte SLA (zie staartvertragingen p95/p99).[34]

Evaluatie op benchmarks

  • BEIR. Een uniforme verzameling van heterogene collecties/taken voor zero‑/out‑of‑domain evaluatie van retrievers (bijv. TREC‑COVID, NFCorpus, NQ, HotpotQA, FiQA‑2018, DBPedia‑entity, ArguAna, Webis‑Touché‑2020, FEVER/Climate‑FEVER, Scidocs, SciFact, CQADupStack, e.a.).[35]
  • TREC Deep Learning / MS MARCO. Klassieke bronnen voor training/evaluatie van retrievers en rerankers in grootschalige regime.[36][37][38]
  • Kwaliteitsmetrieken. nDCG@k, Recall@k, MRR; voor prestaties — latentie p50/p95/p99, QPS; voor exploitatie — geheugen/kosten (CPU/GPU, index).[39][40]
  • Ablatiestudies. Aanbevolen wordt de bijdrage van elk kanaal/gewicht vast te leggen en de gevoeligheid voor de parameters k in RRF en α in de combinatie te analyseren; robuustheid voor herformuleringen en OOD‑verschuivingen te beoordelen.[41][42]

Engineeringaspecten en productiepraktijken

  • Indexen en ANN. FAISS (Flat/HNSW/IVF‑PQ), HNSW, ScaNN voor MIPS/cosinus­gelijkenis.[43][44][45]
  • IR‑stack. Lucene/Anserini/Pyserini voor sparse/dense en hybride pipelines; «twee-knoppen»-reproduceerbaarheid op BEIR.[46][47]
  • Vectordatabases en zoekmachines. Qdrant, Weaviate, pgvector/PostgreSQL, Vespa, Elasticsearch/OpenSearch beschikken over native modi voor hybride zoekopdrachten (BM25F+vector) en/of RRF/lineaire combinatie.[48][49][50][51][52]
  • RAG‑patroon. Architectuur: retrieval → fusion → rerank → context LLM met tokenlimiet en bronverwijzing.[53]
  • Indexupdates, deduplicatie, tokenisatie. Belangrijk is de tokenisatie tussen BM25 en de vectorizer te harmoniseren; kalibratie van scores (normalisatie/schaling) vóór combinatie.[54]

Beperkingen en open vraagstukken

  • Overdraagbaarheid en meertaligheid. Dense‑modellen (GTR/E5) verbeteren de overdracht, maar zijn gevoelig voor domein/taal; sparse‑modellen (SPLADE) zijn op OOD vaak robuuster.[55][56]
  • Integratie met LLM en hallucinaties. Hybride retrieval vermindert omissies en ruis in RAG‑contexten, maar elimineert hallucinaties niet volledig; strikte rerankers en bronfiltring zijn noodzakelijk.[57]
  • Kosten en privacy. Opslag van multi‑vector indexen, compressie, versleuteling en on‑prem stack; TCO‑beoordeling.
  • Trends. HyDE/doc2query/PRF als document-/zoekopdracht­uitbreiding;[58][59] training van combinaties (per‑query α), efficiëntere late‑interaction (PLAID/WARP), lange documenten en multivectorindexen.[60][61]

Vergelijkingstabel van methoden

Per 2025‑09‑10 (voorbeeld op de BEIR‑collectie trec‑covid; nDCG@10 / Recall@100):[62]

Vergelijking van methoden op trec‑covid
Methode Type (sparse/dense/hybrid) Idee/model Fusieschema Reranker nDCG@10 / R@100 Latentie (rel.) Bronnen
BM25 sparse Exacte termmatch (PRF/BM25) 0.595 / 0.109 zeer laag [63][64]
SPLADE++ (ED) sparse (aangeleerd) Schaarse termuitbreiding/-weging 0.727 / 0.128 laag–gemiddeld [65][66]
Contriever (MS MARCO FT) dense Bi-encoder met contrastief leren 0.596 / 0.091 gemiddeld [67][68]
BGE‑base‑en‑v1.5 dense Krachtige universele embedder 0.781 / 0.141 gemiddeld [69]
Cohere embed‑english‑v3.0 dense Industrieel tekstembeddingmodel 0.818 / 0.159 gemiddeld [70]
BM25 + dense (voorbeeld: BM25+BGE) hybrid Parallelle retrieval + lijstfusie RRF (k≈60) of gewogen combinatie opt.: MonoT5/ColBERT (varieert per implementatie; doorgaans > beste afzonderlijk kanaal) gemiddeld [71][72][73]

Opmerking: de laatste rij illustreert het schema; de exacte cijfers zijn afhankelijk van de keuze van embedder, normalisatie en fusieparameters (zie bronnen en reproduceerbare Pyserini‑scripts).

Literatuur

  • Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
  • Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval 3(4):333–389. DOI:10.1561/1500000019.
  • Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR. SIGIR.
  • Järvelин, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  • Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.

Verwijzingen

  • Pyserini / Anserini: github.com/castorini/pyserini • github.com/castorini/anserini
  • FAISS: arXiv:1702.08734
  • Weaviate (Hybrid search): docs.weaviate.io/weaviate/search/hybrid
  • pgvector: github.com/pgvector/pgvector
  • Vespa (Hybrid search tutorial): docs.vespa.ai/en/tutorials/hybrid-search.html

Noten

  1. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval, 3(4), 333–389. DOI:10.1561/1500000019.
  2. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods. SIGIR 2009, 758–759. PDF.
  3. Bruch, S., Gai, S., Ingber, A. (2023). An Analysis of Fusion Functions for Hybrid Retrieval. ACM TOIS 42(1):1–35. DOI:10.1145/3596512 • arXiv:2210.11934.
  4. Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715 (см. главы о TF‑IDF, оценке и проблеме vocabulary mismatch).
  5. Izacard, G. et al. (2022). Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever). TACL 10:1089–1108. arXiv:2112.09118.
  6. Wang, L. et al. (2022/2024). Text Embeddings by Weakly‑Supervised Contrastive Pre‑training (E5). arXiv:2212.03533.
  7. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. DOI:10.1561/1500000019.
  8. Formal, T., Piwowarski, B., Clinchant, S. (2021). SPLADE: Sparse Lexical and Expansion Model for First Stage Ranking. arXiv:2107.05720.
  9. Formal, T. et al. (2022). Making Sparse Neural IR Models More Effective. Findings of EMNLP. arXiv:2205.04733.
  10. Formal, T. et al. (2024). SPLADE‑v3: New baselines for SPLADE. arXiv:2403.06789.
  11. Lin, J., Ma, X. (2021). A Few Brief Notes on DeepImpact, COIL, and uniCOIL. arXiv:2106.14807.
  12. Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open‑Domain QA. EMNLP. arXiv:2004.04906.
  13. Xiong, L. et al. (2021). Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval (ANCE). ICLR. arXiv:2007.00808.
  14. Izacard, G. et al. (2022). TACL. arXiv:2112.09118.
  15. Ni, J. et al. (2021/2022). Large Dual Encoders Are Generalizable Retrievers (GTR). EMNLP. arXiv:2112.07899.
  16. Wang, L. et al. (2022/2024). arXiv:2212.03533.
  17. Khattab, O., Zaharia, M. (2020). ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT. SIGIR. arXiv:2004.12832.
  18. Santhanam, K. et al. (2022). ColBERTv2 & PLAID. NAACL/ArXiv. arXiv:2112.01488; arXiv:2205.09707.
  19. Scheerer, J.L. et al. (2025). WARP: An Efficient Engine for Multi‑Vector Retrieval. arXiv:2501.17788.
  20. Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR with Sparse and Dense Representations. SIGIR. PDF.
  21. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). SIGIR. PDF.
  22. Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../reciprocal-rank-fusion.
  23. OpenSearch Docs. Score ranker processor (RRF). (доступ 2025‑09‑10). docs.opensearch.org/.../score-ranker-processor/.
  24. Fox, E.A., Shaw, J.A. (1994). Combination of Multiple Searches. TREC‑2, NIST SP 500‑215, 243–252. PDF.
  25. Lee, J.H. (1997). Analyses of Multiple Evidence Combination. SIGIR, 267–276. DOI:10.1145/258525.258587.
  26. Hsu, D.F., Taksa, I. (2005). Comparing Rank and Score Combination Methods for Data Fusion in IR. (Tech. report). PDF.
  27. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  28. Hsu, D.F., Taksa, I. (2005). см. выше.
  29. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  30. Nogueira, R., Cho, K. (2019). Passage Re‑ranking with BERT. arXiv:1901.04085.
  31. Nogueira, R., Jiang, Z., Lin, J. (2020). Document Ranking with a Pretrained Sequence‑to‑Sequence Model (MonoT5). Findings of EMNLP. arXiv:2003.06713.
  32. Santhanam, K. et al. (2022). arXiv:2205.09707.
  33. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  34. Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.
  35. Thakur, N. et al. (2021). BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of IR Models. NeurIPS Datasets & Benchmarks. arXiv:2104.08663.
  36. Craswell, N. et al. (2020). Overview of the TREC 2019 Deep Learning Track. arXiv:2003.07820.
  37. Craswell, N. et al. (2021). Overview of the TREC 2020 Deep Learning Track. arXiv:2102.07662.
  38. Bajaj, P. et al. (2016). MS MARCO: A Human Generated MAchine Reading COmprehension Dataset. arXiv:1611.09268.
  39. Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  40. Dean, J., Barroso, L.A. (2013). CACM. DOI:10.1145/2408776.2408794.
  41. Bruch, S. et al. (2023). DOI:10.1145/3596512.
  42. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  43. Johnson, J., Douze, M., Jégou, H. (2017). Billion‑scale Similarity Search with GPUs (FAISS). arXiv:1702.08734.
  44. Malkov, Y., Yashunin, D. (2020). HNSW. IEEE TPAMI 42(4):824–836. DOI:10.1109/TPAMI.2018.2889473.
  45. Guo, R. et al. (2020). ScaNN: Efficient Vector Similarity Search at Scale. arXiv:1908.10396.
  46. Yang, P., Fang, H., Lin, J. (2018). Anserini: Reproducible IR Research with Lucene. JDIQ 10(4):1–20. DOI:10.1145/3239571.
  47. Lin, J. et al. (2021). SIGIR. PDF.
  48. Qdrant Docs. Hybrid queries (RRF, DBSF). (доступ 2025‑09‑10). qdrant.tech/.../hybrid-queries/.
  49. Weaviate Docs. Hybrid search. (доступ 2025‑09‑10). docs.weaviate.io/weaviate/search/hybrid.
  50. pgvector GitHub. (доступ 2025‑09‑10). github.com/pgvector/pgvector.
  51. Vespa Docs. Hybrid Text Search Tutorial. (доступ 2025‑09‑10). docs.vespa.ai/.../hybrid-search.html.
  52. Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../rrf.
  53. Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  54. Hsu, D.F., Taksa, I. (2005). см. выше.
  55. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  56. Formal, T. et al. (2021, 2022, 2024). arXiv:2107.05720; 2205.04733; 2403.06789.
  57. Lewis, P. et al. (2020). arXiv:2005.11401.
  58. Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL. arXiv:2212.10496.
  59. Nogueira, R. et al. (2019). Document Expansion by Query Prediction. arXiv:1904.08375; docTTTTTquery. PDF.
  60. Santhanam, K. et al. (2022). arXiv:2205.09707.
  61. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  62. Pyserini BEIR Regressions (доступ 2025‑09‑10): результаты по trec‑covid для BM25/SPLADE/Contriever/BGE/Cohere. castorini.github.io/pyserini/2cr/beir.html.
  63. Robertson, S., Zaragoza, H. (2009). DOI:10.1561/1500000019.
  64. Pyserini BEIR. См. ссылку выше.
  65. Formal, T. et al. (2021, 2022). arXiv:2107.05720; 2205.04733.
  66. Pyserini BEIR.
  67. Izacard, G. et al. (2022). arXiv:2112.09118.
  68. Pyserini BEIR.
  69. Pyserini BEIR.
  70. Pyserini BEIR.
  71. Cormack et al. (2009). SIGIR. RRF.
  72. Bruch et al. (2023). TOIS.
  73. Elastic/OpenSearch RRF Docs.