Hybrid retrieval (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

Hybrid Retrieval (हाइब्रिड रिट्रीव) — सूचना पुनर्प्राप्ति के उन विधियों का वर्ग है जिनमें लेक्सिकल (sparse) और सिमेंटिक (dense/late‑interaction) संकेतों को मिलाकर परिणामों की पूर्णता और सटीकता बढ़ाई जाती है। हाइब्रिड योजनाएँ सटीक शब्द-मिलान (BM25/TF-IDF) और वेक्टर समीपता (bi-encoder, late-interaction मल्टी-मॉडल) के लाभों को संयुक्त करती हैं, तथा असमान स्केल के स्कोरिंग के प्रति स्थिर रैंकिंग-विलय विधियों (जैसे Reciprocal Rank Fusion, CombSUM/CombMNZ) और cross‑encoder द्वारा पुनर्रैंकिंग का भी उपयोग करती हैं।[1][2][3]

परिभाषा और प्रेरणा

हाइब्रिड रिट्रीव एक समानांतर अथवा कास्केड खोज है जो दो (या अधिक) स्वतंत्र संकेत-चैनलों पर की जाती है और उसके बाद विलय और/या पुनर्रैंकिंग की जाती है। सामान्य प्रेरणाएँ: (i) «शब्दावली अंतर» (पर्यायवाची, पुनः-सूत्रण) से उबरना, (ii) वर्तनी-त्रुटियों/रूपविज्ञान के प्रति स्थिरता, (iii) विशिष्ट कोड/पहचानकर्ताओं का निष्कर्षण (जहाँ sparse-मॉडल सशक्त होता है), (iv) नए डोमेन/भाषाओं पर स्थानांतरण (जहाँ dense-मॉडल सिमेंटिक सामान्यीकरण देते हैं)।[4][5][6]

हाइब्रिड खोज के घटक

लेक्सिकल (sparse)

  • क्लासिकल मॉडल। TF-IDF और BM25/BM25F — इनवर्टेड इंडेक्स पर आधारित मानक आधारभूत विधियाँ; BM25 प्रायिकतावादी PRF-ढाँचे में प्रमाणित है और रैंकिंग के प्रथम चरण में व्यापक रूप से उपयोग की जाती है।[7]
  • प्रशिक्षणीय sparse।
    • SPLADE / SPLADE++/v3। एक न्यूरोस्पार्स मॉडल जो MLM-हेड के माध्यम से विरलता-नियमितीकरण के साथ शब्द-विस्तार और भार-निर्धारण सीखता है; मजबूत परिणाम और अच्छी स्थानांतरणीयता (BEIR) दर्शाता है।[8][9][10]
    • uniCOIL/COIL। संदर्भीकृत इनवर्टेड सूचियाँ और उनका सरलीकृत संस्करण uniCOIL; क्लासिकल इनवर्टेड इंडेक्स के साथ संगत।[11]

सिमेंटिक (dense/late‑interaction)

  • Bi‑encoder (single‑vector)। क्वेरी और दस्तावेज़ को वेक्टर-मॉडलों द्वारा एन्कोड किया जाता है, समानता dot‑product/MIPS से मापी जाती है। उदाहरण: DPR,[12] ANCE,[13] Contriever,[14] GTR,[15] E5।[16]
  • Late‑interaction (multi‑vector)। «विलंबित» अंतःक्रिया पर टोकन-स्तरीय मिलान को मॉडल करते हैं: ColBERT/ColBERTv2; समझौता — बड़े इंडेक्स/लेटेंसी पर बेहतर सटीकता, जिसे इंजीनियरिंग ड्राइवरों (PLAID, WARP) द्वारा कम किया जाता है।[17][18][19]

हाइब्रिडीकरण और रैंकिंग-विलय की योजनाएँ

  • समानांतर खोज और उम्मीदवारों का संयोजन। sparse और dense से स्वतंत्र उम्मीदवार-सूचियाँ उनके आंतरिक स्कोरिंग के साथ प्राप्त करें; फिर — रैंकिंग-विलय।[20]
  • RRF (Reciprocal Rank Fusion)। असंगत स्कोरिंग के प्रति स्थिर तकनीक जो व्युत्क्रम रैंकों को जोड़ती है:

RRF(d)=i=1m1k+ranki(d), जहाँ सामान्यतः k60[21] औद्योगिक इंजनों (Elasticsearch/OpenSearch) में अंतर्निहित रिट्रीवर/प्रोसेसर के रूप में समर्थित है।[22][23]

  • CombSUM/CombMNZ आदि। क्लासिकल «स्कोर-योग» फ़ंक्शन (आवश्यकता पर — सामान्यीकरण के साथ)।[24][25][26]
  • भारित रैखिक मिश्रण।

S(d)=αSsparse(d)+(1α)Sdense(d), α[0,1]α का चुनाव स्थिर या प्रशिक्षणीय (संग्रह/क्वेरी के अनुसार) हो सकता है।[27]

  • स्कोरिंग का सामान्यीकरण। CombSUM/CombMNZ के लिए पैमाने के समन्वय हेतु अक्सर min‑max, z‑score आदि लागू किए जाते हैं;[28] वैकल्पिक रूप से RRF केवल रैंकों पर निर्भर करता है।
  • गतिशील/अनुकूली भार-निर्धारण। क्वेरी रूटिंग (query routing), क्वेरी-विशेषताएँ और LTR-मॉडल चैनलों के चयन/भार के लिए; आधुनिक शोध दर्शाते हैं कि सरल प्रशिक्षित मिश्रण अक्सर RRF से बेहतर होता है और सामान्यीकरण के प्रति कम संवेदनशील होता है।[29]

पुनर्रैंकिंग और बहु-चरणीय पाइपलाइन

हाइब्रिड सिस्टम सामान्यतः retrieval → fusion → rerank के रूप में बनाए जाते हैं। पुनर्रैंकिंग के लिए उपयोग किए जाते हैं:

  • Cross‑encoder (BERT/T5)। सबसे सटीक, लेकिन महँगे: शीर्ष-N उम्मीदवारों के पुनः-क्रमण के लिए MonoBERT/MonoT5।[30][31]
  • Late‑interaction पुनर्रैंकर के रूप में। ColBERT-परिवार पुनर्रैंकर के रूप में भी कार्य कर सकता है; आधुनिक त्वरक (PLAID, WARP) गुणवत्ता-हानि के बिना लेटेंसी कम करते हैं।[32][33]

गुणवत्ता ↔ लेटेंसी/लागत का समझौता RAG और सख्त SLA (देखें टेल लेटेंसी p95/p99) में विशेष रूप से महत्वपूर्ण है।[34]

benchmark पर मूल्यांकन

  • BEIR। रिट्रीवर्स के zero‑/out‑of‑domain मूल्यांकन के लिए विविध संग्रहों/कार्यों का एकीकृत सेट (जैसे TREC‑COVID, NFCorpus, NQ, HotpotQA, FiQA‑2018, DBPedia‑entity, ArguAna, Webis‑Touché‑2020, FEVER/Climate‑FEVER, Scidocs, SciFact, CQADupStack आदि)।[35]
  • TREC Deep Learning / MS MARCO। बड़े-डेटा मोड में रिट्रीवर्स और पुनर्रैंकर्स के प्रशिक्षण/मूल्यांकन के लिए क्लासिकल संसाधन।[36][37][38]
  • गुणवत्ता मेट्रिक्स। nDCG@k, Recall@k, MRR; प्रदर्शन के लिए — latency p50/p95/p99, QPS; संचालन के लिए — मेमोरी/लागत (CPU/GPU, इंडेक्स)।[39][40]
  • एब्लेशन। प्रत्येक चैनल/भार के योगदान और RRF में k तथा मिश्रण में α पैरामीटर के प्रति संवेदनशीलता दर्ज करने की अनुशंसा की जाती है; पुनः-सूत्रणों और OOD-परिवर्तनों के प्रति स्थिरता का मूल्यांकन करें।[41][42]

इंजीनियरिंग पहलू और प्रोडक्शन-प्रथाएँ

  • इंडेक्स और ANN। MIPS/कोसाइन समीपता के लिए FAISS (Flat/HNSW/IVF‑PQ), HNSW, ScaNN।[43][44][45]
  • IR स्टैक। sparse/dense और हाइब्रिड पाइपलाइनों के लिए Lucene/Anserini/Pyserini; BEIR पर «दो-बटन» पुनरुत्पादनीयता।[46][47]
  • वेक्टर DB और खोज इंजन। Qdrant, Weaviate, pgvector/PostgreSQL, Vespa, Elasticsearch/OpenSearch में हाइब्रिड खोज (BM25F+vector) और/या RRF/रैखिक-मिश्रण के नेटिव मोड हैं।[48][49][50][51][52]
  • RAG-पैटर्न। आर्किटेक्चर: retrieval → fusion → rerank → LLM संदर्भ टोकन-सीमा और स्रोत-ट्रेसिंग के साथ।[53]
  • इंडेक्स अपडेट, डीडुप्लिकेशन, टोकनाइज़ेशन। BM25 और वेक्टराइज़र के बीच टोकनाइज़ेशन का समन्वय महत्वपूर्ण है; मिश्रण से पहले स्कोरिंग का अंशांकन (सामान्यीकरण/स्केलिंग)।[54]

सीमाएँ और खुले प्रश्न

  • स्थानांतरणीयता और बहुभाषिता। Dense-मॉडल (GTR/E5) स्थानांतरण में सुधार करते हैं, लेकिन डोमेन/भाषा के प्रति संवेदनशील हैं; sparse-मॉडल (SPLADE) अक्सर OOD पर अधिक स्थिर होते हैं।[55][56]
  • LLM के साथ एकीकरण और हैलुसिनेशन। हाइब्रिड रिट्रीव RAG संदर्भों में चूक और शोर कम करता है, लेकिन हैलुसिनेशन पूरी तरह समाप्त नहीं करता; कड़े पुनर्रैंकर और स्रोत-फ़िल्टरिंग आवश्यक हैं।[57]
  • लागत और गोपनीयता। Multi‑vector इंडेक्स का भंडारण, संपीड़न, एन्क्रिप्शन और on‑prem स्टैक; TCO का मूल्यांकन।
  • प्रवृत्तियाँ। दस्तावेज़/क्वेरी-विस्तार के रूप में HyDE/doc2query/PRF;[58][59] मिश्रण प्रशिक्षण (per‑query α), अधिक कुशल late‑interaction (PLAID/WARP), लंबे दस्तावेज़ और मल्टीवेक्टर इंडेक्स।[60][61]

विधियों की तुलनात्मक तालिका

2025‑09‑10 की स्थिति के अनुसार (BEIR संग्रह trec‑covid पर उदाहरण; nDCG@10 / Recall@100):[62]

trec‑covid पर विधियों की तुलना
विधि प्रकार (sparse/dense/hybrid) विचार/मॉडल विलय योजना पुनर्रैंकर nDCG@10 / R@100 Latency (सापेक्ष) स्रोत
BM25 sparse सटीक शब्द-मिलान (PRF/BM25) 0.595 / 0.109 अत्यंत कम [63][64]
SPLADE++ (ED) sparse (learned) विरल शब्द-विस्तार/भार 0.727 / 0.128 कम–मध्यम [65][66]
Contriever (MS MARCO FT) dense कंट्रास्टिव-लर्निंग bi‑encoder 0.596 / 0.091 मध्यम [67][68]
BGE‑base‑en‑v1.5 dense शक्तिशाली सार्वभौमिक embedder 0.781 / 0.141 मध्यम [69]
Cohere embed‑english‑v3.0 dense औद्योगिक टेक्स्ट embedding मॉडल 0.818 / 0.159 मध्यम [70]
BM25 + dense (उदाहरण: BM25+BGE) hybrid समानांतर रिट्रीव + सूची-विलय RRF (k≈60) या भारित मिश्रण वैकल्पिक: MonoT5/ColBERT (कार्यान्वयन के अनुसार भिन्न; सामान्यतः > सर्वश्रेष्ठ एकल चैनल) मध्यम [71][72][73]

टिप्पणी: अंतिम पंक्ति योजना को दर्शाती है; सटीक संख्याएँ embedder के चुनाव, सामान्यीकरण और विलय-पैरामीटर पर निर्भर करती हैं (स्रोत और Pyserini के पुनरुत्पादनीय स्क्रिप्ट देखें)।

साहित्य

  • Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
  • Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval 3(4):333–389. DOI:10.1561/1500000019.
  • Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR. SIGIR.
  • Järvelин, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  • Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.

संदर्भ लिंक

  • Pyserini / Anserini: github.com/castorini/pyserini • github.com/castorini/anserini
  • FAISS: arXiv:1702.08734
  • Weaviate (Hybrid search): docs.weaviate.io/weaviate/search/hybrid
  • pgvector: github.com/pgvector/pgvector
  • Vespa (Hybrid search tutorial): docs.vespa.ai/en/tutorials/hybrid-search.html

टिप्पणियाँ

  1. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval, 3(4), 333–389. DOI:10.1561/1500000019.
  2. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods. SIGIR 2009, 758–759. PDF.
  3. Bruch, S., Gai, S., Ingber, A. (2023). An Analysis of Fusion Functions for Hybrid Retrieval. ACM TOIS 42(1):1–35. DOI:10.1145/3596512 • arXiv:2210.11934.
  4. Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715 (см. главы о TF‑IDF, оценке и проблеме vocabulary mismatch).
  5. Izacard, G. et al. (2022). Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever). TACL 10:1089–1108. arXiv:2112.09118.
  6. Wang, L. et al. (2022/2024). Text Embeddings by Weakly‑Supervised Contrastive Pre‑training (E5). arXiv:2212.03533.
  7. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. DOI:10.1561/1500000019.
  8. Formal, T., Piwowarski, B., Clinchant, S. (2021). SPLADE: Sparse Lexical and Expansion Model for First Stage Ranking. arXiv:2107.05720.
  9. Formal, T. et al. (2022). Making Sparse Neural IR Models More Effective. Findings of EMNLP. arXiv:2205.04733.
  10. Formal, T. et al. (2024). SPLADE‑v3: New baselines for SPLADE. arXiv:2403.06789.
  11. Lin, J., Ma, X. (2021). A Few Brief Notes on DeepImpact, COIL, and uniCOIL. arXiv:2106.14807.
  12. Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open‑Domain QA. EMNLP. arXiv:2004.04906.
  13. Xiong, L. et al. (2021). Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval (ANCE). ICLR. arXiv:2007.00808.
  14. Izacard, G. et al. (2022). TACL. arXiv:2112.09118.
  15. Ni, J. et al. (2021/2022). Large Dual Encoders Are Generalizable Retrievers (GTR). EMNLP. arXiv:2112.07899.
  16. Wang, L. et al. (2022/2024). arXiv:2212.03533.
  17. Khattab, O., Zaharia, M. (2020). ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT. SIGIR. arXiv:2004.12832.
  18. Santhanam, K. et al. (2022). ColBERTv2 & PLAID. NAACL/ArXiv. arXiv:2112.01488; arXiv:2205.09707.
  19. Scheerer, J.L. et al. (2025). WARP: An Efficient Engine for Multi‑Vector Retrieval. arXiv:2501.17788.
  20. Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR with Sparse and Dense Representations. SIGIR. PDF.
  21. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). SIGIR. PDF.
  22. Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../reciprocal-rank-fusion.
  23. OpenSearch Docs. Score ranker processor (RRF). (доступ 2025‑09‑10). docs.opensearch.org/.../score-ranker-processor/.
  24. Fox, E.A., Shaw, J.A. (1994). Combination of Multiple Searches. TREC‑2, NIST SP 500‑215, 243–252. PDF.
  25. Lee, J.H. (1997). Analyses of Multiple Evidence Combination. SIGIR, 267–276. DOI:10.1145/258525.258587.
  26. Hsu, D.F., Taksa, I. (2005). Comparing Rank and Score Combination Methods for Data Fusion in IR. (Tech. report). PDF.
  27. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  28. Hsu, D.F., Taksa, I. (2005). см. выше.
  29. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  30. Nogueira, R., Cho, K. (2019). Passage Re‑ranking with BERT. arXiv:1901.04085.
  31. Nogueira, R., Jiang, Z., Lin, J. (2020). Document Ranking with a Pretrained Sequence‑to‑Sequence Model (MonoT5). Findings of EMNLP. arXiv:2003.06713.
  32. Santhanam, K. et al. (2022). arXiv:2205.09707.
  33. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  34. Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.
  35. Thakur, N. et al. (2021). BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of IR Models. NeurIPS Datasets & Benchmarks. arXiv:2104.08663.
  36. Craswell, N. et al. (2020). Overview of the TREC 2019 Deep Learning Track. arXiv:2003.07820.
  37. Craswell, N. et al. (2021). Overview of the TREC 2020 Deep Learning Track. arXiv:2102.07662.
  38. Bajaj, P. et al. (2016). MS MARCO: A Human Generated MAchine Reading COmprehension Dataset. arXiv:1611.09268.
  39. Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  40. Dean, J., Barroso, L.A. (2013). CACM. DOI:10.1145/2408776.2408794.
  41. Bruch, S. et al. (2023). DOI:10.1145/3596512.
  42. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  43. Johnson, J., Douze, M., Jégou, H. (2017). Billion‑scale Similarity Search with GPUs (FAISS). arXiv:1702.08734.
  44. Malkov, Y., Yashunin, D. (2020). HNSW. IEEE TPAMI 42(4):824–836. DOI:10.1109/TPAMI.2018.2889473.
  45. Guo, R. et al. (2020). ScaNN: Efficient Vector Similarity Search at Scale. arXiv:1908.10396.
  46. Yang, P., Fang, H., Lin, J. (2018). Anserini: Reproducible IR Research with Lucene. JDIQ 10(4):1–20. DOI:10.1145/3239571.
  47. Lin, J. et al. (2021). SIGIR. PDF.
  48. Qdrant Docs. Hybrid queries (RRF, DBSF). (доступ 2025‑09‑10). qdrant.tech/.../hybrid-queries/.
  49. Weaviate Docs. Hybrid search. (доступ 2025‑09‑10). docs.weaviate.io/weaviate/search/hybrid.
  50. pgvector GitHub. (доступ 2025‑09‑10). github.com/pgvector/pgvector.
  51. Vespa Docs. Hybrid Text Search Tutorial. (доступ 2025‑09‑10). docs.vespa.ai/.../hybrid-search.html.
  52. Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../rrf.
  53. Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  54. Hsu, D.F., Taksa, I. (2005). см. выше.
  55. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  56. Formal, T. et al. (2021, 2022, 2024). arXiv:2107.05720; 2205.04733; 2403.06789.
  57. Lewis, P. et al. (2020). arXiv:2005.11401.
  58. Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL. arXiv:2212.10496.
  59. Nogueira, R. et al. (2019). Document Expansion by Query Prediction. arXiv:1904.08375; docTTTTTquery. PDF.
  60. Santhanam, K. et al. (2022). arXiv:2205.09707.
  61. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  62. Pyserini BEIR Regressions (доступ 2025‑09‑10): результаты по trec‑covid для BM25/SPLADE/Contriever/BGE/Cohere. castorini.github.io/pyserini/2cr/beir.html.
  63. Robertson, S., Zaragoza, H. (2009). DOI:10.1561/1500000019.
  64. Pyserini BEIR. См. ссылку выше.
  65. Formal, T. et al. (2021, 2022). arXiv:2107.05720; 2205.04733.
  66. Pyserini BEIR.
  67. Izacard, G. et al. (2022). arXiv:2112.09118.
  68. Pyserini BEIR.
  69. Pyserini BEIR.
  70. Pyserini BEIR.
  71. Cormack et al. (2009). SIGIR. RRF.
  72. Bruch et al. (2023). TOIS.
  73. Elastic/OpenSearch RRF Docs.