Hybrid retrieval (HI)
Hybrid Retrieval (हाइब्रिड रिट्रीव) — सूचना पुनर्प्राप्ति के उन विधियों का वर्ग है जिनमें लेक्सिकल (sparse) और सिमेंटिक (dense/late‑interaction) संकेतों को मिलाकर परिणामों की पूर्णता और सटीकता बढ़ाई जाती है। हाइब्रिड योजनाएँ सटीक शब्द-मिलान (BM25/TF-IDF) और वेक्टर समीपता (bi-encoder, late-interaction मल्टी-मॉडल) के लाभों को संयुक्त करती हैं, तथा असमान स्केल के स्कोरिंग के प्रति स्थिर रैंकिंग-विलय विधियों (जैसे Reciprocal Rank Fusion, CombSUM/CombMNZ) और cross‑encoder द्वारा पुनर्रैंकिंग का भी उपयोग करती हैं।[1][2][3]
परिभाषा और प्रेरणा
हाइब्रिड रिट्रीव एक समानांतर अथवा कास्केड खोज है जो दो (या अधिक) स्वतंत्र संकेत-चैनलों पर की जाती है और उसके बाद विलय और/या पुनर्रैंकिंग की जाती है। सामान्य प्रेरणाएँ: (i) «शब्दावली अंतर» (पर्यायवाची, पुनः-सूत्रण) से उबरना, (ii) वर्तनी-त्रुटियों/रूपविज्ञान के प्रति स्थिरता, (iii) विशिष्ट कोड/पहचानकर्ताओं का निष्कर्षण (जहाँ sparse-मॉडल सशक्त होता है), (iv) नए डोमेन/भाषाओं पर स्थानांतरण (जहाँ dense-मॉडल सिमेंटिक सामान्यीकरण देते हैं)।[4][5][6]
हाइब्रिड खोज के घटक
लेक्सिकल (sparse)
- क्लासिकल मॉडल। TF-IDF और BM25/BM25F — इनवर्टेड इंडेक्स पर आधारित मानक आधारभूत विधियाँ; BM25 प्रायिकतावादी PRF-ढाँचे में प्रमाणित है और रैंकिंग के प्रथम चरण में व्यापक रूप से उपयोग की जाती है।[7]
- प्रशिक्षणीय sparse।
- SPLADE / SPLADE++/v3। एक न्यूरोस्पार्स मॉडल जो MLM-हेड के माध्यम से विरलता-नियमितीकरण के साथ शब्द-विस्तार और भार-निर्धारण सीखता है; मजबूत परिणाम और अच्छी स्थानांतरणीयता (BEIR) दर्शाता है।[8][9][10]
- uniCOIL/COIL। संदर्भीकृत इनवर्टेड सूचियाँ और उनका सरलीकृत संस्करण uniCOIL; क्लासिकल इनवर्टेड इंडेक्स के साथ संगत।[11]
सिमेंटिक (dense/late‑interaction)
- Bi‑encoder (single‑vector)। क्वेरी और दस्तावेज़ को वेक्टर-मॉडलों द्वारा एन्कोड किया जाता है, समानता dot‑product/MIPS से मापी जाती है। उदाहरण: DPR,[12] ANCE,[13] Contriever,[14] GTR,[15] E5।[16]
- Late‑interaction (multi‑vector)। «विलंबित» अंतःक्रिया पर टोकन-स्तरीय मिलान को मॉडल करते हैं: ColBERT/ColBERTv2; समझौता — बड़े इंडेक्स/लेटेंसी पर बेहतर सटीकता, जिसे इंजीनियरिंग ड्राइवरों (PLAID, WARP) द्वारा कम किया जाता है।[17][18][19]
हाइब्रिडीकरण और रैंकिंग-विलय की योजनाएँ
- समानांतर खोज और उम्मीदवारों का संयोजन। sparse और dense से स्वतंत्र उम्मीदवार-सूचियाँ उनके आंतरिक स्कोरिंग के साथ प्राप्त करें; फिर — रैंकिंग-विलय।[20]
- RRF (Reciprocal Rank Fusion)। असंगत स्कोरिंग के प्रति स्थिर तकनीक जो व्युत्क्रम रैंकों को जोड़ती है:
, जहाँ सामान्यतः ।[21] औद्योगिक इंजनों (Elasticsearch/OpenSearch) में अंतर्निहित रिट्रीवर/प्रोसेसर के रूप में समर्थित है।[22][23]
- CombSUM/CombMNZ आदि। क्लासिकल «स्कोर-योग» फ़ंक्शन (आवश्यकता पर — सामान्यीकरण के साथ)।[24][25][26]
- भारित रैखिक मिश्रण।
, । का चुनाव स्थिर या प्रशिक्षणीय (संग्रह/क्वेरी के अनुसार) हो सकता है।[27]
- स्कोरिंग का सामान्यीकरण। CombSUM/CombMNZ के लिए पैमाने के समन्वय हेतु अक्सर min‑max, z‑score आदि लागू किए जाते हैं;[28] वैकल्पिक रूप से RRF केवल रैंकों पर निर्भर करता है।
- गतिशील/अनुकूली भार-निर्धारण। क्वेरी रूटिंग (query routing), क्वेरी-विशेषताएँ और LTR-मॉडल चैनलों के चयन/भार के लिए; आधुनिक शोध दर्शाते हैं कि सरल प्रशिक्षित मिश्रण अक्सर RRF से बेहतर होता है और सामान्यीकरण के प्रति कम संवेदनशील होता है।[29]
पुनर्रैंकिंग और बहु-चरणीय पाइपलाइन
हाइब्रिड सिस्टम सामान्यतः retrieval → fusion → rerank के रूप में बनाए जाते हैं। पुनर्रैंकिंग के लिए उपयोग किए जाते हैं:
- Cross‑encoder (BERT/T5)। सबसे सटीक, लेकिन महँगे: शीर्ष-N उम्मीदवारों के पुनः-क्रमण के लिए MonoBERT/MonoT5।[30][31]
- Late‑interaction पुनर्रैंकर के रूप में। ColBERT-परिवार पुनर्रैंकर के रूप में भी कार्य कर सकता है; आधुनिक त्वरक (PLAID, WARP) गुणवत्ता-हानि के बिना लेटेंसी कम करते हैं।[32][33]
गुणवत्ता ↔ लेटेंसी/लागत का समझौता RAG और सख्त SLA (देखें टेल लेटेंसी p95/p99) में विशेष रूप से महत्वपूर्ण है।[34]
benchmark पर मूल्यांकन
- BEIR। रिट्रीवर्स के zero‑/out‑of‑domain मूल्यांकन के लिए विविध संग्रहों/कार्यों का एकीकृत सेट (जैसे TREC‑COVID, NFCorpus, NQ, HotpotQA, FiQA‑2018, DBPedia‑entity, ArguAna, Webis‑Touché‑2020, FEVER/Climate‑FEVER, Scidocs, SciFact, CQADupStack आदि)।[35]
- TREC Deep Learning / MS MARCO। बड़े-डेटा मोड में रिट्रीवर्स और पुनर्रैंकर्स के प्रशिक्षण/मूल्यांकन के लिए क्लासिकल संसाधन।[36][37][38]
- गुणवत्ता मेट्रिक्स। nDCG@k, Recall@k, MRR; प्रदर्शन के लिए — latency p50/p95/p99, QPS; संचालन के लिए — मेमोरी/लागत (CPU/GPU, इंडेक्स)।[39][40]
- एब्लेशन। प्रत्येक चैनल/भार के योगदान और RRF में तथा मिश्रण में पैरामीटर के प्रति संवेदनशीलता दर्ज करने की अनुशंसा की जाती है; पुनः-सूत्रणों और OOD-परिवर्तनों के प्रति स्थिरता का मूल्यांकन करें।[41][42]
इंजीनियरिंग पहलू और प्रोडक्शन-प्रथाएँ
- इंडेक्स और ANN। MIPS/कोसाइन समीपता के लिए FAISS (Flat/HNSW/IVF‑PQ), HNSW, ScaNN।[43][44][45]
- IR स्टैक। sparse/dense और हाइब्रिड पाइपलाइनों के लिए Lucene/Anserini/Pyserini; BEIR पर «दो-बटन» पुनरुत्पादनीयता।[46][47]
- वेक्टर DB और खोज इंजन। Qdrant, Weaviate, pgvector/PostgreSQL, Vespa, Elasticsearch/OpenSearch में हाइब्रिड खोज (BM25F+vector) और/या RRF/रैखिक-मिश्रण के नेटिव मोड हैं।[48][49][50][51][52]
- RAG-पैटर्न। आर्किटेक्चर: retrieval → fusion → rerank → LLM संदर्भ टोकन-सीमा और स्रोत-ट्रेसिंग के साथ।[53]
- इंडेक्स अपडेट, डीडुप्लिकेशन, टोकनाइज़ेशन। BM25 और वेक्टराइज़र के बीच टोकनाइज़ेशन का समन्वय महत्वपूर्ण है; मिश्रण से पहले स्कोरिंग का अंशांकन (सामान्यीकरण/स्केलिंग)।[54]
सीमाएँ और खुले प्रश्न
- स्थानांतरणीयता और बहुभाषिता। Dense-मॉडल (GTR/E5) स्थानांतरण में सुधार करते हैं, लेकिन डोमेन/भाषा के प्रति संवेदनशील हैं; sparse-मॉडल (SPLADE) अक्सर OOD पर अधिक स्थिर होते हैं।[55][56]
- LLM के साथ एकीकरण और हैलुसिनेशन। हाइब्रिड रिट्रीव RAG संदर्भों में चूक और शोर कम करता है, लेकिन हैलुसिनेशन पूरी तरह समाप्त नहीं करता; कड़े पुनर्रैंकर और स्रोत-फ़िल्टरिंग आवश्यक हैं।[57]
- लागत और गोपनीयता। Multi‑vector इंडेक्स का भंडारण, संपीड़न, एन्क्रिप्शन और on‑prem स्टैक; TCO का मूल्यांकन।
- प्रवृत्तियाँ। दस्तावेज़/क्वेरी-विस्तार के रूप में HyDE/doc2query/PRF;[58][59] मिश्रण प्रशिक्षण (per‑query ), अधिक कुशल late‑interaction (PLAID/WARP), लंबे दस्तावेज़ और मल्टीवेक्टर इंडेक्स।[60][61]
विधियों की तुलनात्मक तालिका
2025‑09‑10 की स्थिति के अनुसार (BEIR संग्रह trec‑covid पर उदाहरण; nDCG@10 / Recall@100):[62]
| विधि | प्रकार (sparse/dense/hybrid) | विचार/मॉडल | विलय योजना | पुनर्रैंकर | nDCG@10 / R@100 | Latency (सापेक्ष) | स्रोत |
|---|---|---|---|---|---|---|---|
| BM25 | sparse | सटीक शब्द-मिलान (PRF/BM25) | — | — | 0.595 / 0.109 | अत्यंत कम | [63][64] |
| SPLADE++ (ED) | sparse (learned) | विरल शब्द-विस्तार/भार | — | — | 0.727 / 0.128 | कम–मध्यम | [65][66] |
| Contriever (MS MARCO FT) | dense | कंट्रास्टिव-लर्निंग bi‑encoder | — | — | 0.596 / 0.091 | मध्यम | [67][68] |
| BGE‑base‑en‑v1.5 | dense | शक्तिशाली सार्वभौमिक embedder | — | — | 0.781 / 0.141 | मध्यम | [69] |
| Cohere embed‑english‑v3.0 | dense | औद्योगिक टेक्स्ट embedding मॉडल | — | — | 0.818 / 0.159 | मध्यम | [70] |
| BM25 + dense (उदाहरण: BM25+BGE) | hybrid | समानांतर रिट्रीव + सूची-विलय | RRF (k≈60) या भारित मिश्रण | वैकल्पिक: MonoT5/ColBERT | (कार्यान्वयन के अनुसार भिन्न; सामान्यतः > सर्वश्रेष्ठ एकल चैनल) | मध्यम | [71][72][73] |
टिप्पणी: अंतिम पंक्ति योजना को दर्शाती है; सटीक संख्याएँ embedder के चुनाव, सामान्यीकरण और विलय-पैरामीटर पर निर्भर करती हैं (स्रोत और Pyserini के पुनरुत्पादनीय स्क्रिप्ट देखें)।
साहित्य
- Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
- Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval 3(4):333–389. DOI:10.1561/1500000019.
- Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR. SIGIR.
- Järvelин, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
- Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.
संदर्भ लिंक
- Pyserini / Anserini: github.com/castorini/pyserini • github.com/castorini/anserini
- FAISS: arXiv:1702.08734
- Weaviate (Hybrid search): docs.weaviate.io/weaviate/search/hybrid
- pgvector: github.com/pgvector/pgvector
- Vespa (Hybrid search tutorial): docs.vespa.ai/en/tutorials/hybrid-search.html
टिप्पणियाँ
- ↑ Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval, 3(4), 333–389. DOI:10.1561/1500000019.
- ↑ Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods. SIGIR 2009, 758–759. PDF.
- ↑ Bruch, S., Gai, S., Ingber, A. (2023). An Analysis of Fusion Functions for Hybrid Retrieval. ACM TOIS 42(1):1–35. DOI:10.1145/3596512 • arXiv:2210.11934.
- ↑ Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715 (см. главы о TF‑IDF, оценке и проблеме vocabulary mismatch).
- ↑ Izacard, G. et al. (2022). Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever). TACL 10:1089–1108. arXiv:2112.09118.
- ↑ Wang, L. et al. (2022/2024). Text Embeddings by Weakly‑Supervised Contrastive Pre‑training (E5). arXiv:2212.03533.
- ↑ Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. DOI:10.1561/1500000019.
- ↑ Formal, T., Piwowarski, B., Clinchant, S. (2021). SPLADE: Sparse Lexical and Expansion Model for First Stage Ranking. arXiv:2107.05720.
- ↑ Formal, T. et al. (2022). Making Sparse Neural IR Models More Effective. Findings of EMNLP. arXiv:2205.04733.
- ↑ Formal, T. et al. (2024). SPLADE‑v3: New baselines for SPLADE. arXiv:2403.06789.
- ↑ Lin, J., Ma, X. (2021). A Few Brief Notes on DeepImpact, COIL, and uniCOIL. arXiv:2106.14807.
- ↑ Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open‑Domain QA. EMNLP. arXiv:2004.04906.
- ↑ Xiong, L. et al. (2021). Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval (ANCE). ICLR. arXiv:2007.00808.
- ↑ Izacard, G. et al. (2022). TACL. arXiv:2112.09118.
- ↑ Ni, J. et al. (2021/2022). Large Dual Encoders Are Generalizable Retrievers (GTR). EMNLP. arXiv:2112.07899.
- ↑ Wang, L. et al. (2022/2024). arXiv:2212.03533.
- ↑ Khattab, O., Zaharia, M. (2020). ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT. SIGIR. arXiv:2004.12832.
- ↑ Santhanam, K. et al. (2022). ColBERTv2 & PLAID. NAACL/ArXiv. arXiv:2112.01488; arXiv:2205.09707.
- ↑ Scheerer, J.L. et al. (2025). WARP: An Efficient Engine for Multi‑Vector Retrieval. arXiv:2501.17788.
- ↑ Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR with Sparse and Dense Representations. SIGIR. PDF.
- ↑ Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). SIGIR. PDF.
- ↑ Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../reciprocal-rank-fusion.
- ↑ OpenSearch Docs. Score ranker processor (RRF). (доступ 2025‑09‑10). docs.opensearch.org/.../score-ranker-processor/.
- ↑ Fox, E.A., Shaw, J.A. (1994). Combination of Multiple Searches. TREC‑2, NIST SP 500‑215, 243–252. PDF.
- ↑ Lee, J.H. (1997). Analyses of Multiple Evidence Combination. SIGIR, 267–276. DOI:10.1145/258525.258587.
- ↑ Hsu, D.F., Taksa, I. (2005). Comparing Rank and Score Combination Methods for Data Fusion in IR. (Tech. report). PDF.
- ↑ Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
- ↑ Hsu, D.F., Taksa, I. (2005). см. выше.
- ↑ Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
- ↑ Nogueira, R., Cho, K. (2019). Passage Re‑ranking with BERT. arXiv:1901.04085.
- ↑ Nogueira, R., Jiang, Z., Lin, J. (2020). Document Ranking with a Pretrained Sequence‑to‑Sequence Model (MonoT5). Findings of EMNLP. arXiv:2003.06713.
- ↑ Santhanam, K. et al. (2022). arXiv:2205.09707.
- ↑ Scheerer, J.L. et al. (2025). arXiv:2501.17788.
- ↑ Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.
- ↑ Thakur, N. et al. (2021). BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of IR Models. NeurIPS Datasets & Benchmarks. arXiv:2104.08663.
- ↑ Craswell, N. et al. (2020). Overview of the TREC 2019 Deep Learning Track. arXiv:2003.07820.
- ↑ Craswell, N. et al. (2021). Overview of the TREC 2020 Deep Learning Track. arXiv:2102.07662.
- ↑ Bajaj, P. et al. (2016). MS MARCO: A Human Generated MAchine Reading COmprehension Dataset. arXiv:1611.09268.
- ↑ Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
- ↑ Dean, J., Barroso, L.A. (2013). CACM. DOI:10.1145/2408776.2408794.
- ↑ Bruch, S. et al. (2023). DOI:10.1145/3596512.
- ↑ Ni, J. et al. (2021/2022). arXiv:2112.07899.
- ↑ Johnson, J., Douze, M., Jégou, H. (2017). Billion‑scale Similarity Search with GPUs (FAISS). arXiv:1702.08734.
- ↑ Malkov, Y., Yashunin, D. (2020). HNSW. IEEE TPAMI 42(4):824–836. DOI:10.1109/TPAMI.2018.2889473.
- ↑ Guo, R. et al. (2020). ScaNN: Efficient Vector Similarity Search at Scale. arXiv:1908.10396.
- ↑ Yang, P., Fang, H., Lin, J. (2018). Anserini: Reproducible IR Research with Lucene. JDIQ 10(4):1–20. DOI:10.1145/3239571.
- ↑ Lin, J. et al. (2021). SIGIR. PDF.
- ↑ Qdrant Docs. Hybrid queries (RRF, DBSF). (доступ 2025‑09‑10). qdrant.tech/.../hybrid-queries/.
- ↑ Weaviate Docs. Hybrid search. (доступ 2025‑09‑10). docs.weaviate.io/weaviate/search/hybrid.
- ↑ pgvector GitHub. (доступ 2025‑09‑10). github.com/pgvector/pgvector.
- ↑ Vespa Docs. Hybrid Text Search Tutorial. (доступ 2025‑09‑10). docs.vespa.ai/.../hybrid-search.html.
- ↑ Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../rrf.
- ↑ Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ Hsu, D.F., Taksa, I. (2005). см. выше.
- ↑ Ni, J. et al. (2021/2022). arXiv:2112.07899.
- ↑ Formal, T. et al. (2021, 2022, 2024). arXiv:2107.05720; 2205.04733; 2403.06789.
- ↑ Lewis, P. et al. (2020). arXiv:2005.11401.
- ↑ Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL. arXiv:2212.10496.
- ↑ Nogueira, R. et al. (2019). Document Expansion by Query Prediction. arXiv:1904.08375; docTTTTTquery. PDF.
- ↑ Santhanam, K. et al. (2022). arXiv:2205.09707.
- ↑ Scheerer, J.L. et al. (2025). arXiv:2501.17788.
- ↑ Pyserini BEIR Regressions (доступ 2025‑09‑10): результаты по trec‑covid для BM25/SPLADE/Contriever/BGE/Cohere. castorini.github.io/pyserini/2cr/beir.html.
- ↑ Robertson, S., Zaragoza, H. (2009). DOI:10.1561/1500000019.
- ↑ Pyserini BEIR. См. ссылку выше.
- ↑ Formal, T. et al. (2021, 2022). arXiv:2107.05720; 2205.04733.
- ↑ Pyserini BEIR.
- ↑ Izacard, G. et al. (2022). arXiv:2112.09118.
- ↑ Pyserini BEIR.
- ↑ Pyserini BEIR.
- ↑ Pyserini BEIR.
- ↑ Cormack et al. (2009). SIGIR. RRF.
- ↑ Bruch et al. (2023). TOIS.
- ↑ Elastic/OpenSearch RRF Docs.