Hybrid retrieval (BN)
Hybrid Retrieval (হাইব্রিড রিট্রিভ) — তথ্য অনুসন্ধানের একটি পদ্ধতির শ্রেণি, যেখানে ফলাফলের পূর্ণতা ও নির্ভুলতা বাড়াতে লেক্সিক্যাল (sparse) এবং সেমান্টিক (dense/late‑interaction) সংকেত একত্রিত করা হয়। হাইব্রিড স্কিমগুলি সঠিক পদ মিলানোর সুবিধা (BM25/TF-IDF) এবং ভেক্টরীয় নৈকট্যের (bi-encoder, late-interaction মাল্টিমডেল) সুবিধা উভয়ই ব্যবহার করে, পাশাপাশি ভিন্ন স্কেলের স্কোরিং-এর প্রতি সহনশীল র্যাংকিং মার্জ পদ্ধতি (যেমন Reciprocal Rank Fusion, CombSUM/CombMNZ) এবং cross‑encoder-এর মাধ্যমে পুনর্বিন্যাসও প্রয়োগ করে।[1][2][3]
সংজ্ঞা ও প্রেরণা
হাইব্রিড রিট্রিভ হলো দুটি (বা তার বেশি) স্বাধীন সংকেত চ্যানেলে সমান্তরাল বা ক্যাসকেড অনুসন্ধান, যার পরে মার্জিং এবং/অথবা পুনর্বিন্যাস করা হয়। সাধারণ উদ্দেশ্যগুলি হলো: (i) «পরিভাষাগত ফাঁক» অতিক্রম করা (প্রতিশব্দ, পুনর্প্রণয়ন), (ii) বানান ত্রুটি/রূপতত্ত্বের প্রতি সহনশীলতা, (iii) নির্দিষ্ট কোড/শনাক্তকারী উদ্ধার (যেখানে sparse মডেল শক্তিশালী), (iv) নতুন ডোমেইন/ভাষায় স্থানান্তর (যেখানে dense মডেল সেমান্টিক সাধারণীকরণ দেয়)।[4][5][6]
হাইব্রিড অনুসন্ধানের উপাদান
লেক্সিক্যাল (sparse)
- ক্লাসিক মডেল। TF-IDF এবং BM25/BM25F — ইনভার্টেড ইন্ডেক্সের উপর নির্ভরশীল প্রমিত ভিত্তি পদ্ধতি; BM25 সম্ভাব্যতামূলক PRF কাঠামোয় প্রতিষ্ঠিত এবং প্রথম-স্তরের র্যাংকিংয়ে ব্যাপকভাবে ব্যবহৃত হয়।[7]
- শিক্ষণযোগ্য sparse।
- SPLADE / SPLADE++/v3। নিউরো-স্পার্স মডেল, যা MLM-হেড এবং বিরলতা রেগুলারাইজেশনের মাধ্যমে পদের প্রসারণ ও ওজন নির্ধারণ শেখে; শক্তিশালী ফলাফল এবং ভালো স্থানান্তরযোগ্যতা দেখায় (BEIR)।[8][9][10]
- uniCOIL/COIL। প্রাসঙ্গিকীকৃত ইনভার্টেড তালিকা এবং তাদের সরলীকৃত সংস্করণ uniCOIL; ক্লাসিক ইনভার্টেড ইন্ডেক্সের সাথে সামঞ্জস্যপূর্ণ।[11]
সেমান্টিক (dense/late‑interaction)
- Bi‑encoder (single‑vector)। প্রশ্ন ও নথি ভেক্টর মডেল দিয়ে এনকোড করা হয়, মিল পরিমাপ dot‑product/MIPS দিয়ে। উদাহরণ: DPR,[12] ANCE,[13] Contriever,[14] GTR,[15] E5।[16]
- Late‑interaction (multi‑vector)। «দেরি» মিথস্ক্রিয়ায় token-স্তরের মিল মডেল করে: ColBERT/ColBERTv2; আপস হলো বৃহত্তর ইন্ডেক্স/লেটেন্সির বিনিময়ে ভালো নির্ভুলতা, যা ইঞ্জিনিয়ারিং ড্রাইভার (PLAID, WARP) দিয়ে লাঘব করা হয়।[17][18][19]
হাইব্রিডাইজেশন ও র্যাংকিং মার্জ স্কিম
- সমান্তরাল অনুসন্ধান ও প্রার্থী একত্রীকরণ। স্বাধীনভাবে প্রার্থী তালিকা (sparse এবং dense) তাদের অভ্যন্তরীণ স্কোরিং সহ পাওয়া যায়; তারপর র্যাংকিং মার্জ করা হয়।[20]
- RRF (Reciprocal Rank Fusion)। অসামঞ্জস্যপূর্ণ স্কোরিংয়ের প্রতি সহনশীল একটি পদ্ধতি, যা বিপরীত র্যাংক যোগ করে:
, যেখানে সাধারণত ।[21] শিল্প-মানের ইঞ্জিনগুলিতে (Elasticsearch/OpenSearch) অন্তর্নির্মিত রিট্রিভার/প্রসেসর হিসেবে সমর্থিত।[22][23]
- CombSUM/CombMNZ এবং অন্যান্য। ক্লাসিক «স্কোর যোগফল» ফাংশন (প্রয়োজনে নর্মালাইজেশনসহ)।[24][25][26]
- ভারযুক্ত রৈখিক মিশ্রণ।
, । নির্বাচন নির্দিষ্ট বা শিক্ষণযোগ্য হতে পারে (সংগ্রহ অনুযায়ী/প্রশ্ন অনুযায়ী)।[27]
- স্কোরিং নর্মালাইজেশন। CombSUM/CombMNZ-এর জন্য স্কেল সমন্বয়ে প্রায়ই min‑max, z‑score ইত্যাদি ব্যবহার করা হয়;[28] বিকল্পভাবে RRF কেবল র্যাংকের উপর নির্ভর করে।
- গতিশীল/অভিযোজিত ওজনায়ন। প্রশ্ন রাউটিং (query routing), প্রশ্নের বৈশিষ্ট্য এবং LTR মডেল চ্যানেল নির্বাচন/ওজনের জন্য; সাম্প্রতিক গবেষণা দেখায় যে সহজ শিক্ষিত মিশ্রণ প্রায়ই RRF-কে ছাড়িয়ে যায় এবং নর্মালাইজেশনের প্রতি কম সংবেদনশীল।[29]
পুনর্বিন্যাস ও বহু-স্তরীয় pipeline
হাইব্রিড সিস্টেমগুলি সাধারণত retrieval → fusion → rerank হিসেবে নির্মিত হয়। পুনর্বিন্যাসের জন্য ব্যবহার করা হয়:
- Cross‑encoder (BERT/T5)। সবচেয়ে নির্ভুল, কিন্তু ব্যয়বহুল: শীর্ষ-N প্রার্থী পুনর্বিন্যাসের জন্য MonoBERT/MonoT5।[30][31]
- Late‑interaction রির্যাংকার হিসেবে। ColBERT পরিবার রির্যাংকার হিসেবেও কাজ করতে পারে; আধুনিক ত্বরণকারী (PLAID, WARP) গুণমান হ্রাস ছাড়াই লেটেন্সি কমায়।[32][33]
গুণমান ↔ লেটেন্সি/খরচ আপসটি RAG এবং কঠোর SLA-তে (p95/p99 টেইল বিলম্ব দেখুন) বিশেষভাবে গুরুত্বপূর্ণ।[34]
benchmark-এ মূল্যায়ন
- BEIR। রিট্রিভারের zero‑/out‑of‑domain মূল্যায়নের জন্য বৈচিত্র্যময় সংগ্রহ/কাজের একটি একীভূত সেট (যেমন TREC‑COVID, NFCorpus, NQ, HotpotQA, FiQA‑2018, DBPedia‑entity, ArguAna, Webis‑Touché‑2020, FEVER/Climate‑FEVER, Scidocs, SciFact, CQADupStack ইত্যাদি)।[35]
- TREC Deep Learning / MS MARCO। বড় ডেটা পরিবেশে রিট্রিভার ও রির্যাংকার প্রশিক্ষণ/মূল্যায়নের ক্লাসিক সম্পদ।[36][37][38]
- গুণমানের মেট্রিক। nDCG@k, Recall@k, MRR; কর্মক্ষমতার জন্য — latency p50/p95/p99, QPS; পরিচালনার জন্য — মেমরি/খরচ (CPU/GPU, ইন্ডেক্স)।[39][40]
- অ্যাবলেশন। প্রতিটি চ্যানেল/ওজনের অবদান এবং RRF-এ ও মিশ্রণে প্যারামিটারের প্রতি সংবেদনশীলতা নির্দিষ্ট করার পরামর্শ দেওয়া হয়; পুনর্প্রণয়ন ও OOD-শিফটের প্রতি স্থিতিশীলতা মূল্যায়ন করুন।[41][42]
ইঞ্জিনিয়ারিং দিক ও প্রোডাকশন অনুশীলন
- ইন্ডেক্স ও ANN। MIPS/কোসাইন নৈকট্যের জন্য FAISS (Flat/HNSW/IVF‑PQ), HNSW, ScaNN।[43][44][45]
- IR স্ট্যাক। sparse/dense ও হাইব্রিড pipeline-এর জন্য Lucene/Anserini/Pyserini; BEIR-এ «দুই-বোতামে» পুনরুৎপাদনযোগ্যতা।[46][47]
- ভেক্টর ডেটাবেস ও সার্চ ইঞ্জিন। Qdrant, Weaviate, pgvector/PostgreSQL, Vespa, Elasticsearch/OpenSearch-এ নেটিভ হাইব্রিড সার্চ মোড (BM25F+vector) এবং/অথবা RRF/রৈখিক মিশ্রণ রয়েছে।[48][49][50][51][52]
- RAG প্যাটার্ন। আর্কিটেকচার: retrieval → fusion → rerank → LLM প্রসঙ্গ token সীমাবদ্ধতা ও উৎস ট্রেসিংসহ।[53]
- ইন্ডেক্স আপডেট, ডিডুপ্লিকেশন, টোকেনাইজেশন। BM25 ও ভেক্টরাইজারের মধ্যে টোকেনাইজেশন সমন্বয় গুরুত্বপূর্ণ; মিশ্রণের আগে স্কোরিং ক্যালিব্রেশন (নর্মালাইজেশন/স্কেলিং)।[54]
সীমাবদ্ধতা ও উন্মুক্ত প্রশ্ন
- স্থানান্তরযোগ্যতা ও বহুভাষিকতা। Dense মডেল (GTR/E5) স্থানান্তর উন্নত করে, কিন্তু ডোমেইন/ভাষার প্রতি সংবেদনশীল; sparse মডেল (SPLADE) প্রায়ই OOD-তে বেশি স্থিতিশীল।[55][56]
- LLM-এর সাথে একীভূতকরণ ও হ্যালুসিনেশন। হাইব্রিড রিট্রিভ RAG প্রসঙ্গে বাদ পড়া ও শব্দাড়ম্বর কমায়, কিন্তু হ্যালুসিনেশন সম্পূর্ণ দূর করে না; কঠোর রির্যাংকার ও উৎস ফিল্টারিং প্রয়োজন।[57]
- খরচ ও গোপনীয়তা। Multi‑vector ইন্ডেক্স সংরক্ষণ, সংকোচন, এনক্রিপশন ও on‑prem স্ট্যাক; TCO মূল্যায়ন।
- প্রবণতা। নথি/প্রশ্ন প্রসারণ হিসেবে HyDE/doc2query/PRF;[58][59] মিশ্রণ প্রশিক্ষণ (per‑query ), আরও দক্ষ late‑interaction (PLAID/WARP), দীর্ঘ নথি ও মাল্টিভেক্টর ইন্ডেক্স।[60][61]
পদ্ধতির তুলনামূলক সারণি
২০২৫‑০৯‑১০ পর্যন্ত (BEIR trec‑covid সংগ্রহে উদাহরণ; nDCG@10 / Recall@100):[62]
| পদ্ধতি | ধরন (sparse/dense/hybrid) | ধারণা/মডেল | মার্জ স্কিম | রির্যাংকার | nDCG@10 / R@100 | Latency (আপেক্ষিক) | উৎস |
|---|---|---|---|---|---|---|---|
| BM25 | sparse | সঠিক পদ মিলান (PRF/BM25) | — | — | 0.595 / 0.109 | অত্যন্ত কম | [63][64] |
| SPLADE++ (ED) | sparse (learned) | বিরল পদ প্রসারণ/ওজন | — | — | 0.727 / 0.128 | কম–মাঝারি | [65][66] |
| Contriever (MS MARCO FT) | dense | কন্ট্রাস্টিভ লার্নিং bi-encoder | — | — | 0.596 / 0.091 | মাঝারি | [67][68] |
| BGE‑base‑en‑v1.5 | dense | শক্তিশালী সার্বজনীন embedding মডেল | — | — | 0.781 / 0.141 | মাঝারি | [69] |
| Cohere embed‑english‑v3.0 | dense | শিল্প-মানের টেক্সট embedding মডেল | — | — | 0.818 / 0.159 | মাঝারি | [70] |
| BM25 + dense (উদাহরণ: BM25+BGE) | hybrid | সমান্তরাল রিট্রিভ + তালিকা মার্জ | RRF (k≈60) বা ভারযুক্ত মিশ্রণ | ঐচ্ছিক: MonoT5/ColBERT | (বাস্তবায়ন অনুযায়ী পরিবর্তিত হয়; সাধারণত > সেরা একক চ্যানেল) | মাঝারি | [71][72][73] |
দ্রষ্টব্য: শেষ সারিটি স্কিম চিত্রিত করে; সঠিক সংখ্যা embedding মডেল নির্বাচন, নর্মালাইজেশন ও মার্জ প্যারামিটারের উপর নির্ভর করে (উৎস ও Pyserini পুনরুৎপাদনযোগ্য স্ক্রিপ্ট দেখুন)।
সাহিত্য
- Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
- Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval 3(4):333–389. DOI:10.1561/1500000019.
- Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR. SIGIR.
- Järvelін, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
- Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.
লিংক
- Pyserini / Anserini: github.com/castorini/pyserini • github.com/castorini/anserini
- FAISS: arXiv:1702.08734
- Weaviate (Hybrid search): docs.weaviate.io/weaviate/search/hybrid
- pgvector: github.com/pgvector/pgvector
- Vespa (Hybrid search tutorial): docs.vespa.ai/en/tutorials/hybrid-search.html
টীকা
- ↑ Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval, 3(4), 333–389. DOI:10.1561/1500000019.
- ↑ Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods. SIGIR 2009, 758–759. PDF.
- ↑ Bruch, S., Gai, S., Ingber, A. (2023). An Analysis of Fusion Functions for Hybrid Retrieval. ACM TOIS 42(1):1–35. DOI:10.1145/3596512 • arXiv:2210.11934.
- ↑ Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715 (см. главы о TF‑IDF, оценке и проблеме vocabulary mismatch).
- ↑ Izacard, G. et al. (2022). Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever). TACL 10:1089–1108. arXiv:2112.09118.
- ↑ Wang, L. et al. (2022/2024). Text Embeddings by Weakly‑Supervised Contrastive Pre‑training (E5). arXiv:2212.03533.
- ↑ Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. DOI:10.1561/1500000019.
- ↑ Formal, T., Piwowarski, B., Clinchant, S. (2021). SPLADE: Sparse Lexical and Expansion Model for First Stage Ranking. arXiv:2107.05720.
- ↑ Formal, T. et al. (2022). Making Sparse Neural IR Models More Effective. Findings of EMNLP. arXiv:2205.04733.
- ↑ Formal, T. et al. (2024). SPLADE‑v3: New baselines for SPLADE. arXiv:2403.06789.
- ↑ Lin, J., Ma, X. (2021). A Few Brief Notes on DeepImpact, COIL, and uniCOIL. arXiv:2106.14807.
- ↑ Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open‑Domain QA. EMNLP. arXiv:2004.04906.
- ↑ Xiong, L. et al. (2021). Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval (ANCE). ICLR. arXiv:2007.00808.
- ↑ Izacard, G. et al. (2022). TACL. arXiv:2112.09118.
- ↑ Ni, J. et al. (2021/2022). Large Dual Encoders Are Generalizable Retrievers (GTR). EMNLP. arXiv:2112.07899.
- ↑ Wang, L. et al. (2022/2024). arXiv:2212.03533.
- ↑ Khattab, O., Zaharia, M. (2020). ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT. SIGIR. arXiv:2004.12832.
- ↑ Santhanam, K. et al. (2022). ColBERTv2 & PLAID. NAACL/ArXiv. arXiv:2112.01488; arXiv:2205.09707.
- ↑ Scheerer, J.L. et al. (2025). WARP: An Efficient Engine for Multi‑Vector Retrieval. arXiv:2501.17788.
- ↑ Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR with Sparse and Dense Representations. SIGIR. PDF.
- ↑ Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). SIGIR. PDF.
- ↑ Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../reciprocal-rank-fusion.
- ↑ OpenSearch Docs. Score ranker processor (RRF). (доступ 2025‑09‑10). docs.opensearch.org/.../score-ranker-processor/.
- ↑ Fox, E.A., Shaw, J.A. (1994). Combination of Multiple Searches. TREC‑2, NIST SP 500‑215, 243–252. PDF.
- ↑ Lee, J.H. (1997). Analyses of Multiple Evidence Combination. SIGIR, 267–276. DOI:10.1145/258525.258587.
- ↑ Hsu, D.F., Taksa, I. (2005). Comparing Rank and Score Combination Methods for Data Fusion in IR. (Tech. report). PDF.
- ↑ Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
- ↑ Hsu, D.F., Taksa, I. (2005). см. выше.
- ↑ Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
- ↑ Nogueira, R., Cho, K. (2019). Passage Re‑ranking with BERT. arXiv:1901.04085.
- ↑ Nogueira, R., Jiang, Z., Lin, J. (2020). Document Ranking with a Pretrained Sequence‑to‑Sequence Model (MonoT5). Findings of EMNLP. arXiv:2003.06713.
- ↑ Santhanam, K. et al. (2022). arXiv:2205.09707.
- ↑ Scheerer, J.L. et al. (2025). arXiv:2501.17788.
- ↑ Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.
- ↑ Thakur, N. et al. (2021). BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of IR Models. NeurIPS Datasets & Benchmarks. arXiv:2104.08663.
- ↑ Craswell, N. et al. (2020). Overview of the TREC 2019 Deep Learning Track. arXiv:2003.07820.
- ↑ Craswell, N. et al. (2021). Overview of the TREC 2020 Deep Learning Track. arXiv:2102.07662.
- ↑ Bajaj, P. et al. (2016). MS MARCO: A Human Generated MAchine Reading COmprehension Dataset. arXiv:1611.09268.
- ↑ Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
- ↑ Dean, J., Barroso, L.A. (2013). CACM. DOI:10.1145/2408776.2408794.
- ↑ Bruch, S. et al. (2023). DOI:10.1145/3596512.
- ↑ Ni, J. et al. (2021/2022). arXiv:2112.07899.
- ↑ Johnson, J., Douze, M., Jégou, H. (2017). Billion‑scale Similarity Search with GPUs (FAISS). arXiv:1702.08734.
- ↑ Malkov, Y., Yashunin, D. (2020). HNSW. IEEE TPAMI 42(4):824–836. DOI:10.1109/TPAMI.2018.2889473.
- ↑ Guo, R. et al. (2020). ScaNN: Efficient Vector Similarity Search at Scale. arXiv:1908.10396.
- ↑ Yang, P., Fang, H., Lin, J. (2018). Anserini: Reproducible IR Research with Lucene. JDIQ 10(4):1–20. DOI:10.1145/3239571.
- ↑ Lin, J. et al. (2021). SIGIR. PDF.
- ↑ Qdrant Docs. Hybrid queries (RRF, DBSF). (доступ 2025‑09‑10). qdrant.tech/.../hybrid-queries/.
- ↑ Weaviate Docs. Hybrid search. (доступ 2025‑09‑10). docs.weaviate.io/weaviate/search/hybrid.
- ↑ pgvector GitHub. (доступ 2025‑09‑10). github.com/pgvector/pgvector.
- ↑ Vespa Docs. Hybrid Text Search Tutorial. (доступ 2025‑09‑10). docs.vespa.ai/.../hybrid-search.html.
- ↑ Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../rrf.
- ↑ Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ Hsu, D.F., Taksa, I. (2005). см. выше.
- ↑ Ni, J. et al. (2021/2022). arXiv:2112.07899.
- ↑ Formal, T. et al. (2021, 2022, 2024). arXiv:2107.05720; 2205.04733; 2403.06789.
- ↑ Lewis, P. et al. (2020). arXiv:2005.11401.
- ↑ Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL. arXiv:2212.10496.
- ↑ Nogueira, R. et al. (2019). Document Expansion by Query Prediction. arXiv:1904.08375; docTTTTTquery. PDF.
- ↑ Santhanam, K. et al. (2022). arXiv:2205.09707.
- ↑ Scheerer, J.L. et al. (2025). arXiv:2501.17788.
- ↑ Pyserini BEIR Regressions (доступ 2025‑09‑10): результаты по trec‑covid для BM25/SPLADE/Contriever/BGE/Cohere. castorini.github.io/pyserini/2cr/beir.html.
- ↑ Robertson, S., Zaragoza, H. (2009). DOI:10.1561/1500000019.
- ↑ Pyserini BEIR. См. ссылку выше.
- ↑ Formal, T. et al. (2021, 2022). arXiv:2107.05720; 2205.04733.
- ↑ Pyserini BEIR.
- ↑ Izacard, G. et al. (2022). arXiv:2112.09118.
- ↑ Pyserini BEIR.
- ↑ Pyserini BEIR.
- ↑ Pyserini BEIR.
- ↑ Cormack et al. (2009). SIGIR. RRF.
- ↑ Bruch et al. (2023). TOIS.
- ↑ Elastic/OpenSearch RRF Docs.