Hybrid retrieval (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

Hybrid Retrieval (হাইব্রিড রিট্রিভ) — তথ্য অনুসন্ধানের একটি পদ্ধতির শ্রেণি, যেখানে ফলাফলের পূর্ণতা ও নির্ভুলতা বাড়াতে লেক্সিক্যাল (sparse) এবং সেমান্টিক (dense/late‑interaction) সংকেত একত্রিত করা হয়। হাইব্রিড স্কিমগুলি সঠিক পদ মিলানোর সুবিধা (BM25/TF-IDF) এবং ভেক্টরীয় নৈকট্যের (bi-encoder, late-interaction মাল্টিমডেল) সুবিধা উভয়ই ব্যবহার করে, পাশাপাশি ভিন্ন স্কেলের স্কোরিং-এর প্রতি সহনশীল র‌্যাংকিং মার্জ পদ্ধতি (যেমন Reciprocal Rank Fusion, CombSUM/CombMNZ) এবং cross‑encoder-এর মাধ্যমে পুনর্বিন্যাসও প্রয়োগ করে।[1][2][3]

সংজ্ঞা ও প্রেরণা

হাইব্রিড রিট্রিভ হলো দুটি (বা তার বেশি) স্বাধীন সংকেত চ্যানেলে সমান্তরাল বা ক্যাসকেড অনুসন্ধান, যার পরে মার্জিং এবং/অথবা পুনর্বিন্যাস করা হয়। সাধারণ উদ্দেশ্যগুলি হলো: (i) «পরিভাষাগত ফাঁক» অতিক্রম করা (প্রতিশব্দ, পুনর্প্রণয়ন), (ii) বানান ত্রুটি/রূপতত্ত্বের প্রতি সহনশীলতা, (iii) নির্দিষ্ট কোড/শনাক্তকারী উদ্ধার (যেখানে sparse মডেল শক্তিশালী), (iv) নতুন ডোমেইন/ভাষায় স্থানান্তর (যেখানে dense মডেল সেমান্টিক সাধারণীকরণ দেয়)।[4][5][6]

হাইব্রিড অনুসন্ধানের উপাদান

লেক্সিক্যাল (sparse)

  • ক্লাসিক মডেল। TF-IDF এবং BM25/BM25F — ইনভার্টেড ইন্ডেক্সের উপর নির্ভরশীল প্রমিত ভিত্তি পদ্ধতি; BM25 সম্ভাব্যতামূলক PRF কাঠামোয় প্রতিষ্ঠিত এবং প্রথম-স্তরের র‌্যাংকিংয়ে ব্যাপকভাবে ব্যবহৃত হয়।[7]
  • শিক্ষণযোগ্য sparse।
    • SPLADE / SPLADE++/v3। নিউরো-স্পার্স মডেল, যা MLM-হেড এবং বিরলতা রেগুলারাইজেশনের মাধ্যমে পদের প্রসারণ ও ওজন নির্ধারণ শেখে; শক্তিশালী ফলাফল এবং ভালো স্থানান্তরযোগ্যতা দেখায় (BEIR)।[8][9][10]
    • uniCOIL/COIL। প্রাসঙ্গিকীকৃত ইনভার্টেড তালিকা এবং তাদের সরলীকৃত সংস্করণ uniCOIL; ক্লাসিক ইনভার্টেড ইন্ডেক্সের সাথে সামঞ্জস্যপূর্ণ।[11]

সেমান্টিক (dense/late‑interaction)

  • Bi‑encoder (single‑vector)। প্রশ্ন ও নথি ভেক্টর মডেল দিয়ে এনকোড করা হয়, মিল পরিমাপ dot‑product/MIPS দিয়ে। উদাহরণ: DPR,[12] ANCE,[13] Contriever,[14] GTR,[15] E5।[16]
  • Late‑interaction (multi‑vector)। «দেরি» মিথস্ক্রিয়ায় token-স্তরের মিল মডেল করে: ColBERT/ColBERTv2; আপস হলো বৃহত্তর ইন্ডেক্স/লেটেন্সির বিনিময়ে ভালো নির্ভুলতা, যা ইঞ্জিনিয়ারিং ড্রাইভার (PLAID, WARP) দিয়ে লাঘব করা হয়।[17][18][19]

হাইব্রিডাইজেশন ও র‌্যাংকিং মার্জ স্কিম

  • সমান্তরাল অনুসন্ধান ও প্রার্থী একত্রীকরণ। স্বাধীনভাবে প্রার্থী তালিকা (sparse এবং dense) তাদের অভ্যন্তরীণ স্কোরিং সহ পাওয়া যায়; তারপর র‌্যাংকিং মার্জ করা হয়।[20]
  • RRF (Reciprocal Rank Fusion)। অসামঞ্জস্যপূর্ণ স্কোরিংয়ের প্রতি সহনশীল একটি পদ্ধতি, যা বিপরীত র‌্যাংক যোগ করে:

RRF(d)=i=1m1k+ranki(d), যেখানে সাধারণত k60[21] শিল্প-মানের ইঞ্জিনগুলিতে (Elasticsearch/OpenSearch) অন্তর্নির্মিত রিট্রিভার/প্রসেসর হিসেবে সমর্থিত।[22][23]

  • CombSUM/CombMNZ এবং অন্যান্য। ক্লাসিক «স্কোর যোগফল» ফাংশন (প্রয়োজনে নর্মালাইজেশনসহ)।[24][25][26]
  • ভারযুক্ত রৈখিক মিশ্রণ।

S(d)=αSsparse(d)+(1α)Sdense(d), α[0,1]α নির্বাচন নির্দিষ্ট বা শিক্ষণযোগ্য হতে পারে (সংগ্রহ অনুযায়ী/প্রশ্ন অনুযায়ী)।[27]

  • স্কোরিং নর্মালাইজেশন। CombSUM/CombMNZ-এর জন্য স্কেল সমন্বয়ে প্রায়ই min‑max, z‑score ইত্যাদি ব্যবহার করা হয়;[28] বিকল্পভাবে RRF কেবল র‌্যাংকের উপর নির্ভর করে।
  • গতিশীল/অভিযোজিত ওজনায়ন। প্রশ্ন রাউটিং (query routing), প্রশ্নের বৈশিষ্ট্য এবং LTR মডেল চ্যানেল নির্বাচন/ওজনের জন্য; সাম্প্রতিক গবেষণা দেখায় যে সহজ শিক্ষিত মিশ্রণ প্রায়ই RRF-কে ছাড়িয়ে যায় এবং নর্মালাইজেশনের প্রতি কম সংবেদনশীল।[29]

পুনর্বিন্যাস ও বহু-স্তরীয় pipeline

হাইব্রিড সিস্টেমগুলি সাধারণত retrieval → fusion → rerank হিসেবে নির্মিত হয়। পুনর্বিন্যাসের জন্য ব্যবহার করা হয়:

  • Cross‑encoder (BERT/T5)। সবচেয়ে নির্ভুল, কিন্তু ব্যয়বহুল: শীর্ষ-N প্রার্থী পুনর্বিন্যাসের জন্য MonoBERT/MonoT5।[30][31]
  • Late‑interaction রির‌্যাংকার হিসেবে। ColBERT পরিবার রির‌্যাংকার হিসেবেও কাজ করতে পারে; আধুনিক ত্বরণকারী (PLAID, WARP) গুণমান হ্রাস ছাড়াই লেটেন্সি কমায়।[32][33]

গুণমান ↔ লেটেন্সি/খরচ আপসটি RAG এবং কঠোর SLA-তে (p95/p99 টেইল বিলম্ব দেখুন) বিশেষভাবে গুরুত্বপূর্ণ।[34]

benchmark-এ মূল্যায়ন

  • BEIR। রিট্রিভারের zero‑/out‑of‑domain মূল্যায়নের জন্য বৈচিত্র্যময় সংগ্রহ/কাজের একটি একীভূত সেট (যেমন TREC‑COVID, NFCorpus, NQ, HotpotQA, FiQA‑2018, DBPedia‑entity, ArguAna, Webis‑Touché‑2020, FEVER/Climate‑FEVER, Scidocs, SciFact, CQADupStack ইত্যাদি)।[35]
  • TREC Deep Learning / MS MARCO। বড় ডেটা পরিবেশে রিট্রিভার ও রির‌্যাংকার প্রশিক্ষণ/মূল্যায়নের ক্লাসিক সম্পদ।[36][37][38]
  • গুণমানের মেট্রিক। nDCG@k, Recall@k, MRR; কর্মক্ষমতার জন্য — latency p50/p95/p99, QPS; পরিচালনার জন্য — মেমরি/খরচ (CPU/GPU, ইন্ডেক্স)।[39][40]
  • অ্যাবলেশন। প্রতিটি চ্যানেল/ওজনের অবদান এবং RRF-এ k ও মিশ্রণে α প্যারামিটারের প্রতি সংবেদনশীলতা নির্দিষ্ট করার পরামর্শ দেওয়া হয়; পুনর্প্রণয়ন ও OOD-শিফটের প্রতি স্থিতিশীলতা মূল্যায়ন করুন।[41][42]

ইঞ্জিনিয়ারিং দিক ও প্রোডাকশন অনুশীলন

  • ইন্ডেক্স ও ANN। MIPS/কোসাইন নৈকট্যের জন্য FAISS (Flat/HNSW/IVF‑PQ), HNSW, ScaNN।[43][44][45]
  • IR স্ট্যাক। sparse/dense ও হাইব্রিড pipeline-এর জন্য Lucene/Anserini/Pyserini; BEIR-এ «দুই-বোতামে» পুনরুৎপাদনযোগ্যতা।[46][47]
  • ভেক্টর ডেটাবেস ও সার্চ ইঞ্জিন। Qdrant, Weaviate, pgvector/PostgreSQL, Vespa, Elasticsearch/OpenSearch-এ নেটিভ হাইব্রিড সার্চ মোড (BM25F+vector) এবং/অথবা RRF/রৈখিক মিশ্রণ রয়েছে।[48][49][50][51][52]
  • RAG প্যাটার্ন। আর্কিটেকচার: retrieval → fusion → rerank → LLM প্রসঙ্গ token সীমাবদ্ধতা ও উৎস ট্রেসিংসহ।[53]
  • ইন্ডেক্স আপডেট, ডিডুপ্লিকেশন, টোকেনাইজেশন। BM25 ও ভেক্টরাইজারের মধ্যে টোকেনাইজেশন সমন্বয় গুরুত্বপূর্ণ; মিশ্রণের আগে স্কোরিং ক্যালিব্রেশন (নর্মালাইজেশন/স্কেলিং)।[54]

সীমাবদ্ধতা ও উন্মুক্ত প্রশ্ন

  • স্থানান্তরযোগ্যতা ও বহুভাষিকতা। Dense মডেল (GTR/E5) স্থানান্তর উন্নত করে, কিন্তু ডোমেইন/ভাষার প্রতি সংবেদনশীল; sparse মডেল (SPLADE) প্রায়ই OOD-তে বেশি স্থিতিশীল।[55][56]
  • LLM-এর সাথে একীভূতকরণ ও হ্যালুসিনেশন। হাইব্রিড রিট্রিভ RAG প্রসঙ্গে বাদ পড়া ও শব্দাড়ম্বর কমায়, কিন্তু হ্যালুসিনেশন সম্পূর্ণ দূর করে না; কঠোর রির‌্যাংকার ও উৎস ফিল্টারিং প্রয়োজন।[57]
  • খরচ ও গোপনীয়তা। Multi‑vector ইন্ডেক্স সংরক্ষণ, সংকোচন, এনক্রিপশন ও on‑prem স্ট্যাক; TCO মূল্যায়ন।
  • প্রবণতা। নথি/প্রশ্ন প্রসারণ হিসেবে HyDE/doc2query/PRF;[58][59] মিশ্রণ প্রশিক্ষণ (per‑query α), আরও দক্ষ late‑interaction (PLAID/WARP), দীর্ঘ নথি ও মাল্টিভেক্টর ইন্ডেক্স।[60][61]

পদ্ধতির তুলনামূলক সারণি

২০২৫‑০৯‑১০ পর্যন্ত (BEIR trec‑covid সংগ্রহে উদাহরণ; nDCG@10 / Recall@100):[62]

trec‑covid-এ পদ্ধতির তুলনা
পদ্ধতি ধরন (sparse/dense/hybrid) ধারণা/মডেল মার্জ স্কিম রির‌্যাংকার nDCG@10 / R@100 Latency (আপেক্ষিক) উৎস
BM25 sparse সঠিক পদ মিলান (PRF/BM25) 0.595 / 0.109 অত্যন্ত কম [63][64]
SPLADE++ (ED) sparse (learned) বিরল পদ প্রসারণ/ওজন 0.727 / 0.128 কম–মাঝারি [65][66]
Contriever (MS MARCO FT) dense কন্ট্রাস্টিভ লার্নিং bi-encoder 0.596 / 0.091 মাঝারি [67][68]
BGE‑base‑en‑v1.5 dense শক্তিশালী সার্বজনীন embedding মডেল 0.781 / 0.141 মাঝারি [69]
Cohere embed‑english‑v3.0 dense শিল্প-মানের টেক্সট embedding মডেল 0.818 / 0.159 মাঝারি [70]
BM25 + dense (উদাহরণ: BM25+BGE) hybrid সমান্তরাল রিট্রিভ + তালিকা মার্জ RRF (k≈60) বা ভারযুক্ত মিশ্রণ ঐচ্ছিক: MonoT5/ColBERT (বাস্তবায়ন অনুযায়ী পরিবর্তিত হয়; সাধারণত > সেরা একক চ্যানেল) মাঝারি [71][72][73]

দ্রষ্টব্য: শেষ সারিটি স্কিম চিত্রিত করে; সঠিক সংখ্যা embedding মডেল নির্বাচন, নর্মালাইজেশন ও মার্জ প্যারামিটারের উপর নির্ভর করে (উৎস ও Pyserini পুনরুৎপাদনযোগ্য স্ক্রিপ্ট দেখুন)।

সাহিত্য

  • Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
  • Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval 3(4):333–389. DOI:10.1561/1500000019.
  • Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR. SIGIR.
  • Järvelін, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  • Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.

লিংক

  • Pyserini / Anserini: github.com/castorini/pyserini • github.com/castorini/anserini
  • FAISS: arXiv:1702.08734
  • Weaviate (Hybrid search): docs.weaviate.io/weaviate/search/hybrid
  • pgvector: github.com/pgvector/pgvector
  • Vespa (Hybrid search tutorial): docs.vespa.ai/en/tutorials/hybrid-search.html

টীকা

  1. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval, 3(4), 333–389. DOI:10.1561/1500000019.
  2. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods. SIGIR 2009, 758–759. PDF.
  3. Bruch, S., Gai, S., Ingber, A. (2023). An Analysis of Fusion Functions for Hybrid Retrieval. ACM TOIS 42(1):1–35. DOI:10.1145/3596512 • arXiv:2210.11934.
  4. Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715 (см. главы о TF‑IDF, оценке и проблеме vocabulary mismatch).
  5. Izacard, G. et al. (2022). Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever). TACL 10:1089–1108. arXiv:2112.09118.
  6. Wang, L. et al. (2022/2024). Text Embeddings by Weakly‑Supervised Contrastive Pre‑training (E5). arXiv:2212.03533.
  7. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. DOI:10.1561/1500000019.
  8. Formal, T., Piwowarski, B., Clinchant, S. (2021). SPLADE: Sparse Lexical and Expansion Model for First Stage Ranking. arXiv:2107.05720.
  9. Formal, T. et al. (2022). Making Sparse Neural IR Models More Effective. Findings of EMNLP. arXiv:2205.04733.
  10. Formal, T. et al. (2024). SPLADE‑v3: New baselines for SPLADE. arXiv:2403.06789.
  11. Lin, J., Ma, X. (2021). A Few Brief Notes on DeepImpact, COIL, and uniCOIL. arXiv:2106.14807.
  12. Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open‑Domain QA. EMNLP. arXiv:2004.04906.
  13. Xiong, L. et al. (2021). Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval (ANCE). ICLR. arXiv:2007.00808.
  14. Izacard, G. et al. (2022). TACL. arXiv:2112.09118.
  15. Ni, J. et al. (2021/2022). Large Dual Encoders Are Generalizable Retrievers (GTR). EMNLP. arXiv:2112.07899.
  16. Wang, L. et al. (2022/2024). arXiv:2212.03533.
  17. Khattab, O., Zaharia, M. (2020). ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT. SIGIR. arXiv:2004.12832.
  18. Santhanam, K. et al. (2022). ColBERTv2 & PLAID. NAACL/ArXiv. arXiv:2112.01488; arXiv:2205.09707.
  19. Scheerer, J.L. et al. (2025). WARP: An Efficient Engine for Multi‑Vector Retrieval. arXiv:2501.17788.
  20. Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR with Sparse and Dense Representations. SIGIR. PDF.
  21. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). SIGIR. PDF.
  22. Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../reciprocal-rank-fusion.
  23. OpenSearch Docs. Score ranker processor (RRF). (доступ 2025‑09‑10). docs.opensearch.org/.../score-ranker-processor/.
  24. Fox, E.A., Shaw, J.A. (1994). Combination of Multiple Searches. TREC‑2, NIST SP 500‑215, 243–252. PDF.
  25. Lee, J.H. (1997). Analyses of Multiple Evidence Combination. SIGIR, 267–276. DOI:10.1145/258525.258587.
  26. Hsu, D.F., Taksa, I. (2005). Comparing Rank and Score Combination Methods for Data Fusion in IR. (Tech. report). PDF.
  27. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  28. Hsu, D.F., Taksa, I. (2005). см. выше.
  29. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  30. Nogueira, R., Cho, K. (2019). Passage Re‑ranking with BERT. arXiv:1901.04085.
  31. Nogueira, R., Jiang, Z., Lin, J. (2020). Document Ranking with a Pretrained Sequence‑to‑Sequence Model (MonoT5). Findings of EMNLP. arXiv:2003.06713.
  32. Santhanam, K. et al. (2022). arXiv:2205.09707.
  33. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  34. Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.
  35. Thakur, N. et al. (2021). BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of IR Models. NeurIPS Datasets & Benchmarks. arXiv:2104.08663.
  36. Craswell, N. et al. (2020). Overview of the TREC 2019 Deep Learning Track. arXiv:2003.07820.
  37. Craswell, N. et al. (2021). Overview of the TREC 2020 Deep Learning Track. arXiv:2102.07662.
  38. Bajaj, P. et al. (2016). MS MARCO: A Human Generated MAchine Reading COmprehension Dataset. arXiv:1611.09268.
  39. Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  40. Dean, J., Barroso, L.A. (2013). CACM. DOI:10.1145/2408776.2408794.
  41. Bruch, S. et al. (2023). DOI:10.1145/3596512.
  42. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  43. Johnson, J., Douze, M., Jégou, H. (2017). Billion‑scale Similarity Search with GPUs (FAISS). arXiv:1702.08734.
  44. Malkov, Y., Yashunin, D. (2020). HNSW. IEEE TPAMI 42(4):824–836. DOI:10.1109/TPAMI.2018.2889473.
  45. Guo, R. et al. (2020). ScaNN: Efficient Vector Similarity Search at Scale. arXiv:1908.10396.
  46. Yang, P., Fang, H., Lin, J. (2018). Anserini: Reproducible IR Research with Lucene. JDIQ 10(4):1–20. DOI:10.1145/3239571.
  47. Lin, J. et al. (2021). SIGIR. PDF.
  48. Qdrant Docs. Hybrid queries (RRF, DBSF). (доступ 2025‑09‑10). qdrant.tech/.../hybrid-queries/.
  49. Weaviate Docs. Hybrid search. (доступ 2025‑09‑10). docs.weaviate.io/weaviate/search/hybrid.
  50. pgvector GitHub. (доступ 2025‑09‑10). github.com/pgvector/pgvector.
  51. Vespa Docs. Hybrid Text Search Tutorial. (доступ 2025‑09‑10). docs.vespa.ai/.../hybrid-search.html.
  52. Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../rrf.
  53. Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  54. Hsu, D.F., Taksa, I. (2005). см. выше.
  55. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  56. Formal, T. et al. (2021, 2022, 2024). arXiv:2107.05720; 2205.04733; 2403.06789.
  57. Lewis, P. et al. (2020). arXiv:2005.11401.
  58. Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL. arXiv:2212.10496.
  59. Nogueira, R. et al. (2019). Document Expansion by Query Prediction. arXiv:1904.08375; docTTTTTquery. PDF.
  60. Santhanam, K. et al. (2022). arXiv:2205.09707.
  61. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  62. Pyserini BEIR Regressions (доступ 2025‑09‑10): результаты по trec‑covid для BM25/SPLADE/Contriever/BGE/Cohere. castorini.github.io/pyserini/2cr/beir.html.
  63. Robertson, S., Zaragoza, H. (2009). DOI:10.1561/1500000019.
  64. Pyserini BEIR. См. ссылку выше.
  65. Formal, T. et al. (2021, 2022). arXiv:2107.05720; 2205.04733.
  66. Pyserini BEIR.
  67. Izacard, G. et al. (2022). arXiv:2112.09118.
  68. Pyserini BEIR.
  69. Pyserini BEIR.
  70. Pyserini BEIR.
  71. Cormack et al. (2009). SIGIR. RRF.
  72. Bruch et al. (2023). TOIS.
  73. Elastic/OpenSearch RRF Docs.