Hybrid retrieval (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

Hybrid Retrieval (ہائبرڈ ریٹریول) — معلوماتی تلاش کے طریقوں کا ایک زمرہ جس میں لغوی (sparse) اور معنوی (dense/late‑interaction) اشارے یکجا کیے جاتے ہیں تاکہ نتائج کی مکمّلیت اور درستگی بہتر ہو۔ ہائبرڈ اسکیمیں اصطلاحات کی عین مطابقت (BM25/TF-IDF) اور ویکٹر قربت (bi-encoder، دیر سے تعامل کرنے والے ملٹی ماڈل) کے فوائد کو یکجا کرتی ہیں، نیز مختلف پیمانوں کے اسکورنگ کے خلاف مستحکم رینکنگ ضم کرنے کے طریقے (مثلاً Reciprocal Rank Fusion، CombSUM/CombMNZ) اور cross-encoder کے ذریعے دوبارہ ترتیب دینا (re-ranking) بھی استعمال کرتی ہیں۔[1][2][3]

تعریف اور محرکات

ہائبرڈ ریٹریول دو یا زائد آزاد سگنل چینلوں میں متوازی یا سلسلہ وار تلاش ہے جس کے بعد ضم کرنا اور/یا دوبارہ ترتیب دینا ہوتا ہے۔ معمول کے محرکات یہ ہیں: (i) «اصطلاحاتی فرق» پر قابو پانا (مترادفات، دوبارہ تشکیل)، (ii) ہجّے کی غلطیوں/صرفیات کے خلاف استحکام، (iii) مخصوص کوڈز/شناخت کنندگان نکالنا (جہاں sparse ماڈل قوی ہو)، (iv) نئے شعبوں/زبانوں میں منتقلی (جہاں dense ماڈل معنوی تعمیم فراہم کرتے ہیں)۔[4][5][6]

ہائبرڈ تلاش کے اجزاء

لغوی (sparse)

  • کلاسیکی ماڈل۔ TF-IDF اور BM25/BM25F — الٹے اشاریوں پر معیاری بنیادی طریقے؛ BM25 احتمالاتی PRF فریم ورک میں مبنی ہے اور ترتیب دینے کے پہلے مرحلے میں وسیع پیمانے پر استعمال ہوتا ہے۔[7]
  • قابلِ تعلیم sparse۔
    • SPLADE / SPLADE++/v3۔ ایک نیورل sparse ماڈل جو MLM ہیڈ کے ذریعے اصطلاحات کی توسیع اور وزن کاری کو تُنُکی ریگولرائزیشن کے ساتھ سیکھتا ہے؛ مضبوط نتائج اور بہترین منتقلیت (BEIR) ظاہر کرتا ہے۔[8][9][10]
    • uniCOIL/COIL۔ سیاق و سباق سے آگاہ الٹی فہرستیں اور ان کا آسان ورژن uniCOIL؛ کلاسیکی الٹے اشاریوں کے ساتھ ہم آہنگ۔[11]

معنوی (dense/late‑interaction)

  • Bi‑encoder (single‑vector)۔ سوال اور دستاویز کو ویکٹر ماڈلز کے ذریعے انکوڈ کیا جاتا ہے، مشابہت dot-product/MIPS سے ناپی جاتی ہے۔ مثالیں: DPR،[12] ANCE،[13] Contriever،[14] GTR،[15] E5۔[16]
  • Late‑interaction (multi‑vector)۔ «دیر سے» تعامل پر token سطح کی مطابقتیں ماڈل کرتے ہیں: ColBERT/ColBERTv2؛ سمجھوتہ — بڑے انڈیکس/لیٹنسی پر بہتر درستگی، جو انجینئرنگ ڈرائیورز (PLAID، WARP) سے کم ہوتی ہے۔[17][18][19]

ہائبرڈائزیشن اور رینکنگ ضم کرنے کی اسکیمیں

  • متوازی تلاش اور امیدواروں کا اتحاد۔ sparse اور dense چینلوں سے اپنے اندرونی اسکورنگ کے ساتھ امیدواروں کی فہرستیں آزادانہ حاصل کریں؛ پھر رینکنگ ضم کریں۔[20]
  • RRF (Reciprocal Rank Fusion)۔ غیر موازی اسکورنگ کے خلاف مستحکم تکنیک جو الٹے ترتیبی درجوں کو جمع کرتی ہے:

RRF(d)=i=1m1k+ranki(d)، جہاں عام طور پر k60۔[21] صنعتی انجنوں (Elasticsearch/OpenSearch) میں بطور بلٹ ان retriever/processor معاونت حاصل ہے۔[22][23]

  • CombSUM/CombMNZ وغیرہ۔ «اسکور جمع کرنے» کے کلاسیکی افعال (ضرورت پڑنے پر نارملائزیشن کے ساتھ)۔[24][25][26]
  • وزنی خطی آمیزش۔

S(d)=αSsparse(d)+(1α)Sdense(d)، α[0,1]۔ α کا انتخاب ثابت یا قابلِ تعلیم (مجموعہ/سوال کے مطابق) ہو سکتا ہے۔[27]

  • اسکورنگ نارملائزیشن۔ CombSUM/CombMNZ کے لیے پیمانوں کی ہم آہنگی ہیتو اکثر min‑max، z‑score وغیرہ استعمال ہوتے ہیں؛[28] متبادلاً RRF صرف ترتیبی درجوں پر منحصر ہے۔
  • متحرک/انطباقی وزن کاری۔ سوال کی راستہ سازی (query routing)، سوال کی خصوصیات اور LTR ماڈل چینلوں کے انتخاب/وزن کے لیے؛ جدید کام ظاہر کرتے ہیں کہ سادہ سیکھی ہوئی آمیزش اکثر RRF سے بہتر ہوتی ہے اور نارملائزیشن کے لیے کم حساس ہے۔[29]

دوبارہ ترتیب اور کثیر مرحلاتی پائپ لائنیں

ہائبرڈ نظام عام طور پر retrieval → fusion → rerank کے طور پر بنائے جاتے ہیں۔ دوبارہ ترتیب کے لیے استعمال کیا جاتا ہے:

  • Cross‑encoder (BERT/T5)۔ سب سے درست لیکن مہنگے: MonoBERT/MonoT5 ٹاپ‑N امیدواروں کو دوبارہ ترتیب دینے کے لیے۔[30][31]
  • Late‑interaction بطور re-ranker۔ ColBERT خاندان بطور re-ranker بھی کام کر سکتا ہے؛ جدید ایکسلریٹر (PLAID، WARP) معیار میں کمی کے بغیر لیٹنسی کم کرتے ہیں۔[32][33]

معیار ↔ لیٹنسی/لاگت کا سمجھوتہ RAG اور سخت SLA (دیکھیں tail لیٹنسی p95/p99) میں خاص طور پر اہم ہے۔[34]

Benchmark پر جائزہ

  • BEIR۔ zero‑/out‑of‑domain retriever جائزے کے لیے متنوع مجموعوں/کاموں کا یکساں سیٹ (مثلاً TREC‑COVID، NFCorpus، NQ، HotpotQA، FiQA‑2018، DBPedia‑entity، ArguAna، Webis‑Touché‑2020، FEVER/Climate‑FEVER، Scidocs، SciFact، CQADupStack وغیرہ)۔[35]
  • TREC Deep Learning / MS MARCO۔ بڑے ڈیٹا موڈ میں retriever اور re-ranker کی تربیت/جائزے کے لیے کلاسیکی وسائل۔[36][37][38]
  • معیار کی پیمائش۔ nDCG@k، Recall@k، MRR؛ کارکردگی کے لیے — latency p50/p95/p99، QPS؛ استعمال کے لیے — میموری/لاگت (CPU/GPU، انڈیکس)۔[39][40]
  • ابلیشن۔ ہر چینل/وزن کی شراکت اور RRF میں k اور آمیزش میں α کے پیرامیٹرز کے لیے حساسیت ریکارڈ کرنے کی سفارش کی جاتی ہے؛ دوبارہ تشکیل اور OOD تبدیلیوں کے خلاف استحکام کا جائزہ لیں۔[41][42]

انجینئرنگ پہلو اور پروڈکشن طریقے

  • انڈیکس اور ANN۔ FAISS (Flat/HNSW/IVF‑PQ)، HNSW، ScaNN برائے MIPS/کوسائن قربت۔[43][44][45]
  • IR اسٹیک۔ sparse/dense اور ہائبرڈ پائپ لائنوں کے لیے Lucene/Anserini/Pyserini؛ BEIR پر «دو بٹن» تولیدپذیری۔[46][47]
  • ویکٹر ڈیٹابیس اور سرچ انجن۔ Qdrant، Weaviate، pgvector/PostgreSQL، Vespa، Elasticsearch/OpenSearch میں ہائبرڈ سرچ کے مقامی موڈ (BM25F+vector) اور/یا RRF/خطی آمیزش موجود ہے۔[48][49][50][51][52]
  • RAG پیٹرن۔ آرکیٹیکچر: retrieval → fusion → rerank → LLM سیاق و سباق token حد اور ماخذ ٹریسنگ کے ساتھ۔[53]
  • انڈیکس کی تازہ کاری، ڈی ڈپلیکیشن، tokenization۔ BM25 اور vectorizer کے درمیان tokenization کی ہم آہنگی ضروری ہے؛ آمیزش سے پہلے اسکورنگ کیلیبریشن (نارملائزیشن/اسکیلنگ)۔[54]

حدود اور کھلے سوالات

  • منتقلیت اور کثیر لسانیت۔ Dense ماڈل (GTR/E5) منتقلی بہتر کرتے ہیں لیکن شعبے/زبان کے لیے حساس ہیں؛ sparse ماڈل (SPLADE) اکثر OOD میں زیادہ مستحکم ہوتے ہیں۔[55][56]
  • LLM کے ساتھ انضمام اور فریب۔ ہائبرڈ ریٹریول RAG سیاق و سباق میں چھوٹ اور شور کم کرتا ہے، لیکن فریب کو مکمل طور پر ختم نہیں کرتا؛ سخت re-ranker اور ماخذ فلٹریشن ضروری ہے۔[57]
  • لاگت اور رازداری۔ multi-vector انڈیکس کا ذخیرہ، کمپریشن، انکرپشن اور on‑prem اسٹیک؛ TCO کا جائزہ۔
  • رجحانات۔ دستاویز/سوال توسیع کے طور پر HyDE/doc2query/PRF؛[58][59] آمیزش کی تربیت (per‑query α)، زیادہ موثر late‑interaction (PLAID/WARP)، لمبی دستاویزات اور ملٹی ویکٹر انڈیکس۔[60][61]

طریقوں کی تقابلی جدول

2025‑09‑10 کی صورتحال کے مطابق (BEIR trec‑covid مجموعے پر مثال؛ nDCG@10 / Recall@100):[62]

trec‑covid پر طریقوں کا موازنہ
طریقہ قسم (sparse/dense/hybrid) خیال/ماڈل ضم کرنے کی اسکیم Re-ranker nDCG@10 / R@100 Latency (نسبتی) ماخذ
BM25 sparse اصطلاحات کی عین مطابقت (PRF/BM25) 0.595 / 0.109 بہت کم [63][64]
SPLADE++ (ED) sparse (learned) اصطلاحات کی تُنُک توسیع/وزن کاری 0.727 / 0.128 کم–درمیانی [65][66]
Contriever (MS MARCO FT) dense متضاد تعلیم کا bi-encoder 0.596 / 0.091 درمیانی [67][68]
BGE‑base‑en‑v1.5 dense مضبوط عالمی embedder 0.781 / 0.141 درمیانی [69]
Cohere embed‑english‑v3.0 dense صنعتی متنی embedding ماڈل 0.818 / 0.159 درمیانی [70]
BM25 + dense (مثال: BM25+BGE) hybrid متوازی ریٹریول + فہرستوں کا ضم RRF (k≈60) یا وزنی آمیزش اختیاری: MonoT5/ColBERT (نفاذ کے مطابق مختلف؛ عام طور پر > بہترین واحد چینل) درمیانی [71][72][73]

نوٹ: آخری سطر اسکیم کی وضاحت کرتی ہے؛ عین اعداد embedder کے انتخاب، نارملائزیشن اور ضم کرنے کے پیرامیٹرز پر منحصر ہیں (ماخذ اور Pyserini کی قابلِ تولید اسکرپٹ دیکھیں)۔

کتابیات

  • Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
  • Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval 3(4):333–389. DOI:10.1561/1500000019.
  • Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR. SIGIR.
  • Järvelин, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  • Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.

روابط

  • Pyserini / Anserini: github.com/castorini/pyserini • github.com/castorini/anserini
  • FAISS: arXiv:1702.08734
  • Weaviate (Hybrid search): docs.weaviate.io/weaviate/search/hybrid
  • pgvector: github.com/pgvector/pgvector
  • Vespa (Hybrid search tutorial): docs.vespa.ai/en/tutorials/hybrid-search.html

حواشی

  1. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval, 3(4), 333–389. DOI:10.1561/1500000019.
  2. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods. SIGIR 2009, 758–759. PDF.
  3. Bruch, S., Gai, S., Ingber, A. (2023). An Analysis of Fusion Functions for Hybrid Retrieval. ACM TOIS 42(1):1–35. DOI:10.1145/3596512 • arXiv:2210.11934.
  4. Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715 (см. главы о TF‑IDF, оценке и проблеме vocabulary mismatch).
  5. Izacard, G. et al. (2022). Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever). TACL 10:1089–1108. arXiv:2112.09118.
  6. Wang, L. et al. (2022/2024). Text Embeddings by Weakly‑Supervised Contrastive Pre‑training (E5). arXiv:2212.03533.
  7. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. DOI:10.1561/1500000019.
  8. Formal, T., Piwowarski, B., Clinchant, S. (2021). SPLADE: Sparse Lexical and Expansion Model for First Stage Ranking. arXiv:2107.05720.
  9. Formal, T. et al. (2022). Making Sparse Neural IR Models More Effective. Findings of EMNLP. arXiv:2205.04733.
  10. Formal, T. et al. (2024). SPLADE‑v3: New baselines for SPLADE. arXiv:2403.06789.
  11. Lin, J., Ma, X. (2021). A Few Brief Notes on DeepImpact, COIL, and uniCOIL. arXiv:2106.14807.
  12. Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open‑Domain QA. EMNLP. arXiv:2004.04906.
  13. Xiong, L. et al. (2021). Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval (ANCE). ICLR. arXiv:2007.00808.
  14. Izacard, G. et al. (2022). TACL. arXiv:2112.09118.
  15. Ni, J. et al. (2021/2022). Large Dual Encoders Are Generalizable Retrievers (GTR). EMNLP. arXiv:2112.07899.
  16. Wang, L. et al. (2022/2024). arXiv:2212.03533.
  17. Khattab, O., Zaharia, M. (2020). ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT. SIGIR. arXiv:2004.12832.
  18. Santhanam, K. et al. (2022). ColBERTv2 & PLAID. NAACL/ArXiv. arXiv:2112.01488; arXiv:2205.09707.
  19. Scheerer, J.L. et al. (2025). WARP: An Efficient Engine for Multi‑Vector Retrieval. arXiv:2501.17788.
  20. Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR with Sparse and Dense Representations. SIGIR. PDF.
  21. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). SIGIR. PDF.
  22. Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../reciprocal-rank-fusion.
  23. OpenSearch Docs. Score ranker processor (RRF). (доступ 2025‑09‑10). docs.opensearch.org/.../score-ranker-processor/.
  24. Fox, E.A., Shaw, J.A. (1994). Combination of Multiple Searches. TREC‑2, NIST SP 500‑215, 243–252. PDF.
  25. Lee, J.H. (1997). Analyses of Multiple Evidence Combination. SIGIR, 267–276. DOI:10.1145/258525.258587.
  26. Hsu, D.F., Taksa, I. (2005). Comparing Rank and Score Combination Methods for Data Fusion in IR. (Tech. report). PDF.
  27. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  28. Hsu, D.F., Taksa, I. (2005). см. выше.
  29. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  30. Nogueira, R., Cho, K. (2019). Passage Re‑ranking with BERT. arXiv:1901.04085.
  31. Nogueira, R., Jiang, Z., Lin, J. (2020). Document Ranking with a Pretrained Sequence‑to‑Sequence Model (MonoT5). Findings of EMNLP. arXiv:2003.06713.
  32. Santhanam, K. et al. (2022). arXiv:2205.09707.
  33. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  34. Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.
  35. Thakur, N. et al. (2021). BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of IR Models. NeurIPS Datasets & Benchmarks. arXiv:2104.08663.
  36. Craswell, N. et al. (2020). Overview of the TREC 2019 Deep Learning Track. arXiv:2003.07820.
  37. Craswell, N. et al. (2021). Overview of the TREC 2020 Deep Learning Track. arXiv:2102.07662.
  38. Bajaj, P. et al. (2016). MS MARCO: A Human Generated MAchine Reading COmprehension Dataset. arXiv:1611.09268.
  39. Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  40. Dean, J., Barroso, L.A. (2013). CACM. DOI:10.1145/2408776.2408794.
  41. Bruch, S. et al. (2023). DOI:10.1145/3596512.
  42. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  43. Johnson, J., Douze, M., Jégou, H. (2017). Billion‑scale Similarity Search with GPUs (FAISS). arXiv:1702.08734.
  44. Malkov, Y., Yashunin, D. (2020). HNSW. IEEE TPAMI 42(4):824–836. DOI:10.1109/TPAMI.2018.2889473.
  45. Guo, R. et al. (2020). ScaNN: Efficient Vector Similarity Search at Scale. arXiv:1908.10396.
  46. Yang, P., Fang, H., Lin, J. (2018). Anserini: Reproducible IR Research with Lucene. JDIQ 10(4):1–20. DOI:10.1145/3239571.
  47. Lin, J. et al. (2021). SIGIR. PDF.
  48. Qdrant Docs. Hybrid queries (RRF, DBSF). (доступ 2025‑09‑10). qdrant.tech/.../hybrid-queries/.
  49. Weaviate Docs. Hybrid search. (доступ 2025‑09‑10). docs.weaviate.io/weaviate/search/hybrid.
  50. pgvector GitHub. (доступ 2025‑09‑10). github.com/pgvector/pgvector.
  51. Vespa Docs. Hybrid Text Search Tutorial. (доступ 2025‑09‑10). docs.vespa.ai/.../hybrid-search.html.
  52. Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../rrf.
  53. Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  54. Hsu, D.F., Taksa, I. (2005). см. выше.
  55. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  56. Formal, T. et al. (2021, 2022, 2024). arXiv:2107.05720; 2205.04733; 2403.06789.
  57. Lewis, P. et al. (2020). arXiv:2005.11401.
  58. Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL. arXiv:2212.10496.
  59. Nogueira, R. et al. (2019). Document Expansion by Query Prediction. arXiv:1904.08375; docTTTTTquery. PDF.
  60. Santhanam, K. et al. (2022). arXiv:2205.09707.
  61. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  62. Pyserini BEIR Regressions (доступ 2025‑09‑10): результаты по trec‑covid для BM25/SPLADE/Contriever/BGE/Cohere. castorini.github.io/pyserini/2cr/beir.html.
  63. Robertson, S., Zaragoza, H. (2009). DOI:10.1561/1500000019.
  64. Pyserini BEIR. См. ссылку выше.
  65. Formal, T. et al. (2021, 2022). arXiv:2107.05720; 2205.04733.
  66. Pyserini BEIR.
  67. Izacard, G. et al. (2022). arXiv:2112.09118.
  68. Pyserini BEIR.
  69. Pyserini BEIR.
  70. Pyserini BEIR.
  71. Cormack et al. (2009). SIGIR. RRF.
  72. Bruch et al. (2023). TOIS.
  73. Elastic/OpenSearch RRF Docs.