Hybrid retrieval (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

Hybrid Retrieval (hibrit retrieval) — sözlüksel (sparse) ve anlamsal (dense/late‑interaction) sinyalleri birleştirerek erişim tamlığını ve hassasiyetini artırmaya yönelik bilgi erişim yöntemleri sınıfıdır. Hibrit şemalar, tam terim eşleşmesinin (BM25/TF-IDF) ve vektör yakınlığının (bi-encoder'lar, geç etkileşimli çok vektörlü modeller) avantajlarını bir araya getirir; ayrıca farklı ölçekli skorlamaya karşı dayanıklı sıralama birleştirme yöntemlerini (örneğin Reciprocal Rank Fusion, CombSUM/CombMNZ) ve cross-encoder ile yeniden sıralamayı kullanır.[1][2][3]

Tanım ve Motivasyon

Hibrit retrieval — iki (veya daha fazla) bağımsız sinyal kanalında paralel ya da kademeli arama yapılması ve ardından birleştirme ve/veya yeniden sıralama uygulanmasıdır. Tipik motivasyonlar: (i) "terminolojik boşluğun" aşılması (eş anlamlılar, yeniden ifadeler), (ii) yazım hatalarına/morfolojiye dayanıklılık, (iii) belirli kodların/tanımlayıcıların çıkarılması (sparse modelin güçlü olduğu durum), (iv) yeni alan/dillere aktarım (dense modellerin anlamsal genelleme sağladığı durum).[4][5][6]

Hibrit Aramanın Bileşenleri

Sözlüksel (sparse)

  • Klasik modeller. TF-IDF ve BM25/BM25F — ters çevrilmiş indeksler üzerindeki standart temel yöntemler; BM25, olasılıksal PRF çerçevesinde gerekçelendirilmiş olup ilk aşama sıralamada yaygın biçimde kullanılmaktadır.[7]
  • Öğrenilebilir sparse.
    • SPLADE / SPLADE++/v3. Seyreklik düzenlemesiyle MLM başlığı üzerinden terim genişletme ve ağırlıklandırmayı öğrenen bir nöro-sparse model; güçlü sonuçlar ve iyi aktarılabilirlik göstermektedir (BEIR).[8][9][10]
    • uniCOIL/COIL. Bağlamsal ters çevrilmiş listeler ve bunların basitleştirilmiş sürümü olan uniCOIL; klasik ters çevrilmiş indekslerle uyumludur.[11]

Anlamsal (dense/late‑interaction)

  • Bi‑encoder (tek vektör). Sorgu ve belge vektör modelleriyle kodlanır; benzerlik dot-product/MIPS ile hesaplanır. Örnekler: DPR,[12] ANCE,[13] Contriever,[14] GTR,[15] E5.[16]
  • Late‑interaction (çok vektör). "Geç" etkileşimde token düzeyindeki karşılıkları modeller: ColBERT/ColBERTv2; daha büyük indeks/gecikme pahasına daha iyi doğruluk sağlar, mühendislik araçlarıyla hafifletilir (PLAID, WARP).[17][18][19]

Hibritleştirme ve Sıralama Birleştirme Şemaları

  • Paralel arama ve aday birleştirme. Sparse ve dense kanallarından kendi iç skorlarıyla bağımsız aday listeleri elde edilir; ardından sıralama birleştirme uygulanır.[20]
  • RRF (Reciprocal Rank Fusion). Uyumsuz skorlamaya dayanıklı, ters sıraları toplayan teknik:

RRF(d)=i=1m1k+ranki(d), genellikle k60.[21] Endüstriyel arama motorlarında (Elasticsearch/OpenSearch) yerleşik retriever/işlemci olarak desteklenmektedir.[22][23]

  • CombSUM/CombMNZ ve diğerleri. Gerektiğinde normalleştirme ile klasik "skor toplama" fonksiyonları.[24][25][26]
  • Ağırlıklı doğrusal karışım.

S(d)=αSsparse(d)+(1α)Sdense(d), α[0,1]. α seçimi sabit ya da öğrenilebilir olabilir (koleksiyona/sorguya göre).[27]

  • Skor normalleştirme. CombSUM/CombMNZ için ölçeklerin uyumlandırılması amacıyla çoğunlukla min‑max, z‑score vb. uygulanır;[28] alternatif olarak RRF yalnızca sıralara dayanır.
  • Dinamik/uyarlamalı ağırlıklandırma. Kanal seçimi/ağırlığı için sorgu yönlendirme (query routing), sorgu özellikleri ve LTR modelleri; güncel çalışmalar, basit eğitilmiş karışımın çoğunlukla RRF'yi aştığını ve normalleştirmeye az duyarlı olduğunu göstermektedir.[29]

Yeniden Sıralama ve Çok Aşamalı Pipeline'lar

Hibrit sistemler genellikle retrieval → fusion → rerank şeklinde kurulmaktadır. Yeniden sıralama için şunlar kullanılır:

  • Cross-encoder'lar (BERT/T5). En doğru ancak en maliyetli yöntem: ilk N aday için MonoBERT/MonoT5.[30][31]
  • Late‑interaction yeniden sıralayıcı olarak. ColBERT ailesi yeniden sıralayıcı olarak da kullanılabilir; modern hızlandırıcılar (PLAID, WARP) kalite kaybı olmaksızın gecikmeyi azaltır.[32][33]

Kalite ↔ gecikme/maliyet dengesi, RAG ve katı SLA koşullarında (bkz. kuyruk gecikmeleri p95/p99) özellikle önem taşımaktadır.[34]

Benchmark Değerlendirmesi

  • BEIR. Retriever'ların sıfır/alan dışı değerlendirmesi için heterojen koleksiyon/görevlerden oluşan birleşik küme (örn. TREC‑COVID, NFCorpus, NQ, HotpotQA, FiQA‑2018, DBPedia‑entity, ArguAna, Webis‑Touché‑2020, FEVER/Climate‑FEVER, Scidocs, SciFact, CQADupStack vb.).[35]
  • TREC Deep Learning / MS MARCO. Büyük veri koşullarında retriever ve yeniden sıralayıcı eğitimi/değerlendirmesi için klasik kaynaklar.[36][37][38]
  • Kalite metrikleri. nDCG@k, Recall@k, MRR; performans için — gecikme p50/p95/p99, QPS; işletim için — bellek/maliyet (CPU/GPU, indeks).[39][40]
  • Ablasyon çalışmaları. Her kanalın/ağırlığın katkısının, RRF'deki k ve karışımdaki α parametrelerine duyarlılığın sabitlenmesi; yeniden ifadelere ve OOD kaymasına karşı dayanıklılığın değerlendirilmesi önerilmektedir.[41][42]

Mühendislik Boyutları ve Prodüksiyon Pratikleri

  • İndeksler ve ANN. MIPS/kosinüs benzerliği için FAISS (Flat/HNSW/IVF‑PQ), HNSW, ScaNN.[43][44][45]
  • IR yığını. Sparse/dense ve hibrit pipeline'lar için Lucene/Anserini/Pyserini; BEIR üzerinde "iki tuşla" yeniden üretilebilirlik.[46][47]
  • Vektör veritabanları ve arama motorları. Qdrant, Weaviate, pgvector/PostgreSQL, Vespa, Elasticsearch/OpenSearch yerel hibrit arama modlarına (BM25F+vektör) ve/veya RRF/doğrusal karışıma sahiptir.[48][49][50][51][52]
  • RAG pattern'i. Mimari: retrieval → fusion → rerank → LLM bağlamı ve token sınırlama ile kaynak izleme.[53]
  • İndeks güncelleme, tekilleştirme, tokenizasyon. BM25 ile vektörleştirici arasında tokenizasyonun uyumlandırılması; karıştırma öncesinde skor kalibrasyonu (normalleştirme/ölçekleme) önem taşımaktadır.[54]

Kısıtlamalar ve Açık Sorular

  • Aktarılabilirlik ve çok dillilik. Dense modeller (GTR/E5) aktarımı iyileştirir, ancak alana/dile duyarlıdır; sparse modeller (SPLADE) OOD koşullarında genellikle daha dayanıklıdır.[55][56]
  • LLM ile entegrasyon ve halüsinasyonlar. Hibrit retrieval, RAG bağlamlarındaki eksiklikleri ve gürültüyü azaltır, ancak halüsinasyonları tam olarak ortadan kaldırmaz; güçlü yeniden sıralayıcılar ve kaynak filtreleme gerekmektedir.[57]
  • Maliyet ve gizlilik. Çok vektörlü indeks depolama, sıkıştırma, şifreleme ve yerinde (on-prem) yığın; TCO değerlendirmesi.
  • Eğilimler. Belge/sorgu genişletme olarak HyDE/doc2query/PRF;[58][59] karışım eğitimi (sorgu başına α), daha verimli late-interaction (PLAID/WARP), uzun belgeler ve çok vektörlü indeksler.[60][61]

Yöntemlerin Karşılaştırma Tablosu

2025‑09‑10 itibarıyla (BEIR trec‑covid koleksiyonu örneği; nDCG@10 / Recall@100):[62]

trec‑covid üzerinde yöntem karşılaştırması
Yöntem Tür (sparse/dense/hybrid) Fikir/model Birleştirme şeması Yeniden sıralayıcı nDCG@10 / R@100 Gecikme (göreli) Kaynaklar
BM25 sparse Tam terim eşleşmesi (PRF/BM25) 0.595 / 0.109 çok düşük [63][64]
SPLADE++ (ED) sparse (learned) Seyrek terim genişletme/ağırlıklandırma 0.727 / 0.128 düşük–orta [65][66]
Contriever (MS MARCO FT) dense Karşıtlıklı öğrenme bi-encoder'ı 0.596 / 0.091 orta [67][68]
BGE‑base‑en‑v1.5 dense Güçlü evrensel embedding modeli 0.781 / 0.141 orta [69]
Cohere embed‑english‑v3.0 dense Endüstriyel metin embedding modeli 0.818 / 0.159 orta [70]
BM25 + dense (örnek: BM25+BGE) hybrid Paralel retrieval + liste birleştirme RRF (k≈60) veya ağırlıklı karışım isteğe bağlı: MonoT5/ColBERT (uygulamaya göre değişir; genellikle > en iyi tek kanal) orta [71][72][73]

Not: Son satır şemayı örneklendirmektedir; kesin sayılar embedding seçimine, normalleştirmeye ve birleştirme parametrelerine bağlıdır (kaynaklara ve Pyserini ile yeniden üretilebilir betiklere bakınız).

Dış bağlantılar

  • Pyserini / Anserini: github.com/castorini/pyserini • github.com/castorini/anserini
  • FAISS: arXiv:1702.08734
  • Weaviate (Hybrid search): docs.weaviate.io/weaviate/search/hybrid
  • pgvector: github.com/pgvector/pgvector
  • Vespa (Hybrid search tutorial): docs.vespa.ai/en/tutorials/hybrid-search.html

Kaynakça

  • Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
  • Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval 3(4):333–389. DOI:10.1561/1500000019.
  • Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR. SIGIR.
  • Järvelин, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  • Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.

Notlar

  1. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval, 3(4), 333–389. DOI:10.1561/1500000019.
  2. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods. SIGIR 2009, 758–759. PDF.
  3. Bruch, S., Gai, S., Ingber, A. (2023). An Analysis of Fusion Functions for Hybrid Retrieval. ACM TOIS 42(1):1–35. DOI:10.1145/3596512 • arXiv:2210.11934.
  4. Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715 (см. главы о TF‑IDF, оценке и проблеме vocabulary mismatch).
  5. Izacard, G. et al. (2022). Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever). TACL 10:1089–1108. arXiv:2112.09118.
  6. Wang, L. et al. (2022/2024). Text Embeddings by Weakly‑Supervised Contrastive Pre‑training (E5). arXiv:2212.03533.
  7. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. DOI:10.1561/1500000019.
  8. Formal, T., Piwowarski, B., Clinchant, S. (2021). SPLADE: Sparse Lexical and Expansion Model for First Stage Ranking. arXiv:2107.05720.
  9. Formal, T. et al. (2022). Making Sparse Neural IR Models More Effective. Findings of EMNLP. arXiv:2205.04733.
  10. Formal, T. et al. (2024). SPLADE‑v3: New baselines for SPLADE. arXiv:2403.06789.
  11. Lin, J., Ma, X. (2021). A Few Brief Notes on DeepImpact, COIL, and uniCOIL. arXiv:2106.14807.
  12. Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open‑Domain QA. EMNLP. arXiv:2004.04906.
  13. Xiong, L. et al. (2021). Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval (ANCE). ICLR. arXiv:2007.00808.
  14. Izacard, G. et al. (2022). TACL. arXiv:2112.09118.
  15. Ni, J. et al. (2021/2022). Large Dual Encoders Are Generalizable Retrievers (GTR). EMNLP. arXiv:2112.07899.
  16. Wang, L. et al. (2022/2024). arXiv:2212.03533.
  17. Khattab, O., Zaharia, M. (2020). ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT. SIGIR. arXiv:2004.12832.
  18. Santhanam, K. et al. (2022). ColBERTv2 & PLAID. NAACL/ArXiv. arXiv:2112.01488; arXiv:2205.09707.
  19. Scheerer, J.L. et al. (2025). WARP: An Efficient Engine for Multi‑Vector Retrieval. arXiv:2501.17788.
  20. Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR with Sparse and Dense Representations. SIGIR. PDF.
  21. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). SIGIR. PDF.
  22. Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../reciprocal-rank-fusion.
  23. OpenSearch Docs. Score ranker processor (RRF). (доступ 2025‑09‑10). docs.opensearch.org/.../score-ranker-processor/.
  24. Fox, E.A., Shaw, J.A. (1994). Combination of Multiple Searches. TREC‑2, NIST SP 500‑215, 243–252. PDF.
  25. Lee, J.H. (1997). Analyses of Multiple Evidence Combination. SIGIR, 267–276. DOI:10.1145/258525.258587.
  26. Hsu, D.F., Taksa, I. (2005). Comparing Rank and Score Combination Methods for Data Fusion in IR. (Tech. report). PDF.
  27. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  28. Hsu, D.F., Taksa, I. (2005). см. выше.
  29. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  30. Nogueira, R., Cho, K. (2019). Passage Re‑ranking with BERT. arXiv:1901.04085.
  31. Nogueira, R., Jiang, Z., Lin, J. (2020). Document Ranking with a Pretrained Sequence‑to‑Sequence Model (MonoT5). Findings of EMNLP. arXiv:2003.06713.
  32. Santhanam, K. et al. (2022). arXiv:2205.09707.
  33. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  34. Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.
  35. Thakur, N. et al. (2021). BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of IR Models. NeurIPS Datasets & Benchmarks. arXiv:2104.08663.
  36. Craswell, N. et al. (2020). Overview of the TREC 2019 Deep Learning Track. arXiv:2003.07820.
  37. Craswell, N. et al. (2021). Overview of the TREC 2020 Deep Learning Track. arXiv:2102.07662.
  38. Bajaj, P. et al. (2016). MS MARCO: A Human Generated MAchine Reading COmprehension Dataset. arXiv:1611.09268.
  39. Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  40. Dean, J., Barroso, L.A. (2013). CACM. DOI:10.1145/2408776.2408794.
  41. Bruch, S. et al. (2023). DOI:10.1145/3596512.
  42. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  43. Johnson, J., Douze, M., Jégou, H. (2017). Billion‑scale Similarity Search with GPUs (FAISS). arXiv:1702.08734.
  44. Malkov, Y., Yashunin, D. (2020). HNSW. IEEE TPAMI 42(4):824–836. DOI:10.1109/TPAMI.2018.2889473.
  45. Guo, R. et al. (2020). ScaNN: Efficient Vector Similarity Search at Scale. arXiv:1908.10396.
  46. Yang, P., Fang, H., Lin, J. (2018). Anserini: Reproducible IR Research with Lucene. JDIQ 10(4):1–20. DOI:10.1145/3239571.
  47. Lin, J. et al. (2021). SIGIR. PDF.
  48. Qdrant Docs. Hybrid queries (RRF, DBSF). (доступ 2025‑09‑10). qdrant.tech/.../hybrid-queries/.
  49. Weaviate Docs. Hybrid search. (доступ 2025‑09‑10). docs.weaviate.io/weaviate/search/hybrid.
  50. pgvector GitHub. (доступ 2025‑09‑10). github.com/pgvector/pgvector.
  51. Vespa Docs. Hybrid Text Search Tutorial. (доступ 2025‑09‑10). docs.vespa.ai/.../hybrid-search.html.
  52. Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../rrf.
  53. Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  54. Hsu, D.F., Taksa, I. (2005). см. выше.
  55. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  56. Formal, T. et al. (2021, 2022, 2024). arXiv:2107.05720; 2205.04733; 2403.06789.
  57. Lewis, P. et al. (2020). arXiv:2005.11401.
  58. Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL. arXiv:2212.10496.
  59. Nogueira, R. et al. (2019). Document Expansion by Query Prediction. arXiv:1904.08375; docTTTTTquery. PDF.
  60. Santhanam, K. et al. (2022). arXiv:2205.09707.
  61. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  62. Pyserini BEIR Regressions (доступ 2025‑09‑10): результаты по trec‑covid для BM25/SPLADE/Contriever/BGE/Cohere. castorini.github.io/pyserini/2cr/beir.html.
  63. Robertson, S., Zaragoza, H. (2009). DOI:10.1561/1500000019.
  64. Pyserini BEIR. См. ссылку выше.
  65. Formal, T. et al. (2021, 2022). arXiv:2107.05720; 2205.04733.
  66. Pyserini BEIR.
  67. Izacard, G. et al. (2022). arXiv:2112.09118.
  68. Pyserini BEIR.
  69. Pyserini BEIR.
  70. Pyserini BEIR.
  71. Cormack et al. (2009). SIGIR. RRF.
  72. Bruch et al. (2023). TOIS.
  73. Elastic/OpenSearch RRF Docs.