Hybrid retrieval (ID)

From Systems analysis Wiki
Jump to navigation Jump to search

Hybrid Retrieval (pengambilan informasi hibrida) — kelas metode pencarian informasi yang menggabungkan sinyal leksikal (sparse) dan semantik (dense/late‑interaction) untuk meningkatkan kelengkapan dan ketepatan hasil pencarian. Skema hibrida memadukan keunggulan pencocokan istilah yang tepat (BM25/TF-IDF) dengan kedekatan vektor (bi-encoder, model late-interaction multi-vektor), serta memanfaatkan metode penggabungan peringkat yang tahan terhadap skoring berskala berbeda (misalnya, Reciprocal Rank Fusion, CombSUM/CombMNZ) dan pemeringkatan ulang dengan cross‑encoder.[1][2][3]

Definisi dan Motivasi

Hybrid Retrieval adalah pencarian paralel atau berjenjang melalui dua (atau lebih) saluran sinyal independen, diikuti penggabungan dan/atau pemeringkatan ulang. Motivasi utama: (i) mengatasi "kesenjangan terminologi" (sinonim, reformulasi), (ii) ketahanan terhadap kesalahan ketik/morfologi, (iii) pengambilan kode/pengenal spesifik (di mana model sparse unggul), (iv) transfer ke domain/bahasa baru (di mana model dense memberikan generalisasi semantik).[4][5][6]

Komponen Pencarian Hibrida

Leksikal (sparse)

  • Model klasik. TF-IDF dan BM25/BM25F — metode dasar standar pada indeks terbalik; BM25 dilandasi kerangka probabilistik PRF dan banyak digunakan pada tahap pertama peringkat.[7]
  • Sparse yang dapat dilatih.
    • SPLADE / SPLADE++/v3. Model neural sparse yang melatih perluasan dan pembobotan istilah melalui kepala MLM dengan regularisasi kejarangan; menunjukkan hasil yang kuat dan portabilitas yang baik (BEIR).[8][9][10]
    • uniCOIL/COIL. Daftar terbalik yang dikontekstualisasikan beserta versi disederhanakannya uniCOIL; kompatibel dengan indeks terbalik klasik.[11]

Semantik (dense/late‑interaction)

  • Bi‑encoder (single‑vector). Kueri dan dokumen dikodekan oleh model vektor, kemiripan dihitung berdasarkan dot‑product/MIPS. Contoh: DPR,[12] ANCE,[13] Contriever,[14] GTR,[15] E5.[16]
  • Late‑interaction (multi‑vector). Memodelkan kesesuaian di tingkat token pada interaksi "terlambat": ColBERT/ColBERTv2; kompromis — akurasi lebih baik dengan indeks/latensi lebih besar, yang diringankan oleh solusi rekayasa (PLAID, WARP).[17][18][19]

Skema Hibridisasi dan Penggabungan Peringkat

  • Pencarian paralel dan penggabungan kandidat. Daftar kandidat (sparse dan dense) diperoleh secara independen beserta skor internalnya, lalu digabungkan.[20]
  • RRF (Reciprocal Rank Fusion). Teknik yang tahan terhadap skor peringkat yang tidak sebanding, menjumlahkan kebalikan peringkat:

RRF(d)=i=1m1k+ranki(d), di mana biasanya k60.[21] Didukung pada mesin industri (Elasticsearch/OpenSearch) sebagai retriever/prosesor bawaan.[22][23]

  • CombSUM/CombMNZ dan lainnya. Fungsi klasik "penjumlahan skor" (dengan normalisasi bila diperlukan).[24][25][26]
  • Campuran linear berbobot.

S(d)=αSsparse(d)+(1α)Sdense(d), α[0,1]. Pemilihan α dapat bersifat tetap atau dapat dilatih (berdasarkan koleksi/kueri).[27]

  • Normalisasi skor. Untuk CombSUM/CombMNZ sering diterapkan min‑max, z‑score, dan lainnya untuk menyelaraskan skala;[28] alternatifnya, RRF hanya bergantung pada peringkat.
  • Pembobotan dinamis/adaptif. Perutean kueri (query routing), fitur kueri, dan model LTR untuk memilih/membobot saluran; penelitian terkini menunjukkan bahwa campuran terlatih sederhana sering melampaui RRF dan tidak sensitif terhadap normalisasi.[29]

Pemeringkatan Ulang dan Pipeline Multi-Tahap

Sistem hibrida biasanya dibangun sebagai retrieval → fusion → rerank. Untuk pemeringkatan ulang digunakan:

  • Cross‑encoder (BERT/T5). Paling akurat tetapi paling mahal: MonoBERT/MonoT5 untuk menyusun ulang top‑N kandidat.[30][31]
  • Late‑interaction sebagai reranker. Keluarga ColBERT dapat berfungsi juga sebagai reranker; akselerator modern (PLAID, WARP) mengurangi latensi tanpa kehilangan kualitas.[32][33]

Kompromi kualitas ↔ latensi/biaya sangat penting dalam RAG dan SLA yang ketat (lihat latensi ekor p95/p99).[34]

Evaluasi pada Benchmark

  • BEIR. Kumpulan terpadu dari koleksi/tugas beragam untuk evaluasi zero‑/out‑of‑domain pada retriever (misalnya, TREC‑COVID, NFCorpus, NQ, HotpotQA, FiQA‑2018, DBPedia‑entity, ArguAna, Webis‑Touché‑2020, FEVER/Climate‑FEVER, Scidocs, SciFact, CQADupStack, dan lainnya).[35]
  • TREC Deep Learning / MS MARCO. Sumber daya klasik untuk pelatihan/evaluasi retriever dan reranker dalam mode data besar.[36][37][38]
  • Metrik kualitas. nDCG@k, Recall@k, MRR; untuk performa — latency p50/p95/p99, QPS; untuk operasional — memori/biaya (CPU/GPU, indeks).[39][40]
  • Ablasi. Disarankan untuk mencatat kontribusi setiap saluran/bobot dan sensitivitas terhadap parameter k dalam RRF serta α dalam pencampuran; mengevaluasi ketahanan terhadap reformulasi dan pergeseran OOD.[41][42]

Aspek Rekayasa dan Praktik Produksi

  • Indeks dan ANN. FAISS (Flat/HNSW/IVF‑PQ), HNSW, ScaNN untuk MIPS/kemiripan kosinus.[43][44][45]
  • Tumpukan IR. Lucene/Anserini/Pyserini untuk pipeline sparse/dense dan hibrida; reprodusibilitas "dua tombol" pada BEIR.[46][47]
  • Basis data vektor dan mesin pencari. Qdrant, Weaviate, pgvector/PostgreSQL, Vespa, Elasticsearch/OpenSearch memiliki mode pencarian hibrida native (BM25F+vector) dan/atau RRF/pencampuran linear.[48][49][50][51][52]
  • Pola RAG. Arsitektur: retrieval → fusion → rerank → konteks LLM dengan pembatasan token dan pelacakan sumber.[53]
  • Pembaruan indeks, deduplikasi, tokenisasi. Penting untuk menyelaraskan tokenisasi antara BM25 dan vektorisator; kalibrasi skor (normalisasi/penskalaan) sebelum pencampuran.[54]

Keterbatasan dan Pertanyaan Terbuka

  • Portabilitas dan multibahasa. Model dense (GTR/E5) meningkatkan transfer, tetapi sensitif terhadap domain/bahasa; model sparse (SPLADE) umumnya lebih tahan pada OOD.[55][56]
  • Integrasi dengan LLM dan halusinasi. Hybrid Retrieval mengurangi kelalaian dan kebisingan dalam konteks RAG, tetapi tidak sepenuhnya menghilangkan halusinasi; diperlukan reranker yang ketat dan penyaringan sumber.[57]
  • Biaya dan privasi. Penyimpanan indeks multi-vektor, kompresi, enkripsi, dan tumpukan on‑prem; evaluasi TCO.
  • Tren. HyDE/doc2query/PRF sebagai perluasan dokumen/kueri;[58][59] pelatihan pencampuran (per‑query α), late‑interaction yang lebih efisien (PLAID/WARP), dokumen panjang, dan indeks multi-vektor.[60][61]

Tabel Perbandingan Metode

Per 2025‑09‑10 (contoh pada koleksi BEIR trec‑covid; nDCG@10 / Recall@100):[62]

Perbandingan metode pada trec‑covid
Metode Tipe (sparse/dense/hybrid) Ide/model Skema penggabungan Reranker nDCG@10 / R@100 Latensi (relatif) Sumber
BM25 sparse Pencocokan istilah tepat (PRF/BM25) 0.595 / 0.109 sangat rendah [63][64]
SPLADE++ (ED) sparse (learned) Perluasan/pembobotan istilah jarang 0.727 / 0.128 rendah–sedang [65][66]
Contriever (MS MARCO FT) dense Bi-encoder pembelajaran kontrastif 0.596 / 0.091 sedang [67][68]
BGE‑base‑en‑v1.5 dense Embedder universal yang kuat 0.781 / 0.141 sedang [69]
Cohere embed‑english‑v3.0 dense Model embedding teks industri 0.818 / 0.159 sedang [70]
BM25 + dense (contoh: BM25+BGE) hybrid Retrieval paralel + penggabungan daftar RRF (k≈60) atau campuran berbobot ops.: MonoT5/ColBERT (bervariasi sesuai implementasi; biasanya > saluran tunggal terbaik) sedang [71][72][73]

Catatan: baris terakhir mengilustrasikan skema; angka pasti bergantung pada pilihan embedder, normalisasi, dan parameter penggabungan (lihat sumber dan skrip Pyserini yang dapat direproduksi).

Daftar Pustaka

  • Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
  • Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval 3(4):333–389. DOI:10.1561/1500000019.
  • Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR. SIGIR.
  • Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  • Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.

Tautan

  • Pyserini / Anserini: github.com/castorini/pyserini • github.com/castorini/anserini
  • FAISS: arXiv:1702.08734
  • Weaviate (Hybrid search): docs.weaviate.io/weaviate/search/hybrid
  • pgvector: github.com/pgvector/pgvector
  • Vespa (Hybrid search tutorial): docs.vespa.ai/en/tutorials/hybrid-search.html

Catatan

  1. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval, 3(4), 333–389. DOI:10.1561/1500000019.
  2. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods. SIGIR 2009, 758–759. PDF.
  3. Bruch, S., Gai, S., Ingber, A. (2023). An Analysis of Fusion Functions for Hybrid Retrieval. ACM TOIS 42(1):1–35. DOI:10.1145/3596512 • arXiv:2210.11934.
  4. Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715 (см. главы о TF‑IDF, оценке и проблеме vocabulary mismatch).
  5. Izacard, G. et al. (2022). Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever). TACL 10:1089–1108. arXiv:2112.09118.
  6. Wang, L. et al. (2022/2024). Text Embeddings by Weakly‑Supervised Contrastive Pre‑training (E5). arXiv:2212.03533.
  7. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. DOI:10.1561/1500000019.
  8. Formal, T., Piwowarski, B., Clinchant, S. (2021). SPLADE: Sparse Lexical and Expansion Model for First Stage Ranking. arXiv:2107.05720.
  9. Formal, T. et al. (2022). Making Sparse Neural IR Models More Effective. Findings of EMNLP. arXiv:2205.04733.
  10. Formal, T. et al. (2024). SPLADE‑v3: New baselines for SPLADE. arXiv:2403.06789.
  11. Lin, J., Ma, X. (2021). A Few Brief Notes on DeepImpact, COIL, and uniCOIL. arXiv:2106.14807.
  12. Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open‑Domain QA. EMNLP. arXiv:2004.04906.
  13. Xiong, L. et al. (2021). Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval (ANCE). ICLR. arXiv:2007.00808.
  14. Izacard, G. et al. (2022). TACL. arXiv:2112.09118.
  15. Ni, J. et al. (2021/2022). Large Dual Encoders Are Generalizable Retrievers (GTR). EMNLP. arXiv:2112.07899.
  16. Wang, L. et al. (2022/2024). arXiv:2212.03533.
  17. Khattab, O., Zaharia, M. (2020). ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT. SIGIR. arXiv:2004.12832.
  18. Santhanam, K. et al. (2022). ColBERTv2 & PLAID. NAACL/ArXiv. arXiv:2112.01488; arXiv:2205.09707.
  19. Scheerer, J.L. et al. (2025). WARP: An Efficient Engine for Multi‑Vector Retrieval. arXiv:2501.17788.
  20. Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR with Sparse and Dense Representations. SIGIR. PDF.
  21. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). SIGIR. PDF.
  22. Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../reciprocal-rank-fusion.
  23. OpenSearch Docs. Score ranker processor (RRF). (доступ 2025‑09‑10). docs.opensearch.org/.../score-ranker-processor/.
  24. Fox, E.A., Shaw, J.A. (1994). Combination of Multiple Searches. TREC‑2, NIST SP 500‑215, 243–252. PDF.
  25. Lee, J.H. (1997). Analyses of Multiple Evidence Combination. SIGIR, 267–276. DOI:10.1145/258525.258587.
  26. Hsu, D.F., Taksa, I. (2005). Comparing Rank and Score Combination Methods for Data Fusion in IR. (Tech. report). PDF.
  27. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  28. Hsu, D.F., Taksa, I. (2005). см. выше.
  29. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  30. Nogueira, R., Cho, K. (2019). Passage Re‑ranking with BERT. arXiv:1901.04085.
  31. Nogueira, R., Jiang, Z., Lin, J. (2020). Document Ranking with a Pretrained Sequence‑to‑Sequence Model (MonoT5). Findings of EMNLP. arXiv:2003.06713.
  32. Santhanam, K. et al. (2022). arXiv:2205.09707.
  33. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  34. Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.
  35. Thakur, N. et al. (2021). BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of IR Models. NeurIPS Datasets & Benchmarks. arXiv:2104.08663.
  36. Craswell, N. et al. (2020). Overview of the TREC 2019 Deep Learning Track. arXiv:2003.07820.
  37. Craswell, N. et al. (2021). Overview of the TREC 2020 Deep Learning Track. arXiv:2102.07662.
  38. Bajaj, P. et al. (2016). MS MARCO: A Human Generated MAchine Reading COmprehension Dataset. arXiv:1611.09268.
  39. Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  40. Dean, J., Barroso, L.A. (2013). CACM. DOI:10.1145/2408776.2408794.
  41. Bruch, S. et al. (2023). DOI:10.1145/3596512.
  42. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  43. Johnson, J., Douze, M., Jégou, H. (2017). Billion‑scale Similarity Search with GPUs (FAISS). arXiv:1702.08734.
  44. Malkov, Y., Yashunin, D. (2020). HNSW. IEEE TPAMI 42(4):824–836. DOI:10.1109/TPAMI.2018.2889473.
  45. Guo, R. et al. (2020). ScaNN: Efficient Vector Similarity Search at Scale. arXiv:1908.10396.
  46. Yang, P., Fang, H., Lin, J. (2018). Anserini: Reproducible IR Research with Lucene. JDIQ 10(4):1–20. DOI:10.1145/3239571.
  47. Lin, J. et al. (2021). SIGIR. PDF.
  48. Qdrant Docs. Hybrid queries (RRF, DBSF). (доступ 2025‑09‑10). qdrant.tech/.../hybrid-queries/.
  49. Weaviate Docs. Hybrid search. (доступ 2025‑09‑10). docs.weaviate.io/weaviate/search/hybrid.
  50. pgvector GitHub. (доступ 2025‑09‑10). github.com/pgvector/pgvector.
  51. Vespa Docs. Hybrid Text Search Tutorial. (доступ 2025‑09‑10). docs.vespa.ai/.../hybrid-search.html.
  52. Elastic Docs. Reciprocal Rank Fusion. (доступ 2025‑09‑10). elastic.co/docs/.../rrf.
  53. Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  54. Hsu, D.F., Taksa, I. (2005). см. выше.
  55. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  56. Formal, T. et al. (2021, 2022, 2024). arXiv:2107.05720; 2205.04733; 2403.06789.
  57. Lewis, P. et al. (2020). arXiv:2005.11401.
  58. Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL. arXiv:2212.10496.
  59. Nogueira, R. et al. (2019). Document Expansion by Query Prediction. arXiv:1904.08375; docTTTTTquery. PDF.
  60. Santhanam, K. et al. (2022). arXiv:2205.09707.
  61. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  62. Pyserini BEIR Regressions (доступ 2025‑09‑10): результаты по trec‑covid для BM25/SPLADE/Contriever/BGE/Cohere. castorini.github.io/pyserini/2cr/beir.html.
  63. Robertson, S., Zaragoza, H. (2009). DOI:10.1561/1500000019.
  64. Pyserini BEIR. См. ссылку выше.
  65. Formal, T. et al. (2021, 2022). arXiv:2107.05720; 2205.04733.
  66. Pyserini BEIR.
  67. Izacard, G. et al. (2022). arXiv:2112.09118.
  68. Pyserini BEIR.
  69. Pyserini BEIR.
  70. Pyserini BEIR.
  71. Cormack et al. (2009). SIGIR. RRF.
  72. Bruch et al. (2023). TOIS.
  73. Elastic/OpenSearch RRF Docs.