Hypothetical Document Embeddings (HyDE) (BN)
Hypothetical Document Expansion (HyDE) — ভেক্টর retrieval এবং retrieval‑augmented generation (RAG) উন্নত করার একটি পদ্ধতি, যেখানে একটি বৃহৎ ভাষা মডেল (LLM) মূল প্রশ্নের ভিত্তিতে একটি «হাইপোথেটিক্যাল ডকুমেন্ট» তৈরি করে; তারপর এই টেক্সটটি একটি encoder দ্বারা ভেক্টরে রূপান্তরিত হয় এবং প্রাপ্ত ভেক্টরের সাথে নৈকট্যের ভিত্তিতে প্রকৃত ডকুমেন্টগুলির মধ্যে অনুসন্ধান পরিচালিত হয়। এই পদ্ধতি LLM-এ এনকোড করা «প্রাসঙ্গিকতার প্যাটার্ন» ব্যবহার করতে এবং ঘন embedding-এর মাধ্যমে সেগুলিকে corpus-এ «গ্রাউন্ড» করতে সক্ষম করে[1]।
সংজ্ঞা এবং স্বজ্ঞা
HyDE অনুসন্ধানের কাজকে দুটি ধাপে বিভক্ত করে:
(1) LLM প্রশ্নের জন্য একটি «প্রাসঙ্গিক উত্তরের উদাহরণ» (hypothetical document) তৈরি করে, এর মাধ্যমে প্রাসঙ্গিকতার বৈশিষ্ট্যগুলি মডেল করে;
(2) একটি contrastive encoder (যেমন Contriever) এই টেক্সটকে একটি ভেক্টরে রূপান্তরিত করে, যার মাধ্যমে index থেকে প্রকৃত ডকুমেন্টগুলি বের করা হয়। তৈরি করা টেক্সটে তথ্যগত ত্রুটি থাকতে পারে, কিন্তু গুরুত্বপূর্ণ হল encoder দ্বারা ধরা পড়া বিষয়গত ও পরিভাষাগত প্যাটার্নগুলি[2]।
ইতিহাস এবং উৎস
কৃত্রিম টেক্সট দিয়ে অনুসন্ধান প্রসারিত করার ধারণাটি query expansion এবং pseudo-relevant feedback (PRF) সংক্রান্ত গবেষণায় ফিরে যায়: Rocchio অ্যালগরিদম এবং Relevance Language Model[3][4]। ঘন retrieval-এর জন্য contrastively প্রশিক্ষিত encoder (Contriever)[5] এবং Dense Passage Retrieval (DPR)[6] ব্যবহার করা হয়েছিল। BEIR benchmark zero‑shot মূল্যায়ন মানসম্পন্ন করেছে[7]। এই প্রেক্ষাপটে HyDE প্রস্তাব করা হয়েছে encoder-এর fine-tuning ছাড়াই LLM-এর মাধ্যমে শূন্য-মোডে প্রাসঙ্গিকতার জ্ঞান «আনয়ন» করার উপায় হিসেবে[8]।
পদ্ধতি এবং আনুষ্ঠানিকতা
ধরা যাক ডকুমেন্টের corpus হল , এবং টেক্সট encoder ডকুমেন্টের ভেক্টর উপস্থাপনা নির্ধারণ করে। নৈকট্য পরিমাপের জন্য cosine similarity বা dot product ব্যবহার করা হয়; একটি গুরুত্বপূর্ণ মন্তব্য: **dot product কেবলমাত্র তখনই cosine similarity-র সমান হয় যখন উভয় ভেক্টরের L2‑norm একক হয়** ()[9]।
HyDE LLM দ্বারা তৈরি «হাইপোথেটিক্যাল ডকুমেন্ট»-এর মাধ্যমে প্রশ্নের উপস্থাপনাকে পুনর্নির্ধারণ করে। আনুষ্ঠানিকভাবে:
যেখানে — নির্দেশনা সহ LLM (যেমন: «প্রশ্নটির উত্তর দিয়ে একটি অনুচ্ছেদ লিখুন …»), — similarity পরিমাপ (normalization সহ cosine বা IP), এবং — সর্বোচ্চ similarity সহ টি ডকুমেন্টের সেট[10][11]।
ইঞ্জিনিয়ারিং অনুশীলনে প্রায়ই **একাধিক** হাইপোথেটিক্যাল টেক্সট তৈরি করা হয় এবং তাদের উপস্থাপনাগুলি একত্রিত করা হয়, যা স্থিতিশীলতা বাড়ায়:
যেখানে — stochastic decoding প্যারামিটার (যেমন temperature/top‑p)। এই ধরনের ensembling মাঝারি latency বৃদ্ধিতে Recall উন্নত করে[12]।
HyDE-এর মৌলিক pipeline
# 1) prompt(query) -> hypothetical_doc # 2) embed(hypothetical_doc) -> v_h # 3) retrieve(index, v_h, k) -> candidates # 4) (optional) rerank(query, candidates) -> topN # 5) (для RAG) stuff / map-reduce / refine на topN
অন্যান্য পদ্ধতির সাথে সম্পর্ক (QE, doc2query, PRF)
- QE (query expansion) প্রশ্নে term যোগ করে; HyDE পরিবর্তে একটি সম্পূর্ণ «quasi-document» তৈরি করে, যা ঘন encoder-এর সাথে আরও ভালোভাবে সামঞ্জস্যপূর্ণ[13]।
- doc2query / docTTTTTquery indexing-এর আগে কৃত্রিম প্রশ্ন দিয়ে ডকুমেন্ট প্রসারিত করে[14][15]; HyDE তাৎক্ষণিকভাবে প্রশ্ন প্রসারিত করে, reindexing ছাড়াই।
- PRF (Rocchio, Relevance LM) শীর্ষ ফলাফলের উপর ভিত্তি করে প্রশ্নের ভেক্টর আপডেট করে; HyDE সরাসরি LLM থেকে «প্রাসঙ্গিকতার প্যাটার্ন» বের করে এবং তারপর corpus-এ retrieval দ্বারা সেটি «গ্রাউন্ড» করে[16]।
RAG এবং reranking-এ একীকরণ
RAG-এ HyDE retrieval-এর প্রথম ধাপ হিসেবে প্রয়োগ করা হয়: hypothetical document → embedding → k প্রার্থী। এরপর reranking ব্যবহার করা হয়: BERT-শ্রেণীর cross-encoder[17] বা ColBERT late interaction[18]। তালিকা একীকরণের জন্য (যেমন BM25+vector হাইব্রিড) সাধারণত RRF (reciprocal rank fusion) প্রয়োগ করা হয়: RRF পদ্ধতি একত্রিত ranking-এর সামগ্রিক মান ধারাবাহিকভাবে উন্নত করে[19]।
benchmark-এ মূল্যায়ন (BEIR এবং অন্যান্য)
মূল গবেষণাটি TREC DL'19/20 (ওয়েব অনুসন্ধান) এবং BEIR collection-এর একটি উপসেটে (Scifact, ArguAna, TREC‑COVID, FiQA, DBPedia, TREC‑NEWS, Climate‑FEVER) zero-shot মোডে HyDE মূল্যায়ন করে। ফলাফলের একটি অংশ — 2023‑07 তারিখের হিসাবে:
| পদ্ধতি | DL19 | DL20 | উৎস |
|---|---|---|---|
| BM25 | 30.1 / 50.6 / 75.0 | 28.6 / 48.0 / 78.6 | [20] |
| Contriever (unsup.) | 24.0 / 44.5 / 74.6 | 24.0 / 42.1 / 75.4 | [21] |
| HyDE (Contriever+LLM) | 41.8 / 61.3 / 88.0 | 38.2 / 57.9 / 84.4 | [22] |
| DPR (ft) | 36.5 / 62.2 / 76.9 | 41.8 / 65.3 / 81.4 | [23] |
| ANCE (ft) | 37.1 / 64.5 / 75.5 | 40.8 / 64.6 / 77.6 | [24] |
| পদ্ধতি | Scifact | ArguAna | TREC‑COVID | FiQA | DBPedia | TREC‑NEWS | Climate‑FEVER | উৎস |
|---|---|---|---|---|---|---|---|---|
| BM25 | 67.9 / 92.5 | 39.7 / 93.2 | 59.5 / 49.8 | 23.6 / 54.0 | 31.8 / 46.8 | 39.5 / 44.7 | 16.5 / 42.5 | [25] |
| Contriever | 64.9 / 92.6 | 37.9 / 90.1 | 27.3 / 17.2 | 24.5 / 56.2 | 29.2 / 45.3 | 34.8 / 42.3 | 15.5 / 44.1 | [26] |
| HyDE | 69.1 / 96.4 | 46.6 / 97.9 | 59.3 / 41.4 | 27.3 / 62.1 | 36.8 / 47.2 | 44.0 / 50.9 | 22.3 / 53.0 | [27] |
HyDE বহুভাষিক Mr.TyDi dataset-এ (sw/ko/ja/bn) mContriever-এর তুলনায় MRR@100-ও উন্নত করে[28]।
ব্যবহারিক সুপারিশ
- HyDE কখন প্রয়োগ করবেন
- Zero-shot/transfer মোড (কোনো প্রাসঙ্গিক লেবেল নেই; প্রশিক্ষণ corpus থেকে domain «ভিন্নতা»)[29]।
- গ্রহণযোগ্য নির্ভুলতায় Recall@k বৃদ্ধি প্রয়োজন — HyDE প্রায়ই ভেক্টর স্থানের প্রাসঙ্গিক অঞ্চলগুলি «উন্মুক্ত» করে[30]।
- সাধারণ সেটিংস
- LLM এবং prompt: «প্রশ্নটির উত্তর দিয়ে একটি অনুচ্ছেদ লিখুন …» নির্দেশনা; মাঝারি stochasticity (যেমন temperature≈0.7)[31]।
- হাইপোথেটিক্যাল টেক্সটের সংখ্যা: ১–৫; embedding-এর গড় করা স্থিতিশীলতা বাড়ায়[32]।
- Embedder: fine-tuning ছাড়া (m)Contriever; fine-tuned encoder প্রয়োগও সম্ভব (HyDE-এর প্রভাব বজায় থাকে)[33]।
- Embedding normalization: L2‑norm; dot product cosine-এর সমতুল্য হয়[34]।
- হাইব্রিড retrieval: পরবর্তী reranking সহ BM25+vector[35]।
- Reranker: Cross-Encoder (BERT re‑ranker)[36] বা ColBERT[37]।
- একীকরণ বিভিন্ন কৌশলের ফলাফলের: RRF (k≈60)[38]।
- গুণমান/খরচ পর্যবেক্ষণ
- Retrieval: nDCG@k, Recall@k, MRR; end‑to‑end RAG: EM/F1 বা groundedness মেট্রিক (RAGAS/TruLens)[39][40]।
- খরচ/latency: LLM generation এবং (যদি থাকে) reranking প্রভাবশালী; হাইপোথেটিক্যাল টেক্সটের সংখ্যা এবং উত্তরের দৈর্ঘ্য দ্বারা অপ্টিমাইজ করা হয়[41]।
সীমাবদ্ধতা এবং উন্মুক্ত প্রশ্ন
- হাইপোথেটিক্যাল টেক্সটের hallucination: LLM তথ্যগত ত্রুটি প্রবর্তন করতে পারে; encoder এবং corpus-এর মাধ্যমে «grounding» ঝুঁকি কমায়, কিন্তু সম্পূর্ণ দূর করে না[42]।
- Domain/ভাষার সীমাবদ্ধতা: অত্যন্ত বিশেষায়িত domain এবং কম-সম্পদ ভাষায় HyDE-এর সুবিধা হ্রাস পায়[43]।
- Latency এবং খরচ: LLM generation বিলম্ব এবং token খরচ যোগ করে; অনলাইন পরিস্থিতি এবং দীর্ঘ হাইপোথেটিক্যাল টেক্সটের জন্য গুরুত্বপূর্ণ[44]।
- নৈতিকতা এবং পক্ষপাত: নিরাপদ LLM এবং ফিল্টারিং ব্যবহার করা বাঞ্ছনীয়[45]।
পদ্ধতির তুলনামূলক সারণি
| পদ্ধতি | শ্রেণী | টেক্সট কোথায় তৈরি হয় | Encoder/index | Reranker (২য় ধাপ) | সাধারণ মেট্রিক (উদাহরণ) | খরচ/latency | উৎস |
|---|---|---|---|---|---|---|---|
| HyDE | Query→hypo‑doc | প্রশ্নের পক্ষে (LLM → অনুচ্ছেদ) | (m)Contriever; ANN | BERT re‑rank / ColBERT / RRF | DL19 nDCG@10≈61.3; DL20≈57.9; ArguAna nDCG@10≈46.6 | + LLM generation; + reranking (ঐচ্ছিক) | [46] |
| BM25 | লেক্সিক্যাল | — | Inverted index | ঐচ্ছিক | উপরের সারণি দেখুন | কম (lexical) | [47] |
| DPR / ANCE | ঘন (fine-tuned) | — | Bi‑encoder; ANN | ঐচ্ছিক | DL19 nDCG@10≈62–65 | মাঝারি (LLM ছাড়া) | [48][49] |
| doc2query / docTTTTTquery | ডকুমেন্ট expansion | collection-এর পক্ষে (indexing-এর আগে) | BM25/sparse+expanded | ঐচ্ছিক | MS MARCO-তে BM25 উন্নতি | উচ্চ অফলাইন generation; দ্রুত অনলাইন | [50][51] |
| PRF (Rocchio, RLM) | feedback-ভিত্তিক QE | প্রশ্ন (শীর্ষ ফলাফল অনুযায়ী) | যেকোনো | ঐচ্ছিক | Recall বৃদ্ধি/drift ঝুঁকি | + অতিরিক্ত retrieval পাস | [52] |
আরও দেখুন
- BM25
- ভেক্টর উপস্থাপনা দ্বারা অনুসন্ধান
- RAG
- Pseudo-relevant feedback
- BEIR
সাহিত্য
- Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
- Robertson, S.; Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in IR, 3(4), 333–389. DOI:10.1561/1500000019.
লিংক
- HyDE রিপোজিটরি: github.com/texttron/hyde।
- ডকুমেন্টেশন: Haystack — HyDE: docs.haystack.deepset.ai।
- ডকুমেন্টেশন: LangChain — HyDE Retriever: docs.langchain.com।
মন্তব্য
- ↑ Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023. pp. 1762–1777. DOI:10.18653/v1/2023.acl-long.99. arXiv:2212.10496
- ↑ Gao, L. et al. (2023). ACL 2023, §3.2. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Rocchio, J. (1971). ‘‘Relevance Feedback in Information Retrieval’’. In: Salton, G. (ed.) The SMART Retrieval System. Prentice‑Hall, pp. 313–323. ISBN 978‑0138145255.
- ↑ Lavrenko, V.; Croft, W. B. (2001). ‘‘Relevance‑Based Language Models’’. SIGIR. DOI:10.1145/383952.383972.
- ↑ Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning’’. arXiv:2112.09118.
- ↑ Karpukhin, V. et al. (2020). ‘‘Dense Passage Retrieval for Open‑Domain QA’’. EMNLP. DOI:10.18653/v1/2020.emnlp-main.550.
- ↑ Thakur, N. et al. (2021). ‘‘BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of Information Retrieval Models’’. NeurIPS Datasets Track. arXiv:2104.08663.
- ↑ Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
- ↑ Milvus Docs. ‘‘Similarity Metrics’’ — при L2‑нормализации векторов внутр. произведение эквивалентно косинусу. URL: https://milvus.io/docs/v2.2.x/metric.md
- ↑ Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023, §3–4. arXiv:2212.10496. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever)’’. arXiv:2112.09118.
- ↑ Gao, L. et al. (2023). Прил. (ablation): влияние числа гипотетических текстов и параметров генерации. arXiv:2212.10496.
- ↑ Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
- ↑ Nogueira, R. et al. (2019). ‘‘Document Expansion by Query Prediction’’ (doc2query). arXiv:1904.08375.
- ↑ Nogueira, R.; Lin, J. (2019). ‘‘From doc2query to docTTTTTquery’’ (tech report). PDF
- ↑ Rocchio, J. (1971); Lavrenko & Croft (2001), см. выше.
- ↑ Nogueira, R.; Cho, K. (2019). ‘‘Passage Re‑ranking with BERT’’. arXiv:1901.04085.
- ↑ Khattab, O.; Zaharia, M. (2020). ‘‘ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT’’. SIGIR. DOI:10.1145/3397271.3401075; arXiv:2004.12832.
- ↑ Cormack, G. V.; Clarke, C. L. A.; Büttcher, S. (2009). ‘‘Reciprocal Rank Fusion Outperforms Condorcet and Nearly Optimally Combines Rankings’’. SIGIR. DOI:10.1145/1571941.1572114.
- ↑ Gao, L. et al. (2023). Табл. 1. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Izacard, G. et al. (2022); сводные метрики — в Gao et al., 2023, табл. 1. arXiv:2112.09118.
- ↑ Gao, L. et al. (2023). Табл. 1.
- ↑ Karpukhin, V. et al. (2020); сводные — в Gao et al., 2023.
- ↑ Xiong, L. et al. (2021). ICLR. arXiv:2007.00808.
- ↑ Thakur, N. et al. (2021); сводные — в Gao et al., 2023, табл. 2. arXiv:2104.08663.
- ↑ Izacard, G. et al. (2022); сводные — в Gao et al., 2023, табл. 2.
- ↑ Gao, L. et al. (2023). Табл. 2.
- ↑ Gao, L. et al. (2023). Табл. 3. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Gao, L. et al. (2023). §4–5.
- ↑ Gao, L. et al. (2023). §4.2–4.3.
- ↑ Gao, L. et al. (2023). §4.1.
- ↑ Haystack Docs. ‘‘Hypothetical Document Embeddings (HyDE)’’ (инженерная справка). docs.haystack.deepset.ai
- ↑ Gao, L. et al. (2023). Табл. 6.
- ↑ Milvus Docs. ‘‘Similarity Metrics’’.
- ↑ Haystack × Milvus Integration (официальная док.). haystack.deepset.ai
- ↑ Nogueira, R.; Cho, K. (2019). arXiv:1901.04085.
- ↑ Khattab, O.; Zaharia, M. (2020). DOI:10.1145/3397271.3401075.
- ↑ Cormack, G. V. et al. (2009). DOI:10.1145/1571941.1572114.
- ↑ Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge Univ. Press. ISBN 978‑0521865715.
- ↑ Es, S. et al. (2023). ‘‘RAGAS: Automated Evaluation of Retrieval‑Augmented Generation’’. arXiv:2309.15217.
- ↑ Gao, L. et al. (2023). §5.
- ↑ Gao, L. et al. (2023). §3.2; §4.1. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Gao, L. et al. (2023). Табл. 3; §4.4.
- ↑ Gao, L. et al. (2023). §4–5.
- ↑ Ouyang, L. et al. (2022). ‘‘Training language models to follow instructions with human feedback (InstructGPT)’’. NeurIPS. arXiv:2203.02155.
- ↑ Gao, L. et al. (2023). Табл. 1–2.
- ↑ Robertson, S.; Zaragoza, H. (2009). ‘‘The Probabilistic Relevance Framework: BM25 and Beyond’’. Found. Trends IR. DOI:10.1561/1500000019.
- ↑ Karpukhin, V. et al. (2020). DOI:10.18653/v1/2020.emnlp-main.550.
- ↑ Xiong, L. et al. (2021). arXiv:2007.00808.
- ↑ Nogueira, R. et al. (2019). arXiv:1904.08375.
- ↑ Nogueira, R.; Lin, J. (2019). tech report.
- ↑ Rocchio, J. (1971). SMART; Lavrenko & Croft (2001) SIGIR.