Hypothetical Document Embeddings (HyDE) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

Hypothetical Document Expansion (HyDE) — ভেক্টর retrieval এবং retrieval‑augmented generation (RAG) উন্নত করার একটি পদ্ধতি, যেখানে একটি বৃহৎ ভাষা মডেল (LLM) মূল প্রশ্নের ভিত্তিতে একটি «হাইপোথেটিক্যাল ডকুমেন্ট» তৈরি করে; তারপর এই টেক্সটটি একটি encoder দ্বারা ভেক্টরে রূপান্তরিত হয় এবং প্রাপ্ত ভেক্টরের সাথে নৈকট্যের ভিত্তিতে প্রকৃত ডকুমেন্টগুলির মধ্যে অনুসন্ধান পরিচালিত হয়। এই পদ্ধতি LLM-এ এনকোড করা «প্রাসঙ্গিকতার প্যাটার্ন» ব্যবহার করতে এবং ঘন embedding-এর মাধ্যমে সেগুলিকে corpus-এ «গ্রাউন্ড» করতে সক্ষম করে[1]

সংজ্ঞা এবং স্বজ্ঞা

HyDE অনুসন্ধানের কাজকে দুটি ধাপে বিভক্ত করে:

(1) LLM প্রশ্নের জন্য একটি «প্রাসঙ্গিক উত্তরের উদাহরণ» (hypothetical document) তৈরি করে, এর মাধ্যমে প্রাসঙ্গিকতার বৈশিষ্ট্যগুলি মডেল করে;

(2) একটি contrastive encoder (যেমন Contriever) এই টেক্সটকে একটি ভেক্টরে রূপান্তরিত করে, যার মাধ্যমে index থেকে প্রকৃত ডকুমেন্টগুলি বের করা হয়। তৈরি করা টেক্সটে তথ্যগত ত্রুটি থাকতে পারে, কিন্তু গুরুত্বপূর্ণ হল encoder দ্বারা ধরা পড়া বিষয়গত ও পরিভাষাগত প্যাটার্নগুলি[2]

ইতিহাস এবং উৎস

কৃত্রিম টেক্সট দিয়ে অনুসন্ধান প্রসারিত করার ধারণাটি query expansion এবং pseudo-relevant feedback (PRF) সংক্রান্ত গবেষণায় ফিরে যায়: Rocchio অ্যালগরিদম এবং Relevance Language Model[3][4]। ঘন retrieval-এর জন্য contrastively প্রশিক্ষিত encoder (Contriever)[5] এবং Dense Passage Retrieval (DPR)[6] ব্যবহার করা হয়েছিল। BEIR benchmark zero‑shot মূল্যায়ন মানসম্পন্ন করেছে[7]। এই প্রেক্ষাপটে HyDE প্রস্তাব করা হয়েছে encoder-এর fine-tuning ছাড়াই LLM-এর মাধ্যমে শূন্য-মোডে প্রাসঙ্গিকতার জ্ঞান «আনয়ন» করার উপায় হিসেবে[8]

পদ্ধতি এবং আনুষ্ঠানিকতা

ধরা যাক ডকুমেন্টের corpus হল 𝒟={d1,,dN}, এবং টেক্সট encoder E:textn ডকুমেন্টের ভেক্টর উপস্থাপনা 𝐯d=E(d) নির্ধারণ করে। নৈকট্য পরিমাপের জন্য cosine similarity বা dot product ব্যবহার করা হয়; একটি গুরুত্বপূর্ণ মন্তব্য: **dot product কেবলমাত্র তখনই cosine similarity-র সমান হয় যখন উভয় ভেক্টরের L2‑norm একক হয়** (𝐮=𝐯=1)[9]

HyDE LLM দ্বারা তৈরি «হাইপোথেটিক্যাল ডকুমেন্ট»-এর মাধ্যমে প্রশ্নের উপস্থাপনাকে পুনর্নির্ধারণ করে। আনুষ্ঠানিকভাবে:

(1) Генерация гипотетического текста:d~=G(q;inst),(2) Эмбеддинг гипотетического текста:𝐯h=E(d~),(3) Поиск ближайших соседей:k(q)=TopKd𝒟S(𝐯h,𝐯d),

যেখানে G — নির্দেশনা inst সহ LLM (যেমন: «প্রশ্নটির উত্তর দিয়ে একটি অনুচ্ছেদ লিখুন …»), S — similarity পরিমাপ (normalization সহ cosine বা IP), এবং k(q) — সর্বোচ্চ similarity সহ kটি ডকুমেন্টের সেট[10][11]

ইঞ্জিনিয়ারিং অনুশীলনে প্রায়ই **একাধিক** হাইপোথেটিক্যাল টেক্সট তৈরি করা হয় এবং তাদের উপস্থাপনাগুলি একত্রিত করা হয়, যা স্থিতিশীলতা বাড়ায়:

d~(j)=G(q;inst,ξj),𝐯h=1mj=1mE(d~(j)),

যেখানে ξj — stochastic decoding প্যারামিটার (যেমন temperature/top‑p)। এই ধরনের ensembling মাঝারি latency বৃদ্ধিতে Recall উন্নত করে[12]

HyDE-এর মৌলিক pipeline

# 1) prompt(query) -> hypothetical_doc
# 2) embed(hypothetical_doc) -> v_h
# 3) retrieve(index, v_h, k) -> candidates
# 4) (optional) rerank(query, candidates) -> topN
# 5) (для RAG) stuff / map-reduce / refine на topN

অন্যান্য পদ্ধতির সাথে সম্পর্ক (QE, doc2query, PRF)

  • QE (query expansion) প্রশ্নে term যোগ করে; HyDE পরিবর্তে একটি সম্পূর্ণ «quasi-document» তৈরি করে, যা ঘন encoder-এর সাথে আরও ভালোভাবে সামঞ্জস্যপূর্ণ[13]
  • doc2query / docTTTTTquery indexing-এর আগে কৃত্রিম প্রশ্ন দিয়ে ডকুমেন্ট প্রসারিত করে[14][15]; HyDE তাৎক্ষণিকভাবে প্রশ্ন প্রসারিত করে, reindexing ছাড়াই।
  • PRF (Rocchio, Relevance LM) শীর্ষ ফলাফলের উপর ভিত্তি করে প্রশ্নের ভেক্টর আপডেট করে; HyDE সরাসরি LLM থেকে «প্রাসঙ্গিকতার প্যাটার্ন» বের করে এবং তারপর corpus-এ retrieval দ্বারা সেটি «গ্রাউন্ড» করে[16]

RAG এবং reranking-এ একীকরণ

RAG-এ HyDE retrieval-এর প্রথম ধাপ হিসেবে প্রয়োগ করা হয়: hypothetical document → embedding → k প্রার্থী। এরপর reranking ব্যবহার করা হয়: BERT-শ্রেণীর cross-encoder[17] বা ColBERT late interaction[18]। তালিকা একীকরণের জন্য (যেমন BM25+vector হাইব্রিড) সাধারণত RRF (reciprocal rank fusion) প্রয়োগ করা হয়: RRF(d)=r1k+rankr(d),k60. RRF পদ্ধতি একত্রিত ranking-এর সামগ্রিক মান ধারাবাহিকভাবে উন্নত করে[19]

benchmark-এ মূল্যায়ন (BEIR এবং অন্যান্য)

মূল গবেষণাটি TREC DL'19/20 (ওয়েব অনুসন্ধান) এবং BEIR collection-এর একটি উপসেটে (Scifact, ArguAna, TREC‑COVID, FiQA, DBPedia, TREC‑NEWS, Climate‑FEVER) zero-shot মোডে HyDE মূল্যায়ন করে। ফলাফলের একটি অংশ — 2023‑07 তারিখের হিসাবে:

TREC DL19/20 (ওয়েব অনুসন্ধান) — mAP / nDCG@10 / Recall@1k
পদ্ধতি DL19 DL20 উৎস
BM25 30.1 / 50.6 / 75.0 28.6 / 48.0 / 78.6 [20]
Contriever (unsup.) 24.0 / 44.5 / 74.6 24.0 / 42.1 / 75.4 [21]
HyDE (Contriever+LLM) 41.8 / 61.3 / 88.0 38.2 / 57.9 / 84.4 [22]
DPR (ft) 36.5 / 62.2 / 76.9 41.8 / 65.3 / 81.4 [23]
ANCE (ft) 37.1 / 64.5 / 75.5 40.8 / 64.6 / 77.6 [24]
BEIR (dataset-এর বাছাই) — nDCG@10 / Recall@100
পদ্ধতি Scifact ArguAna TREC‑COVID FiQA DBPedia TREC‑NEWS Climate‑FEVER উৎস
BM25 67.9 / 92.5 39.7 / 93.2 59.5 / 49.8 23.6 / 54.0 31.8 / 46.8 39.5 / 44.7 16.5 / 42.5 [25]
Contriever 64.9 / 92.6 37.9 / 90.1 27.3 / 17.2 24.5 / 56.2 29.2 / 45.3 34.8 / 42.3 15.5 / 44.1 [26]
HyDE 69.1 / 96.4 46.6 / 97.9 59.3 / 41.4 27.3 / 62.1 36.8 / 47.2 44.0 / 50.9 22.3 / 53.0 [27]

HyDE বহুভাষিক Mr.TyDi dataset-এ (sw/ko/ja/bn) mContriever-এর তুলনায় MRR@100-ও উন্নত করে[28]

ব্যবহারিক সুপারিশ

HyDE কখন প্রয়োগ করবেন
  • Zero-shot/transfer মোড (কোনো প্রাসঙ্গিক লেবেল নেই; প্রশিক্ষণ corpus থেকে domain «ভিন্নতা»)[29]
  • গ্রহণযোগ্য নির্ভুলতায় Recall@k বৃদ্ধি প্রয়োজন — HyDE প্রায়ই ভেক্টর স্থানের প্রাসঙ্গিক অঞ্চলগুলি «উন্মুক্ত» করে[30]
সাধারণ সেটিংস
  • LLM এবং prompt: «প্রশ্নটির উত্তর দিয়ে একটি অনুচ্ছেদ লিখুন …» নির্দেশনা; মাঝারি stochasticity (যেমন temperature≈0.7)[31]
  • হাইপোথেটিক্যাল টেক্সটের সংখ্যা: ১–৫; embedding-এর গড় করা স্থিতিশীলতা বাড়ায়[32]
  • Embedder: fine-tuning ছাড়া (m)Contriever; fine-tuned encoder প্রয়োগও সম্ভব (HyDE-এর প্রভাব বজায় থাকে)[33]
  • Embedding normalization: L2‑norm; dot product cosine-এর সমতুল্য হয়[34]
  • হাইব্রিড retrieval: পরবর্তী reranking সহ BM25+vector[35]
  • Reranker: Cross-Encoder (BERT re‑ranker)[36] বা ColBERT[37]
  • একীকরণ বিভিন্ন কৌশলের ফলাফলের: RRF (k≈60)[38]
গুণমান/খরচ পর্যবেক্ষণ
  • Retrieval: nDCG@k, Recall@k, MRR; end‑to‑end RAG: EM/F1 বা groundedness মেট্রিক (RAGAS/TruLens)[39][40]
  • খরচ/latency: LLM generation এবং (যদি থাকে) reranking প্রভাবশালী; হাইপোথেটিক্যাল টেক্সটের সংখ্যা এবং উত্তরের দৈর্ঘ্য দ্বারা অপ্টিমাইজ করা হয়[41]

সীমাবদ্ধতা এবং উন্মুক্ত প্রশ্ন

  • হাইপোথেটিক্যাল টেক্সটের hallucination: LLM তথ্যগত ত্রুটি প্রবর্তন করতে পারে; encoder এবং corpus-এর মাধ্যমে «grounding» ঝুঁকি কমায়, কিন্তু সম্পূর্ণ দূর করে না[42]
  • Domain/ভাষার সীমাবদ্ধতা: অত্যন্ত বিশেষায়িত domain এবং কম-সম্পদ ভাষায় HyDE-এর সুবিধা হ্রাস পায়[43]
  • Latency এবং খরচ: LLM generation বিলম্ব এবং token খরচ যোগ করে; অনলাইন পরিস্থিতি এবং দীর্ঘ হাইপোথেটিক্যাল টেক্সটের জন্য গুরুত্বপূর্ণ[44]
  • নৈতিকতা এবং পক্ষপাত: নিরাপদ LLM এবং ফিল্টারিং ব্যবহার করা বাঞ্ছনীয়[45]

পদ্ধতির তুলনামূলক সারণি

HyDE এবং সংশ্লিষ্ট পদ্ধতির তুলনা
পদ্ধতি শ্রেণী টেক্সট কোথায় তৈরি হয় Encoder/index Reranker (২য় ধাপ) সাধারণ মেট্রিক (উদাহরণ) খরচ/latency উৎস
HyDE Query→hypo‑doc প্রশ্নের পক্ষে (LLM → অনুচ্ছেদ) (m)Contriever; ANN BERT re‑rank / ColBERT / RRF DL19 nDCG@10≈61.3; DL20≈57.9; ArguAna nDCG@10≈46.6 + LLM generation; + reranking (ঐচ্ছিক) [46]
BM25 লেক্সিক্যাল Inverted index ঐচ্ছিক উপরের সারণি দেখুন কম (lexical) [47]
DPR / ANCE ঘন (fine-tuned) Bi‑encoder; ANN ঐচ্ছিক DL19 nDCG@10≈62–65 মাঝারি (LLM ছাড়া) [48][49]
doc2query / docTTTTTquery ডকুমেন্ট expansion collection-এর পক্ষে (indexing-এর আগে) BM25/sparse+expanded ঐচ্ছিক MS MARCO-তে BM25 উন্নতি উচ্চ অফলাইন generation; দ্রুত অনলাইন [50][51]
PRF (Rocchio, RLM) feedback-ভিত্তিক QE প্রশ্ন (শীর্ষ ফলাফল অনুযায়ী) যেকোনো ঐচ্ছিক Recall বৃদ্ধি/drift ঝুঁকি + অতিরিক্ত retrieval পাস [52]

আরও দেখুন

  • BM25
  • ভেক্টর উপস্থাপনা দ্বারা অনুসন্ধান
  • RAG
  • Pseudo-relevant feedback
  • BEIR

সাহিত্য

  • Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
  • Robertson, S.; Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in IR, 3(4), 333–389. DOI:10.1561/1500000019.

লিংক

  • HyDE রিপোজিটরি: github.com/texttron/hyde।
  • ডকুমেন্টেশন: Haystack — HyDE: docs.haystack.deepset.ai।
  • ডকুমেন্টেশন: LangChain — HyDE Retriever: docs.langchain.com।

মন্তব্য

  1. Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023. pp. 1762–1777. DOI:10.18653/v1/2023.acl-long.99. arXiv:2212.10496
  2. Gao, L. et al. (2023). ACL 2023, §3.2. DOI:10.18653/v1/2023.acl-long.99.
  3. Rocchio, J. (1971). ‘‘Relevance Feedback in Information Retrieval’’. In: Salton, G. (ed.) The SMART Retrieval System. Prentice‑Hall, pp. 313–323. ISBN 978‑0138145255.
  4. Lavrenko, V.; Croft, W. B. (2001). ‘‘Relevance‑Based Language Models’’. SIGIR. DOI:10.1145/383952.383972.
  5. Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning’’. arXiv:2112.09118.
  6. Karpukhin, V. et al. (2020). ‘‘Dense Passage Retrieval for Open‑Domain QA’’. EMNLP. DOI:10.18653/v1/2020.emnlp-main.550.
  7. Thakur, N. et al. (2021). ‘‘BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of Information Retrieval Models’’. NeurIPS Datasets Track. arXiv:2104.08663.
  8. Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
  9. Milvus Docs. ‘‘Similarity Metrics’’ — при L2‑нормализации векторов внутр. произведение эквивалентно косинусу. URL: https://milvus.io/docs/v2.2.x/metric.md
  10. Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023, §3–4. arXiv:2212.10496. DOI:10.18653/v1/2023.acl-long.99.
  11. Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever)’’. arXiv:2112.09118.
  12. Gao, L. et al. (2023). Прил. (ablation): влияние числа гипотетических текстов и параметров генерации. arXiv:2212.10496.
  13. Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
  14. Nogueira, R. et al. (2019). ‘‘Document Expansion by Query Prediction’’ (doc2query). arXiv:1904.08375.
  15. Nogueira, R.; Lin, J. (2019). ‘‘From doc2query to docTTTTTquery’’ (tech report). PDF
  16. Rocchio, J. (1971); Lavrenko & Croft (2001), см. выше.
  17. Nogueira, R.; Cho, K. (2019). ‘‘Passage Re‑ranking with BERT’’. arXiv:1901.04085.
  18. Khattab, O.; Zaharia, M. (2020). ‘‘ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT’’. SIGIR. DOI:10.1145/3397271.3401075; arXiv:2004.12832.
  19. Cormack, G. V.; Clarke, C. L. A.; Büttcher, S. (2009). ‘‘Reciprocal Rank Fusion Outperforms Condorcet and Nearly Optimally Combines Rankings’’. SIGIR. DOI:10.1145/1571941.1572114.
  20. Gao, L. et al. (2023). Табл. 1. DOI:10.18653/v1/2023.acl-long.99.
  21. Izacard, G. et al. (2022); сводные метрики — в Gao et al., 2023, табл. 1. arXiv:2112.09118.
  22. Gao, L. et al. (2023). Табл. 1.
  23. Karpukhin, V. et al. (2020); сводные — в Gao et al., 2023.
  24. Xiong, L. et al. (2021). ICLR. arXiv:2007.00808.
  25. Thakur, N. et al. (2021); сводные — в Gao et al., 2023, табл. 2. arXiv:2104.08663.
  26. Izacard, G. et al. (2022); сводные — в Gao et al., 2023, табл. 2.
  27. Gao, L. et al. (2023). Табл. 2.
  28. Gao, L. et al. (2023). Табл. 3. DOI:10.18653/v1/2023.acl-long.99.
  29. Gao, L. et al. (2023). §4–5.
  30. Gao, L. et al. (2023). §4.2–4.3.
  31. Gao, L. et al. (2023). §4.1.
  32. Haystack Docs. ‘‘Hypothetical Document Embeddings (HyDE)’’ (инженерная справка). docs.haystack.deepset.ai
  33. Gao, L. et al. (2023). Табл. 6.
  34. Milvus Docs. ‘‘Similarity Metrics’’.
  35. Haystack × Milvus Integration (официальная док.). haystack.deepset.ai
  36. Nogueira, R.; Cho, K. (2019). arXiv:1901.04085.
  37. Khattab, O.; Zaharia, M. (2020). DOI:10.1145/3397271.3401075.
  38. Cormack, G. V. et al. (2009). DOI:10.1145/1571941.1572114.
  39. Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge Univ. Press. ISBN 978‑0521865715.
  40. Es, S. et al. (2023). ‘‘RAGAS: Automated Evaluation of Retrieval‑Augmented Generation’’. arXiv:2309.15217.
  41. Gao, L. et al. (2023). §5.
  42. Gao, L. et al. (2023). §3.2; §4.1. DOI:10.18653/v1/2023.acl-long.99.
  43. Gao, L. et al. (2023). Табл. 3; §4.4.
  44. Gao, L. et al. (2023). §4–5.
  45. Ouyang, L. et al. (2022). ‘‘Training language models to follow instructions with human feedback (InstructGPT)’’. NeurIPS. arXiv:2203.02155.
  46. Gao, L. et al. (2023). Табл. 1–2.
  47. Robertson, S.; Zaragoza, H. (2009). ‘‘The Probabilistic Relevance Framework: BM25 and Beyond’’. Found. Trends IR. DOI:10.1561/1500000019.
  48. Karpukhin, V. et al. (2020). DOI:10.18653/v1/2020.emnlp-main.550.
  49. Xiong, L. et al. (2021). arXiv:2007.00808.
  50. Nogueira, R. et al. (2019). arXiv:1904.08375.
  51. Nogueira, R.; Lin, J. (2019). tech report.
  52. Rocchio, J. (1971). SMART; Lavrenko & Croft (2001) SIGIR.