Hypothetical Document Embeddings (HyDE) (UR)
Hypothetical Document Expansion (HyDE) — یہ ویکٹر ریٹریول اور retrieval‑augmented generation (RAG) کو بہتر بنانے کا ایک طریقہ ہے، جس میں بڑا زبانی نمونہ (LLM) اصل سوال کی بنیاد پر ایک «فرضی دستاویز» تیار کرتا ہے؛ پھر اس متن کو encoder کے ذریعے ویکٹر میں تبدیل کیا جاتا ہے، اور حاصل شدہ ویکٹر کے قریب موجود حقیقی دستاویزات میں تلاش کی جاتی ہے۔ یہ طریقہ LLM میں موجود «ربط کے نمونوں» کو استعمال کرنے اور انہیں گھنے embeddings کے ذریعے کارپس سے «جوڑنے» کی اجازت دیتا ہے[1]۔
تعریف اور بنیادی سوچ
HyDE تلاش کے کام کو دو مرحلوں میں تقسیم کرتا ہے:
(1) LLM سوال کے جواب میں «متعلقہ جواب کی مثال» (hypothetical document) تیار کرتا ہے، اس طرح ربط کی خصوصیات کو ماڈل کرتا ہے؛
(2) ایک contrastive encoder (مثلاً Contriever) اس متن کو ایک ایسے ویکٹر میں تبدیل کرتا ہے جس کے ذریعے index سے حقیقی دستاویزات نکالی جاتی ہیں۔ تیار کردہ متن میں حقیقی غلطیاں ہو سکتی ہیں، لیکن encoder کے ذریعے پکڑے جانے والے موضوعاتی اور اصطلاحاتی نمونے اہم ہوتے ہیں[2]۔
تاریخ اور ماخذ
مصنوعی متون سے تلاش کو وسعت دینے کا خیال سوال کی توسیع اور pseudo-relevant feedback (PRF) پر ہونے والے کاموں سے لیا گیا ہے: Rocchio الگورتھم اور ربط کے زبانی نمونے[3][4]۔ گھنے ریٹریول کے لیے contrastively تربیت یافتہ encoders (Contriever)[5] اور Dense Passage Retrieval (DPR)[6] استعمال کیے گئے۔ benchmark BEIR نے zero‑shot تشخیص کو معیاری بنایا[7]۔ اسی پس منظر میں HyDE کو encoder کی دوبارہ تربیت کے بغیر، LLM کے ذریعے نولِ صفر موڈ میں ربط کا علم «لانے» کے ایک طریقے کے طور پر پیش کیا گیا[8]۔
طریقہ اور رسمی بیان
فرض کیجیے دستاویزات کا کارپس ہے، اور متن encoder دستاویزات کی ویکٹر نمائندگی فراہم کرتا ہے۔ قربت ناپنے کے لیے یا تو cosine similarity یا scalar product استعمال ہوتا ہے؛ ایک اہم نکتہ یہ ہے کہ **scalar product صرف اسی وقت cosine similarity کے برابر ہوتا ہے جب دونوں ویکٹروں کا L2‑norm اکائی ہو** ()[9]۔
HyDE سوال کی نمائندگی کو LLM کے ذریعے تیار کردہ «فرضی دستاویز» سے نئے سرے سے متعین کرتا ہے۔ رسمی طور پر:
جہاں — ہدایت کے ساتھ LLM ہے (مثلاً: «ایک پیراگراف لکھیں جو اس سوال کا جواب دے …»)، — مشابہت کا پیمانہ (cosine یا normalization کے ساتھ IP) ہے، اور — زیادہ سے زیادہ مشابہت والے دستاویزات کا مجموعہ ہے[10][11]۔
انجینیئری عمل میں اکثر **متعدد** فرضی متون تیار کیے جاتے ہیں اور ان کی نمائندگیوں کو یکجا کیا جاتا ہے، جس سے استحکام بڑھتا ہے:
جہاں — stochastic decoding پیرامیٹرز ہیں (مثلاً temperature/top‑p)۔ اس طرح کی ensembling اعتدال پسند latency اضافے کے ساتھ Recall کو بہتر بناتی ہے[12]۔
HyDE کا بنیادی پائپ لائن
# 1) prompt(query) -> hypothetical_doc # 2) embed(hypothetical_doc) -> v_h # 3) retrieve(index, v_h, k) -> candidates # 4) (optional) rerank(query, candidates) -> topN # 5) (для RAG) stuff / map-reduce / refine на topN
دیگر طریقوں سے تعلق (QE، doc2query، PRF)
- QE (سوال کی توسیع) سوال میں اصطلاحات شامل کرتا ہے؛ HyDE اس کے بجائے ایک مکمل «شبہ دستاویز» تیار کرتا ہے، جو گھنے encoders کے ساتھ بہتر ہم آہنگ ہے[13]۔
- doc2query / docTTTTTquery indexing سے پہلے مصنوعی سوالات سے دستاویزات کو وسعت دیتا ہے[14][15]؛ HyDE سوال کو بروقت وسعت دیتا ہے، re-indexing کی ضرورت نہیں۔
- PRF (Rocchio، Relevance LM) ٹاپ نتائج کی بنیاد پر سوال کے ویکٹر کو اپ ڈیٹ کرتا ہے؛ HyDE «ربط کا نمونہ» براہِ راست LLM سے نکالتا ہے اور پھر اسے کارپس پر ریٹریول کے ذریعے «جوڑتا» ہے[16]۔
RAG اور دوبارہ درجہ بندی میں انضمام
RAG میں HyDE ریٹریول کے پہلے مرحلے کے طور پر استعمال ہوتا ہے: فرضی دستاویز ← embedding ← k امیدوار۔ اس کے بعد دوبارہ درجہ بندی کی جاتی ہے: BERT کلاس کے cross‑encoders[17] یا ColBERT کا late interaction[18]۔ فہرستوں کو ضم کرنے کے لیے (مثلاً BM25+vector کا ہائبرڈ) عام طور پر RRF (reciprocal rank fusion) استعمال ہوتا ہے: RRF طریقہ مجتمع درجہ بندیوں کے مجموعی معیار کو مستقل طور پر بہتر بناتا ہے[19]۔
benchmarks پر تشخیص (BEIR وغیرہ)
اصل تحقیق TREC DL'19/20 (ویب تلاش) اور BEIR مجموعوں کے ذیلی حصے (Scifact، ArguAna، TREC‑COVID، FiQA، DBPedia، TREC‑NEWS، Climate‑FEVER) پر نولِ صفر موڈ میں HyDE کا جائزہ لیتی ہے۔ نتائج کا ایک حصہ — جولائی 2023 کی صورتِ حال کے مطابق:
| طریقہ | DL19 | DL20 | ماخذ |
|---|---|---|---|
| BM25 | 30.1 / 50.6 / 75.0 | 28.6 / 48.0 / 78.6 | [20] |
| Contriever (unsup.) | 24.0 / 44.5 / 74.6 | 24.0 / 42.1 / 75.4 | [21] |
| HyDE (Contriever+LLM) | 41.8 / 61.3 / 88.0 | 38.2 / 57.9 / 84.4 | [22] |
| DPR (ft) | 36.5 / 62.2 / 76.9 | 41.8 / 65.3 / 81.4 | [23] |
| ANCE (ft) | 37.1 / 64.5 / 75.5 | 40.8 / 64.6 / 77.6 | [24] |
| طریقہ | Scifact | ArguAna | TREC‑COVID | FiQA | DBPedia | TREC‑NEWS | Climate‑FEVER | ماخذ |
|---|---|---|---|---|---|---|---|---|
| BM25 | 67.9 / 92.5 | 39.7 / 93.2 | 59.5 / 49.8 | 23.6 / 54.0 | 31.8 / 46.8 | 39.5 / 44.7 | 16.5 / 42.5 | [25] |
| Contriever | 64.9 / 92.6 | 37.9 / 90.1 | 27.3 / 17.2 | 24.5 / 56.2 | 29.2 / 45.3 | 34.8 / 42.3 | 15.5 / 44.1 | [26] |
| HyDE | 69.1 / 96.4 | 46.6 / 97.9 | 59.3 / 41.4 | 27.3 / 62.1 | 36.8 / 47.2 | 44.0 / 50.9 | 22.3 / 53.0 | [27] |
HyDE کثیر لسانی مجموعوں Mr.TyDi (sw/ko/ja/bn) پر mContriever کے مقابلے میں MRR@100 کو بھی بہتر بناتا ہے[28]۔
عملی سفارشات
- HyDE کب استعمال کریں
- نولِ صفر / منتقلی موڈ (کوئی متعلقہ لیبل نہ ہو؛ تربیتی کارپس سے ڈومین کا «فرق»)[29]۔
- قابلِ قبول درستگی کے ساتھ Recall@k میں اضافہ درکار ہو — HyDE اکثر ویکٹر اسپیس کے متعلقہ علاقوں کو «کھولتا» ہے[30]۔
- عام ترتیبات
- LLM اور prompt: ہدایت «ایک پیراگراف لکھیں جو اس سوال کا جواب دے …»؛ اعتدال پسند stochasticity (مثلاً temperature≈0.7)[31]۔
- فرضی متون کی تعداد: 1–5؛ embeddings کا اوسط نکالنا استحکام بڑھاتا ہے[32]۔
- Embedder: دوبارہ تربیت کے بغیر (m)Contriever؛ fine-tuned encoders کا استعمال بھی ممکن ہے (HyDE کا اثر برقرار رہتا ہے)[33]۔
- Embeddings کا معمول بنانا: L2‑norm؛ اندرونی ضرب cosine کے مساوی ہے[34]۔
- ہائبرڈ ریٹریول: BM25+vector اور بعد میں دوبارہ درجہ بندی[35]۔
- Re-ranker: Cross-Encoder (BERT re‑ranker)[36] یا ColBERT[37]۔
- مختلف حکمتِ عملیوں کے نتائج کا ضم: RRF (k≈60)[38]۔
- معیار/لاگت کی نگرانی
- ریٹریول: nDCG@k، Recall@k، MRR؛ end‑to‑end RAG: EM/F1 یا groundedness کے پیمانے (RAGAS/TruLens)[39][40]۔
- لاگت/latency: LLM کی تیاری اور (اگر ہو تو) دوبارہ درجہ بندی غالب ہے؛ «فرضی» متون کی تعداد اور جواب کی لمبائی سے بہتر بنایا جاتا ہے[41]۔
حدود اور کھلے سوالات
- فرضی متن میں ہذیان: LLM حقیقی غلطیاں داخل کر سکتا ہے؛ encoder اور کارپس کے ذریعے «جوڑنا» خطرہ کم کرتا ہے لیکن مکمل طور پر ختم نہیں کرتا[42]۔
- ڈومین/زبان کی حدود: انتہائی مخصوص ڈومینز اور کم وسائل والی زبانوں میں HyDE کا فائدہ کم ہو جاتا ہے[43]۔
- Latency اور لاگت: LLM کی تیاری تاخیر اور token لاگت بڑھاتی ہے؛ آن لائن منظرناموں اور لمبے «فرضی» متون کے لیے یہ اہم ہے[44]۔
- اخلاقیات اور جھکاؤ: محفوظ LLMs اور فلٹرنگ کا استعمال ترجیحی ہے[45]۔
طریقوں کا تقابلی جدول
| طریقہ | طبقہ | متن کہاں تیار ہوتا ہے | Encoder/Index | Re-ranker (دوسرا مرحلہ) | عام پیمانے (مثال) | لاگت/Latency | ماخذ |
|---|---|---|---|---|---|---|---|
| HyDE | Query→hypo‑doc | سوال کی جانب (LLM → پیراگراف) | (m)Contriever; ANN | BERT re‑rank / ColBERT / RRF | DL19 nDCG@10≈61.3; DL20≈57.9; ArguAna nDCG@10≈46.6 | + LLM کی تیاری؛ + دوبارہ درجہ بندی (اختیاری) | [46] |
| BM25 | لغوی | — | الٹا Index | اختیاری | مذکورہ جدول دیکھیں | کم (lexical) | [47] |
| DPR / ANCE | گھنا (ft) | — | Bi‑encoder; ANN | اختیاری | DL19 nDCG@10≈62–65 | درمیانی (بغیر LLM) | [48][49] |
| doc2query / docTTTTTquery | دستاویز کی توسیع | مجموعے کی جانب (indexing سے پہلے) | BM25/sparse+expanded | اختیاری | MS MARCO پر BM25 میں بہتری | آف لائن تیاری زیادہ؛ آن لائن تیز | [50][51] |
| PRF (Rocchio, RLM) | feedback پر QE | سوال (ٹاپ نتائج کی بنیاد پر) | کوئی بھی | اختیاری | Recall میں اضافہ/بہاؤ کے خطرات | + ریٹریول کا اضافی دور | [52] |
یہ بھی دیکھیں
- BM25
- ویکٹر نمائندگی پر مبنی تلاش،
- RAG
- Pseudo-relevant feedback
- BEIR
کتابیات
- Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
- Robertson, S.; Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in IR, 3(4), 333–389. DOI:10.1561/1500000019.
حوالہ جات
- HyDE ریپوزیٹری: github.com/texttron/hyde۔
- دستاویز: Haystack — HyDE: docs.haystack.deepset.ai۔
- دستاویز: LangChain — HyDE Retriever: docs.langchain.com۔
نوٹس
- ↑ Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023. pp. 1762–1777. DOI:10.18653/v1/2023.acl-long.99. arXiv:2212.10496
- ↑ Gao, L. et al. (2023). ACL 2023, §3.2. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Rocchio, J. (1971). ‘‘Relevance Feedback in Information Retrieval’’. In: Salton, G. (ed.) The SMART Retrieval System. Prentice‑Hall, pp. 313–323. ISBN 978‑0138145255.
- ↑ Lavrenko, V.; Croft, W. B. (2001). ‘‘Relevance‑Based Language Models’’. SIGIR. DOI:10.1145/383952.383972.
- ↑ Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning’’. arXiv:2112.09118.
- ↑ Karpukhin, V. et al. (2020). ‘‘Dense Passage Retrieval for Open‑Domain QA’’. EMNLP. DOI:10.18653/v1/2020.emnlp-main.550.
- ↑ Thakur, N. et al. (2021). ‘‘BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of Information Retrieval Models’’. NeurIPS Datasets Track. arXiv:2104.08663.
- ↑ Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
- ↑ Milvus Docs. ‘‘Similarity Metrics’’ — при L2‑нормализации векторов внутр. произведение эквивалентно косинусу. URL: https://milvus.io/docs/v2.2.x/metric.md
- ↑ Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023, §3–4. arXiv:2212.10496. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever)’’. arXiv:2112.09118.
- ↑ Gao, L. et al. (2023). Прил. (ablation): влияние числа гипотетических текстов и параметров генерации. arXiv:2212.10496.
- ↑ Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
- ↑ Nogueira, R. et al. (2019). ‘‘Document Expansion by Query Prediction’’ (doc2query). arXiv:1904.08375.
- ↑ Nogueira, R.; Lin, J. (2019). ‘‘From doc2query to docTTTTTquery’’ (tech report). PDF
- ↑ Rocchio, J. (1971); Lavrenko & Croft (2001), см. выше.
- ↑ Nogueira, R.; Cho, K. (2019). ‘‘Passage Re‑ranking with BERT’’. arXiv:1901.04085.
- ↑ Khattab, O.; Zaharia, M. (2020). ‘‘ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT’’. SIGIR. DOI:10.1145/3397271.3401075; arXiv:2004.12832.
- ↑ Cormack, G. V.; Clarke, C. L. A.; Büttcher, S. (2009). ‘‘Reciprocal Rank Fusion Outperforms Condorcet and Nearly Optimally Combines Rankings’’. SIGIR. DOI:10.1145/1571941.1572114.
- ↑ Gao, L. et al. (2023). Табл. 1. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Izacard, G. et al. (2022); сводные метрики — в Gao et al., 2023, табл. 1. arXiv:2112.09118.
- ↑ Gao, L. et al. (2023). Табл. 1.
- ↑ Karpukhin, V. et al. (2020); сводные — в Gao et al., 2023.
- ↑ Xiong, L. et al. (2021). ICLR. arXiv:2007.00808.
- ↑ Thakur, N. et al. (2021); сводные — в Gao et al., 2023, табл. 2. arXiv:2104.08663.
- ↑ Izacard, G. et al. (2022); сводные — в Gao et al., 2023, табл. 2.
- ↑ Gao, L. et al. (2023). Табл. 2.
- ↑ Gao, L. et al. (2023). Табл. 3. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Gao, L. et al. (2023). §4–5.
- ↑ Gao, L. et al. (2023). §4.2–4.3.
- ↑ Gao, L. et al. (2023). §4.1.
- ↑ Haystack Docs. ‘‘Hypothetical Document Embeddings (HyDE)’’ (инженерная справка). docs.haystack.deepset.ai
- ↑ Gao, L. et al. (2023). Табл. 6.
- ↑ Milvus Docs. ‘‘Similarity Metrics’’.
- ↑ Haystack × Milvus Integration (официальная док.). haystack.deepset.ai
- ↑ Nogueira, R.; Cho, K. (2019). arXiv:1901.04085.
- ↑ Khattab, O.; Zaharia, M. (2020). DOI:10.1145/3397271.3401075.
- ↑ Cormack, G. V. et al. (2009). DOI:10.1145/1571941.1572114.
- ↑ Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge Univ. Press. ISBN 978‑0521865715.
- ↑ Es, S. et al. (2023). ‘‘RAGAS: Automated Evaluation of Retrieval‑Augmented Generation’’. arXiv:2309.15217.
- ↑ Gao, L. et al. (2023). §5.
- ↑ Gao, L. et al. (2023). §3.2; §4.1. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Gao, L. et al. (2023). Табл. 3; §4.4.
- ↑ Gao, L. et al. (2023). §4–5.
- ↑ Ouyang, L. et al. (2022). ‘‘Training language models to follow instructions with human feedback (InstructGPT)’’. NeurIPS. arXiv:2203.02155.
- ↑ Gao, L. et al. (2023). Табл. 1–2.
- ↑ Robertson, S.; Zaragoza, H. (2009). ‘‘The Probabilistic Relevance Framework: BM25 and Beyond’’. Found. Trends IR. DOI:10.1561/1500000019.
- ↑ Karpukhin, V. et al. (2020). DOI:10.18653/v1/2020.emnlp-main.550.
- ↑ Xiong, L. et al. (2021). arXiv:2007.00808.
- ↑ Nogueira, R. et al. (2019). arXiv:1904.08375.
- ↑ Nogueira, R.; Lin, J. (2019). tech report.
- ↑ Rocchio, J. (1971). SMART; Lavrenko & Croft (2001) SIGIR.