Hypothetical Document Embeddings (HyDE) (BG)
Hypothetical Document Expansion (HyDE) — метод за подобряване на векторното извличане и retrieval‑augmented generation (RAG), при който голям езиков модел (LLM) генерира „хипотетичен документ" по зададена заявка; след това този текст се векторизира от encoder, а търсенето се извършва сред реални документи по близост до получения вектор. Подходът позволява да се използват „шаблони на релевантност", кодирани от LLM, и да се „заземят" върху корпуса с помощта на плътни embedding-и[1].\n\n== Определение и интуиция ==\nHyDE декомпозира задачата за търсене на два етапа:\n\n(1) LLM създава „пример на релевантен отговор" (hypothetical document) към заявката, като по този начин моделира признаците на релевантност;\n\n(2) контрастивен encoder (напр. Contriever) превежда този текст във вектор, по който се извличат реални документи от индекса. Генерираният текст може да съдържа фактически грешки, но важни са тематичните и терминологичните шаблони, улавяни от encoder-а[2].\n\n== История и източници ==\nИдеята за разширяване на търсенето със синтетични текстове води началото си от работи по разширяване на заявки и псевдорелевантна обратна връзка (PRF): алгоритъмът на Рокио и езикови модели на релевантност[3][4]. За плътно извличане са използвани контрастивно обучени encoder-и (Contriever)[5] и Dense Passage Retrieval (DPR)[6]. Бенчмаркът BEIR стандартизира zero‑shot оценката[7]. На този фон е предложен HyDE като начин да се „привнесе" в нулевия режим знание за релевантност чрез LLM, без да се дообучава encoder-ът[8].\n\n== Метод и формализация ==\nНека корпусът от документи е , а encoder-ът на текстове задава векторни представяния на документите . За измерване на близостта се използва косинусово сходство или скаларно произведение; важна забележка: **скаларното произведение съвпада с косинусовото сходство само при единична L2‑норма на двата вектора** ()[9].\n\nHyDE предефинира представянето на заявката чрез „хипотетичен документ", генериран от LLM. Формално:\n\n\n\nкъдето — LLM с инструкция (например: „Напиши абзац, отговарящ на въпроса …"), — мярка за сходство (косинус или IP с нормализация), а — множество от документа с максимално сходство[10][11].\n\nВ инженерната практика често се генерират **няколко** хипотетични текста и техните представяния се агрегират, което повишава устойчивостта:\n\n\n\nкъдето — стохастични параметри на декодиране (напр. temperature/top‑p). Такова ансамблиране подобрява Recall при умерен ръст на латентността[12].\n\n=== Базов конвейер на HyDE ===\n
# 1) prompt(query) -> hypothetical_doc # 2) embed(hypothetical_doc) -> v_h # 3) retrieve(index, v_h, k) -> candidates # 4) (optional) rerank(query, candidates) -> topN # 5) (для RAG) stuff / map-reduce / refine на topN
\n\n\n\n=== Връзка с други методи (QE, doc2query, PRF) ===\n* QE (разширяване на заявка) добавя термини към заявката; HyDE вместо това генерира цял „квази‑документ", което се съгласува по-добре с плътните encoder-и[13].\n* doc2query / docTTTTTquery разширяват документите със синтетични заявки преди индексиране[14][15]; HyDE разширява заявката в реално време, без да изисква преиндексиране.\n* PRF (Rocchio, Relevance LM) актуализира вектора на заявката по топ резултатите; HyDE извлича „шаблона на релевантност" директно от LLM и след това го „заземява" чрез извличане по корпуса[16].\n\n== Интеграция в RAG и преранжиране ==\nВ RAG HyDE се прилага като първи етап на извличане: хипотетичен документ → embedding → k кандидата. След това се използва преранжиране: кросс-encoder-и от клас BERT[17] или ColBERT с късно взаимодействие[18]. За сливане на списъци (напр. хибрид BM25+vector) типично се прилага RRF (reciprocal rank fusion):\n\nМетодът RRF стабилно повишава съвкупното качество на обединените наредби[19].\n\n== Оценка на бенчмаркове (BEIR и др.) ==\nОригиналната работа оценява HyDE в нулев режим на TREC DL'19/20 (уеб търсене) и на подмножество от колекции BEIR (Scifact, ArguAna, TREC‑COVID, FiQA, DBPedia, TREC‑NEWS, Climate‑FEVER). Фрагмент от резултатите — към 2023‑07:\n\n{| class=\"wikitable\"\n|+ TREC DL19/20 (уеб търсене) — mAP / nDCG@10 / Recall@1k\n|-\n! Метод !! DL19 !! DL20 !! Източник\n|-\n| BM25 || 30.1 / 50.6 / 75.0 || 28.6 / 48.0 / 78.6 || [20]\n|-\n| Contriever (unsup.) || 24.0 / 44.5 / 74.6 || 24.0 / 42.1 / 75.4 || [21]\n|-\n| HyDE (Contriever+LLM) || 41.8 / 61.3 / 88.0 || 38.2 / 57.9 / 84.4 || [22]\n|-\n| DPR (ft) || 36.5 / 62.2 / 76.9 || 41.8 / 65.3 / 81.4 || [23]\n|-\n| ANCE (ft) || 37.1 / 64.5 / 75.5 || 40.8 / 64.6 / 77.6 || [24]\n|}\n\n{| class=\"wikitable\"\n|+ BEIR (подборка от набори) — nDCG@10 / Recall@100\n|-\n! Метод !! Scifact !! ArguAna !! TREC‑COVID !! FiQA !! DBPedia !! TREC‑NEWS !! Climate‑FEVER !! Източник\n|-\n| BM25 || 67.9 / 92.5 || 39.7 / 93.2 || 59.5 / 49.8 || 23.6 / 54.0 || 31.8 / 46.8 || 39.5 / 44.7 || 16.5 / 42.5 || [25]\n|-\n| Contriever || 64.9 / 92.6 || 37.9 / 90.1 || 27.3 / 17.2 || 24.5 / 56.2 || 29.2 / 45.3 || 34.8 / 42.3 || 15.5 / 44.1 || [26]\n|-\n| HyDE || 69.1 / 96.4 || 46.6 / 97.9 || 59.3 / 41.4 || 27.3 / 62.1 || 36.8 / 47.2 || 44.0 / 50.9 || 22.3 / 53.0 || [27]\n|}\n\nHyDE също подобрява MRR@100 на многоезичните набори Mr.TyDi (sw/ko/ja/bn) спрямо mContriever[28].\n\n== Практически препоръки ==\n;Кога да се прилага HyDE\n* Нулев/преносен режим (няма релевантни етикети; домейново „несходство" с обучаващите корпуси)[29].\n* Необходимо е повишаване на Recall@k при приемлива точност — HyDE често „открива" релевантни области на векторното пространство[30].\n\n;Типични настройки\n* LLM и prompt: инструкция „Напиши абзац, отговарящ на въпроса …"; умерена стохастичност (напр. temperature≈0.7)[31].\n* Брой хипотетични текстове: 1–5; усредняването на embedding-ите повишава устойчивостта[32].\n* Embedder: (m)Contriever без дообучаване; възможно е прилагане на дообучени encoder-и (ефектът на HyDE се запазва)[33].\n* Нормализация на embedding-ите: L2‑норма; вътрешното произведение е еквивалентно на косинуса[34].\n* Хибридно извличане: BM25+vector с последващо преранжиране[35].\n* Преранжиращ модел: Cross-Encoder (BERT re‑ranker)[36] или ColBERT[37].\n* Сливане на резултати от различни стратегии: RRF (k≈60)[38].\n\n;Мониторинг на качество/разход\n* Извличане: nDCG@k, Recall@k, MRR; end‑to‑end RAG: EM/F1 или метрики groundedness (RAGAS/TruLens)[39][40].\n* Разход/латентност: доминира генерацията от LLM и (ако е налично) преранжирането; оптимизира се с броя „хипотетики" и дължината на отговора[41].\n\n== Ограничения и отворени въпроси ==\n* Халюцинации в хипотетичния текст: LLM може да въвежда фактически грешки; „заземяването" чрез encoder и корпус намалява риска, но не го елиминира напълно[42].\n* Домейнови/езикови ограничения: ползата от HyDE намалява в тясноспециализирани домейни и при езици с малко ресурси[43].\n* Латентност и разход: генерацията от LLM добавя закъснение и разход на токени; критично за онлайн сценарии и дълги „хипотетики"[44].\n* Етика и отклонения: препоръчително е използването на безопасни LLM и филтриране[45].\n\n== Сравнителна таблица на методите ==\n{| class=\"wikitable\"\n|+ Съпоставяне на HyDE и сродни подходи\n|-\n! Метод !! Клас !! Къде се генерира текстът !! Encoder/индекс !! Преранжиращ модел (2‑ри етап) !! Типични метрики (пример) !! Разход/латентност !! Източници\n|-\n| HyDE || Query→hypo‑doc || На страната на заявката (LLM → абзац) || (m)Contriever; ANN || BERT re‑rank / ColBERT / RRF || DL19 nDCG@10≈61.3; DL20≈57.9; ArguAna nDCG@10≈46.6 || + генерация от LLM; + преранжиране (опц.) || [46]\n|-\n| BM25 || Лексикален || — || Инвертиран индекс || По избор || вж. табл. (по-горе) || Нисък (lexical) || [47]\n|-\n| DPR / ANCE || Плътен (ft) || — || Bi‑encoder; ANN || По избор || DL19 nDCG@10≈62–65 || Среден (без LLM) || [48][49]\n|-\n| doc2query / docTTTTTquery || Разширяване на документи || На страната на колекцията (преди индексиране) || BM25/sparse+expanded || По избор || Подобрения на BM25 при MS MARCO || Висока офлайн генерация; бърз онлайн || [50][51]\n|-\n| PRF (Rocchio, RLM) || QE по обратна връзка || Заявка (по топ резултати) || Произволен || По избор || Ръст на Recall/рискове от отклонение || + допълнителен проход на извличане || [52]\n|}\n\n== Вижте също ==\n* BM25\n* Търсене по векторни представяния,\n* RAG\n* Псевдорелевантна обратна връзка\n* BEIR\n\n== Литература ==\n* Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.\n* Robertson, S.; Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in IR, 3(4), 333–389. DOI:10.1561/1500000019.\n\n== Препратки ==\n* Хранилище на HyDE: github.com/texttron/hyde.\n* Документация: Haystack — HyDE: docs.haystack.deepset.ai.\n* Документация: LangChain — HyDE Retriever: docs.langchain.com.\n\n== Бележки ==\n\n\n\nTemplate:SEOMeta\n
- ↑ Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023. pp. 1762–1777. DOI:10.18653/v1/2023.acl-long.99. arXiv:2212.10496
- ↑ Gao, L. et al. (2023). ACL 2023, §3.2. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Rocchio, J. (1971). ‘‘Relevance Feedback in Information Retrieval’’. In: Salton, G. (ed.) The SMART Retrieval System. Prentice‑Hall, pp. 313–323. ISBN 978‑0138145255.
- ↑ Lavrenko, V.; Croft, W. B. (2001). ‘‘Relevance‑Based Language Models’’. SIGIR. DOI:10.1145/383952.383972.
- ↑ Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning’’. arXiv:2112.09118.
- ↑ Karpukhin, V. et al. (2020). ‘‘Dense Passage Retrieval for Open‑Domain QA’’. EMNLP. DOI:10.18653/v1/2020.emnlp-main.550.
- ↑ Thakur, N. et al. (2021). ‘‘BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of Information Retrieval Models’’. NeurIPS Datasets Track. arXiv:2104.08663.
- ↑ Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
- ↑ Milvus Docs. ‘‘Similarity Metrics’’ — при L2‑нормализации векторов внутр. произведение эквивалентно косинусу. URL: https://milvus.io/docs/v2.2.x/metric.md
- ↑ Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023, §3–4. arXiv:2212.10496. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever)’’. arXiv:2112.09118.
- ↑ Gao, L. et al. (2023). Прил. (ablation): влияние числа гипотетических текстов и параметров генерации. arXiv:2212.10496.
- ↑ Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.
- ↑ Nogueira, R. et al. (2019). ‘‘Document Expansion by Query Prediction’’ (doc2query). arXiv:1904.08375.
- ↑ Nogueira, R.; Lin, J. (2019). ‘‘From doc2query to docTTTTTquery’’ (tech report). PDF
- ↑ Rocchio, J. (1971); Lavrenko & Croft (2001), см. выше.
- ↑ Nogueira, R.; Cho, K. (2019). ‘‘Passage Re‑ranking with BERT’’. arXiv:1901.04085.
- ↑ Khattab, O.; Zaharia, M. (2020). ‘‘ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT’’. SIGIR. DOI:10.1145/3397271.3401075; arXiv:2004.12832.
- ↑ Cormack, G. V.; Clarke, C. L. A.; Büttcher, S. (2009). ‘‘Reciprocal Rank Fusion Outperforms Condorcet and Nearly Optimally Combines Rankings’’. SIGIR. DOI:10.1145/1571941.1572114.
- ↑ Gao, L. et al. (2023). Табл. 1. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Izacard, G. et al. (2022); сводные метрики — в Gao et al., 2023, табл. 1. arXiv:2112.09118.
- ↑ Gao, L. et al. (2023). Табл. 1.
- ↑ Karpukhin, V. et al. (2020); сводные — в Gao et al., 2023.
- ↑ Xiong, L. et al. (2021). ICLR. arXiv:2007.00808.
- ↑ Thakur, N. et al. (2021); сводные — в Gao et al., 2023, табл. 2. arXiv:2104.08663.
- ↑ Izacard, G. et al. (2022); сводные — в Gao et al., 2023, табл. 2.
- ↑ Gao, L. et al. (2023). Табл. 2.
- ↑ Gao, L. et al. (2023). Табл. 3. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Gao, L. et al. (2023). §4–5.
- ↑ Gao, L. et al. (2023). §4.2–4.3.
- ↑ Gao, L. et al. (2023). §4.1.
- ↑ Haystack Docs. ‘‘Hypothetical Document Embeddings (HyDE)’’ (инженерная справка). docs.haystack.deepset.ai
- ↑ Gao, L. et al. (2023). Табл. 6.
- ↑ Milvus Docs. ‘‘Similarity Metrics’’.
- ↑ Haystack × Milvus Integration (официальная док.). haystack.deepset.ai
- ↑ Nogueira, R.; Cho, K. (2019). arXiv:1901.04085.
- ↑ Khattab, O.; Zaharia, M. (2020). DOI:10.1145/3397271.3401075.
- ↑ Cormack, G. V. et al. (2009). DOI:10.1145/1571941.1572114.
- ↑ Manning, C. D.; Raghavan, P.; Schütze, H. (2008). Introduction to Information Retrieval. Cambridge Univ. Press. ISBN 978‑0521865715.
- ↑ Es, S. et al. (2023). ‘‘RAGAS: Automated Evaluation of Retrieval‑Augmented Generation’’. arXiv:2309.15217.
- ↑ Gao, L. et al. (2023). §5.
- ↑ Gao, L. et al. (2023). §3.2; §4.1. DOI:10.18653/v1/2023.acl-long.99.
- ↑ Gao, L. et al. (2023). Табл. 3; §4.4.
- ↑ Gao, L. et al. (2023). §4–5.
- ↑ Ouyang, L. et al. (2022). ‘‘Training language models to follow instructions with human feedback (InstructGPT)’’. NeurIPS. arXiv:2203.02155.
- ↑ Gao, L. et al. (2023). Табл. 1–2.
- ↑ Robertson, S.; Zaragoza, H. (2009). ‘‘The Probabilistic Relevance Framework: BM25 and Beyond’’. Found. Trends IR. DOI:10.1561/1500000019.
- ↑ Karpukhin, V. et al. (2020). DOI:10.18653/v1/2020.emnlp-main.550.
- ↑ Xiong, L. et al. (2021). arXiv:2007.00808.
- ↑ Nogueira, R. et al. (2019). arXiv:1904.08375.
- ↑ Nogueira, R.; Lin, J. (2019). tech report.
- ↑ Rocchio, J. (1971). SMART; Lavrenko & Croft (2001) SIGIR.