---
title: "Hypothetical Document Embeddings (HyDE) (HU)"
source: "https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)"
wiki: "systems-analysis.info/int"
article: "Hypothetical_Document_Embeddings_(HyDE)_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:Pages with math errors"
  - "Category:Pages with math render errors"
  - "Category:Prompt engineering"
revision_id: 3114
wiki_created_at: 2026-09-06T23:15:54Z
wiki_modified_at: 2026-09-06T23:15:54Z
downloaded_at: 2026-09-07T22:55:15Z
---

# Hypothetical Document Embeddings (HyDE) (HU)

**Hypothetical Document Expansion (HyDE)** — a vektoros keresés és a retrieval‑augmented generation (RAG) javítására szolgáló módszer, amelynek során egy nagy nyelvi modell (LLM) az eredeti lekérdezés alapján egy „hipotetikus dokumentumot" generál; ezt a szöveget ezután egy enkóder vektorizálja, és a tényleges dokumentumok között a kapott vektorhoz való közelség alapján folyik a keresés. A megközelítés lehetővé teszi az LLM által kódolt „relevanciamintázatok" kiaknázását, és ezeket sűrű embeddingek segítségével a korpuszra „horgonyozza"<sup>[\[1\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-1)</sup>.\n\n== Meghatározás és intuíció ==\nA HyDE a keresési feladatot két lépésre bontja:\n\n(1) Az LLM a lekérdezéshez létrehoz egy „releváns válasz mintát" (*hypothetical document*), ezáltal modellezi a relevanciajegyeket;\n\n(2) egy kontrasztív enkóder (pl. Contriever) ezt a szöveget vektorrá alakítja, amely alapján a tényleges dokumentumok kinyerhetők az indexből. A generált szöveg tartalmazhat ténybeli hibákat, azonban a fontosak az enkóder által felismert tematikai és terminológiai minták<sup>[\[2\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-2)</sup>.\n\n== Előzmények és források ==\nA keresés szintetikus szövegekkel való bővítésének ötlete a lekérdezésbővítési és pszeudo-relevanciavissza-jelzési (PRF) kutatásokra vezethető vissza: a Rocchio-algoritmus és a relevanciaalapú nyelvi modellek<sup>[\[3\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-3)[\[4\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-4)</sup>. A sűrű visszakereséshez kontrasztívan tanított enkódereket (Contriever)<sup>[\[5\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-5)</sup> és Dense Passage Retrieval (DPR)<sup>[\[6\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-6)</sup> módszert alkalmaztak. A BEIR benchmark standardizálta a zero‑shot kiértékelést<sup>[\[7\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-7)</sup>. Ezen a háttéren javasolták a HyDE-t mint olyan módszert, amely nulláról (zero-shot) „beemeli" a relevanciaismeretet az LLM-en keresztül, az enkóder finomhangolása nélkül<sup>[\[8\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-8)</sup>.\n\n== Módszer és formalizáció ==\nLegyen a dokumentumkorpusz $\mathcal{D} = \{ d_{1},\ldots,d_{N}\}$, a szöveges enkóder $E:\text{text} \rightarrow {\mathbb{R}}^{n}$ pedig a dokumentumok vektoros reprezentációit $\mathbf{v}_{d} = E(d)$ adja meg. A közelség mérésére kosinus-hasonlóságot vagy skaláris szorzatot alkalmaznak; fontos megjegyzés: \*\*a skaláris szorzat csak akkor egyezik meg a kosinus-hasonlósággal, ha mindkét vektor L2-normája egységnyi\*\* ($\|\mathbf{u}\| = \|\mathbf{v}\| = 1$)<sup>[\[9\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-9)</sup>.\n\nA HyDE a lekérdezés reprezentációját az LLM által generált „hipotetikus dokumentumon" keresztül határozza meg. Formálisan:\n\n$\begin{matrix}
 & \text{(1) Генерация гипотетического текста:} & & {\overset{\sim}{d}\; = \; G\!\left( q;\,{inst} \right),} \\
 & \text{(2) Эмбеддинг гипотетического текста:} & & {\mathbf{v}_{h}\; = \; E(\overset{\sim}{d}),} \\
 & \text{(3) Поиск ближайших соседей:} & & {\mathcal{R}_{k}(q)\; = \;{TopK}_{\, d \in \mathcal{D}}\; S\!\left( \mathbf{v}_{h},\mathbf{v}_{d} \right),}
\end{matrix}$\n\nahol $G$ — az LLM a $inst$ instrukcióval (például: „Írj egy bekezdést, amely megválaszolja a következő kérdést: …"), $S$ — a hasonlóságmérték (koszinusz vagy normalizált IP), $\mathcal{R}_{k}(q)$ pedig a maximális hasonlóságú $k$ dokumentumok halmaza<sup>[\[10\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-10)[\[11\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-11)</sup>.\n\nA mérnöki gyakorlatban gyakran \*\*több\*\* hipotetikus szöveget generálnak, és aggregálják azok reprezentációit, ami növeli a robusztusságot:\n\n${\overset{\sim}{d}}^{(j)} = G\!\left( q;\,{inst},\xi_{j} \right),\quad\mathbf{v}_{h}\; = \;\frac{1}{m}\sum\limits_{j = 1}^{m}E\!\left( {\overset{\sim}{d}}^{(j)} \right),$\n\nahol $\xi_{j}$ — a dekódolás sztochasztikus paraméterei (pl. temperature/top‑p). Az ilyen enszemlizálás mérsékelt latencinövekedés mellett javítja a Recall értékét<sup>[\[12\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-12)</sup>.\n\n=== A HyDE alapfolyamata ===\n

    # 1) prompt(query) -> hypothetical_doc
    # 2) embed(hypothetical_doc) -> v_h
    # 3) retrieve(index, v_h, k) -> candidates
    # 4) (optional) rerank(query, candidates) -> topN
    # 5) (для RAG) stuff / map-reduce / refine на topN

\n\n\n\n=== Kapcsolat más módszerekkel (QE, doc2query, PRF) ===\n\* **QE (lekérdezésbővítés)** kifejezéseket ad a lekérdezéshez; a HyDE ehelyett egy teljes „kvázidokumentumot" generál, ami jobban illeszkedik a sűrű enkóderekhez<sup>[\[13\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-13)</sup>.\n\* **doc2query / docTTTTTquery** szintetikus lekérdezésekkel bővíti a **dokumentumokat** az indexelés előtt<sup>[\[14\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-14)[\[15\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-15)</sup>; a HyDE a **lekérdezést** bővíti menet közben, újraindexelés nélkül.\n\* **PRF** (Rocchio, Relevance LM) a lekérdezési vektort a top eredmények alapján frissíti; a HyDE a „relevanciamintázatot" közvetlenül az LLM-ből nyeri ki, majd a korpuszon végzett visszakereséssel „horgonyozza le"<sup>[\[16\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-16)</sup>.\n\n== Integráció RAG-ba és újrarangsorolás ==\nA RAG-ban a HyDE az első visszakeresési lépésként alkalmazható: hipotetikus dokumentum → embedding → k jelölt. Ezután újrarangsorolás következik: BERT-osztályú kereszt-enkóderek<sup>[\[17\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-17)</sup> vagy késői interakciós ColBERT<sup>[\[18\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-18)</sup>. A listák összeolvasztásához (pl. BM25+vektor hibrid) általában RRF (*reciprocal rank fusion*) alkalmazandó:\n$\operatorname{RRF}(d) = \sum\limits_{r \in \mathcal{R}}\frac{1}{k + \operatorname{rank}_{r}(d)},\qquad k \approx 60.$\nAz RRF módszer következetesen javítja az egyesített rangsorolások összesített minőségét<sup>[\[19\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-19)</sup>.\n\n== Kiértékelés benchmarkokon (BEIR és egyéb) ==\nAz eredeti tanulmány zero‑shot módban értékeli a HyDE-t a TREC DL'19/20 (webkeresés) és a BEIR-kollekciók egy részhalmazán (Scifact, ArguAna, TREC‑COVID, FiQA, DBPedia, TREC‑NEWS, Climate‑FEVER). Az eredmények töredéke — *2023‑07 állapot szerint*:\n\n{\| class=\\wikitable\\\n\|+ *TREC DL19/20 (webkeresés)* — mAP / nDCG@10 / Recall@1k\n\|-\n! Módszer !! DL19 !! DL20 !! Forrás\n\|-\n\| BM25 \|\| 30.1 / 50.6 / 75.0 \|\| 28.6 / 48.0 / 78.6 \|\| <sup>[\[20\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-20)</sup>\n\|-\n\| Contriever (unsup.) \|\| 24.0 / 44.5 / 74.6 \|\| 24.0 / 42.1 / 75.4 \|\| <sup>[\[21\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-21)</sup>\n\|-\n\| **HyDE** (Contriever+LLM) \|\| **41.8 / 61.3 / 88.0** \|\| **38.2 / 57.9 / 84.4** \|\| <sup>[\[22\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-22)</sup>\n\|-\n\| DPR (ft) \|\| 36.5 / 62.2 / 76.9 \|\| 41.8 / 65.3 / 81.4 \|\| <sup>[\[23\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-23)</sup>\n\|-\n\| ANCE (ft) \|\| 37.1 / 64.5 / 75.5 \|\| 40.8 / 64.6 / 77.6 \|\| <sup>[\[24\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-24)</sup>\n\|}\n\n{\| class=\\wikitable\\\n\|+ *BEIR (válogatott adathalmazok)* — nDCG@10 / Recall@100\n\|-\n! Módszer !! Scifact !! ArguAna !! TREC‑COVID !! FiQA !! DBPedia !! TREC‑NEWS !! Climate‑FEVER !! Forrás\n\|-\n\| BM25 \|\| 67.9 / 92.5 \|\| 39.7 / 93.2 \|\| **59.5 / 49.8** \|\| 23.6 / 54.0 \|\| 31.8 / 46.8 \|\| 39.5 / 44.7 \|\| 16.5 / 42.5 \|\| <sup>[\[25\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-25)</sup>\n\|-\n\| Contriever \|\| 64.9 / 92.6 \|\| 37.9 / 90.1 \|\| 27.3 / 17.2 \|\| 24.5 / 56.2 \|\| 29.2 / 45.3 \|\| 34.8 / 42.3 \|\| 15.5 / 44.1 \|\| <sup>[\[26\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-26)</sup>\n\|-\n\| **HyDE** \|\| **69.1 / 96.4** \|\| **46.6 / 97.9** \|\| 59.3 / 41.4 \|\| 27.3 / 62.1 \|\| 36.8 / 47.2 \|\| **44.0 / 50.9** \|\| **22.3 / 53.0** \|\| <sup>[\[27\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-27)</sup>\n\|}\n\nA HyDE emellett javítja az MRR@100 értéket a többnyelvű Mr.TyDi adathalmazokon (sw/ko/ja/bn) az mContrieverhez képest<sup>[\[28\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-28)</sup>.\n\n== Gyakorlati ajánlások ==\n;Mikor alkalmazzuk a HyDE-t\n\* Zero-shot/transzfer módban (nincsenek relevanciacímkék; a domain „különbözősége" a tanítókorpuszoktól)<sup>[\[29\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-29)</sup>.\n\* Ha Recall@k javítása szükséges elfogadható pontosság mellett — a HyDE gyakran „megnyitja" a vektortér releváns területeit<sup>[\[30\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-30)</sup>.\n\n;Tipikus beállítások\n\* **LLM és prompt**: „Írj egy bekezdést, amely megválaszolja a következő kérdést: …" instrukció; mérsékelt sztochaszticitás (pl. *temperature*≈0.7)<sup>[\[31\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-31)</sup>.\n\* **Hipotetikus szövegek száma**: 1–5; az embeddingek átlagolása növeli a robusztusságot<sup>[\[32\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-32)</sup>.\n\* **Embeddingmodul**: (m)Contriever finomhangolás nélkül; finomhangolt enkóderek is alkalmazhatók (a HyDE hatása megmarad)<sup>[\[33\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-33)</sup>.\n\* **Embedding normalizálás**: L2-norma; a belső szorzat ekvivalens a koszinusszal<sup>[\[34\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-34)</sup>.\n\* **Hibrid visszakeresés**: BM25+vektor, majd újrarangsorolás<sup>[\[35\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-35)</sup>.\n\* **Újrarangsoroló**: Cross-Encoder (BERT re‑ranker)<sup>[\[36\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-36)</sup> vagy ColBERT<sup>[\[37\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-37)</sup>.\n\* **Összevonás** különböző stratégiák eredményeiből: RRF (*k*≈60)<sup>[\[38\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-38)</sup>.\n\n;Minőség/költség monitorozása\n\* Visszakeresés: nDCG@k, Recall@k, MRR; end‑to‑end RAG: EM/F1 vagy *groundedness* metrikák (RAGAS/TruLens)<sup>[\[39\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-39)[\[40\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-40)</sup>.\n\* Költség/latencia: az LLM generálás és (ha van) az újrarangsorolás dominál; a „hipotézisek" számának és a válasz hosszának optimalizálásával csökkenthető<sup>[\[41\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-41)</sup>.\n\n== Korlátok és nyitott kérdések ==\n\* **Hallucinációk** a hipotetikus szövegben: az LLM ténybeli hibákat vihet be; az enkóderen és a korpuszon keresztüli „lehorgonyzás" csökkenti a kockázatot, de nem szünteti meg teljesen<sup>[\[42\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-42)</sup>.\n\* **Domain- és nyelvspecifikus korlátok**: a HyDE előnye csökken szűken specializált területeken és alacsony erőforrású nyelveken<sup>[\[43\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-43)</sup>.\n\* **Latencia és költség**: az LLM generálás késleltetést és token-költséget ad hozzá; ez kritikus online forgatókönyvek és hosszú „hipotetikák" esetén<sup>[\[44\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-44)</sup>.\n\* **Etika és torzítások**: ajánlott biztonságos LLM-ek és szűrés alkalmazása<sup>[\[45\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-45)</sup>.\n\n== A módszerek összehasonlító táblázata ==\n{\| class=\\wikitable\\\n\|+ A HyDE és rokon megközelítések összehasonlítása\n\|-\n! Módszer !! Osztály !! Hol generálódik a szöveg !! Enkóder/index !! Újrarangsoroló (2. lépés) !! Tipikus metrikák (példa) !! Költség/latencia !! Források\n\|-\n\| **HyDE** \|\| Query→*hypo‑doc* \|\| A lekérdezés oldalán (LLM → bekezdés) \|\| (m)Contriever; ANN \|\| BERT re‑rank / ColBERT / RRF \|\| DL19 nDCG@10≈61.3; DL20≈57.9; ArguAna nDCG@10≈46.6 \|\| + LLM generálás; + újrarangsorolás (opcionális) \|\| <sup>[\[46\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-46)</sup>\n\|-\n\| BM25 \|\| Lexikális \|\| — \|\| Invertált index \|\| Opcionális \|\| lásd fenti táblázat \|\| Alacsony (lexikális) \|\| <sup>[\[47\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-47)</sup>\n\|-\n\| DPR / ANCE \|\| Sűrű (ft) \|\| — \|\| Bi‑encoder; ANN \|\| Opcionális \|\| DL19 nDCG@10≈62–65 \|\| Közepes (LLM nélkül) \|\| <sup>[\[48\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-48)[\[49\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-49)</sup>\n\|-\n\| doc2query / docTTTTTquery \|\| Dokumentumbővítés \|\| A kollekció oldalán (indexelés előtt) \|\| BM25/sparse+expanded \|\| Opcionális \|\| Javítások BM25-ön MS MARCO-n \|\| Nagy offline generálás; gyors online \|\| <sup>[\[50\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-50)[\[51\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-51)</sup>\n\|-\n\| PRF (Rocchio, RLM) \|\| QE visszajelzés alapján \|\| Lekérdezés (top eredmények alapján) \|\| Bármely \|\| Opcionális \|\| Recall növekedése/drift kockázata \|\| + extra visszakeresési menet \|\| <sup>[\[52\]](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_note-52)</sup>\n\|}\n\n== Lásd még ==\n\* BM25\n\* Vektoros reprezentáción alapuló keresés\n\* RAG\n\* Pszeudo-relevanciavissza-jelzés\n\* BEIR\n\n== Irodalom ==\n\* Manning, C. D.; Raghavan, P.; Schütze, H. (2008). *Introduction to Information Retrieval*. Cambridge University Press. ISBN 978‑0521865715.\n\* Robertson, S.; Zaragoza, H. (2009). *The Probabilistic Relevance Framework: BM25 and Beyond*. Foundations and Trends in IR, 3(4), 333–389. DOI:10.1561/1500000019.\n\n== Hivatkozások ==\n\* HyDE repositórium: github.com/texttron/hyde.\n\* Dokumentáció: Haystack — HyDE: docs.haystack.deepset.ai.\n\* Dokumentáció: LangChain — HyDE Retriever: docs.langchain.com.\n\n== Megjegyzések ==\n\n\n\n<a href="https://systems-analysis.info/int/index.php?title=Template:SEOMeta%5Cn&amp;action=edit&amp;redlink=1" class="new" title="Template:SEOMeta\n (page does not exist)">Template:SEOMeta\n</a>

1.  <span id="cite_note-1">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-1) Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023. pp. 1762–1777. DOI:10.18653/v1/2023.acl-long.99. <a href="https://arxiv.org/abs/2212.10496" class="external text" rel="nofollow">arXiv:2212.10496</a></span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-2) Gao, L. et al. (2023). ACL 2023, §3.2. DOI:10.18653/v1/2023.acl-long.99.</span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-3) Rocchio, J. (1971). ‘‘Relevance Feedback in Information Retrieval’’. In: Salton, G. (ed.) *The SMART Retrieval System*. Prentice‑Hall, pp. 313–323. ISBN 978‑0138145255.</span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-4) Lavrenko, V.; Croft, W. B. (2001). ‘‘Relevance‑Based Language Models’’. SIGIR. DOI:10.1145/383952.383972.</span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-5) Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning’’. <a href="https://arxiv.org/abs/2112.09118" class="external text" rel="nofollow">arXiv:2112.09118</a>.</span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-6) Karpukhin, V. et al. (2020). ‘‘Dense Passage Retrieval for Open‑Domain QA’’. EMNLP. DOI:10.18653/v1/2020.emnlp-main.550.</span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-7) Thakur, N. et al. (2021). ‘‘BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of Information Retrieval Models’’. NeurIPS Datasets Track. <a href="https://arxiv.org/abs/2104.08663" class="external text" rel="nofollow">arXiv:2104.08663</a>.</span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-8) Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.</span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-9) Milvus Docs. ‘‘Similarity Metrics’’ — при L2‑нормализации векторов внутр. произведение эквивалентно косинусу. URL: <a href="https://milvus.io/docs/v2.2.x/metric.md" class="external free" rel="nofollow">https://milvus.io/docs/v2.2.x/metric.md</a></span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-10) Gao, L.; Ma, X.; Lin, J.; Callan, J. (2023). ‘‘Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)’’. ACL 2023, §3–4. arXiv:2212.10496. DOI:10.18653/v1/2023.acl-long.99.</span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-11) Izacard, G. et al. (2021/2022). ‘‘Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever)’’. arXiv:2112.09118.</span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-12) Gao, L. et al. (2023). Прил. (ablation): влияние числа гипотетических текстов и параметров генерации. arXiv:2212.10496.</span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-13) Gao, L. et al. (2023). DOI:10.18653/v1/2023.acl-long.99.</span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-14) Nogueira, R. et al. (2019). ‘‘Document Expansion by Query Prediction’’ (doc2query). <a href="https://arxiv.org/abs/1904.08375" class="external text" rel="nofollow">arXiv:1904.08375</a>.</span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-15) Nogueira, R.; Lin, J. (2019). ‘‘From doc2query to docTTTTTquery’’ (tech report). <a href="https://cs.uwaterloo.ca/~jimmylin/publications/Nogueira_Lin_2019_docTTTTTquery-v2.pdf" class="external text" rel="nofollow">PDF</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-16) Rocchio, J. (1971); Lavrenko & Croft (2001), см. выше.</span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-17) Nogueira, R.; Cho, K. (2019). ‘‘Passage Re‑ranking with BERT’’. <a href="https://arxiv.org/abs/1901.04085" class="external text" rel="nofollow">arXiv:1901.04085</a>.</span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-18) Khattab, O.; Zaharia, M. (2020). ‘‘ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT’’. SIGIR. DOI:10.1145/3397271.3401075; <a href="https://arxiv.org/abs/2004.12832" class="external text" rel="nofollow">arXiv:2004.12832</a>.</span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-19) Cormack, G. V.; Clarke, C. L. A.; Büttcher, S. (2009). ‘‘Reciprocal Rank Fusion Outperforms Condorcet and Nearly Optimally Combines Rankings’’. SIGIR. DOI:10.1145/1571941.1572114.</span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-20) Gao, L. et al. (2023). Табл. 1. DOI:10.18653/v1/2023.acl-long.99.</span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-21) Izacard, G. et al. (2022); сводные метрики — в Gao et al., 2023, табл. 1. arXiv:2112.09118.</span>
22. <span id="cite_note-22">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-22) Gao, L. et al. (2023). Табл. 1.</span>
23. <span id="cite_note-23">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-23) Karpukhin, V. et al. (2020); сводные — в Gao et al., 2023.</span>
24. <span id="cite_note-24">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-24) Xiong, L. et al. (2021). ICLR. <a href="https://arxiv.org/abs/2007.00808" class="external text" rel="nofollow">arXiv:2007.00808</a>.</span>
25. <span id="cite_note-25">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-25) Thakur, N. et al. (2021); сводные — в Gao et al., 2023, табл. 2. arXiv:2104.08663.</span>
26. <span id="cite_note-26">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-26) Izacard, G. et al. (2022); сводные — в Gao et al., 2023, табл. 2.</span>
27. <span id="cite_note-27">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-27) Gao, L. et al. (2023). Табл. 2.</span>
28. <span id="cite_note-28">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-28) Gao, L. et al. (2023). Табл. 3. DOI:10.18653/v1/2023.acl-long.99.</span>
29. <span id="cite_note-29">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-29) Gao, L. et al. (2023). §4–5.</span>
30. <span id="cite_note-30">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-30) Gao, L. et al. (2023). §4.2–4.3.</span>
31. <span id="cite_note-31">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-31) Gao, L. et al. (2023). §4.1.</span>
32. <span id="cite_note-32">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-32) Haystack Docs. ‘‘Hypothetical Document Embeddings (HyDE)’’ (инженерная справка). <a href="https://docs.haystack.deepset.ai/docs/hypothetical-document-embeddings-hyde" class="external text" rel="nofollow">docs.haystack.deepset.ai</a></span>
33. <span id="cite_note-33">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-33) Gao, L. et al. (2023). Табл. 6.</span>
34. <span id="cite_note-34">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-34) Milvus Docs. ‘‘Similarity Metrics’’.</span>
35. <span id="cite_note-35">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-35) Haystack × Milvus Integration (официальная док.). <a href="https://haystack.deepset.ai/integrations/milvus-document-store" class="external text" rel="nofollow">haystack.deepset.ai</a></span>
36. <span id="cite_note-36">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-36) Nogueira, R.; Cho, K. (2019). arXiv:1901.04085.</span>
37. <span id="cite_note-37">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-37) Khattab, O.; Zaharia, M. (2020). DOI:10.1145/3397271.3401075.</span>
38. <span id="cite_note-38">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-38) Cormack, G. V. et al. (2009). DOI:10.1145/1571941.1572114.</span>
39. <span id="cite_note-39">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-39) Manning, C. D.; Raghavan, P.; Schütze, H. (2008). *Introduction to Information Retrieval*. Cambridge Univ. Press. ISBN 978‑0521865715.</span>
40. <span id="cite_note-40">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-40) Es, S. et al. (2023). ‘‘RAGAS: Automated Evaluation of Retrieval‑Augmented Generation’’. <a href="https://arxiv.org/abs/2309.15217" class="external text" rel="nofollow">arXiv:2309.15217</a>.</span>
41. <span id="cite_note-41">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-41) Gao, L. et al. (2023). §5.</span>
42. <span id="cite_note-42">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-42) Gao, L. et al. (2023). §3.2; §4.1. DOI:10.18653/v1/2023.acl-long.99.</span>
43. <span id="cite_note-43">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-43) Gao, L. et al. (2023). Табл. 3; §4.4.</span>
44. <span id="cite_note-44">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-44) Gao, L. et al. (2023). §4–5.</span>
45. <span id="cite_note-45">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-45) Ouyang, L. et al. (2022). ‘‘Training language models to follow instructions with human feedback (InstructGPT)’’. NeurIPS. <a href="https://arxiv.org/abs/2203.02155" class="external text" rel="nofollow">arXiv:2203.02155</a>.</span>
46. <span id="cite_note-46">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-46) Gao, L. et al. (2023). Табл. 1–2.</span>
47. <span id="cite_note-47">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-47) Robertson, S.; Zaragoza, H. (2009). ‘‘The Probabilistic Relevance Framework: BM25 and Beyond’’. Found. Trends IR. DOI:10.1561/1500000019.</span>
48. <span id="cite_note-48">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-48) Karpukhin, V. et al. (2020). DOI:10.18653/v1/2020.emnlp-main.550.</span>
49. <span id="cite_note-49">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-49) Xiong, L. et al. (2021). <a href="https://arxiv.org/abs/2007.00808" class="external text" rel="nofollow">arXiv:2007.00808</a>.</span>
50. <span id="cite_note-50">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-50) Nogueira, R. et al. (2019). arXiv:1904.08375.</span>
51. <span id="cite_note-51">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-51) Nogueira, R.; Lin, J. (2019). tech report.</span>
52. <span id="cite_note-52">[↑](https://systems-analysis.info/int/Hypothetical_Document_Embeddings_(HyDE)_(HU)#cite_ref-52) Rocchio, J. (1971). SMART; Lavrenko & Croft (2001) SIGIR.</span>
