---
title: "RAG-паттерны"
source: "https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B"
wiki: "systems-analysis.info/wiki"
article: "RAG-паттерны"
language: "ru"
categories:
  - "Категория:Prompt инжиниринг"
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
revision_id: 173
wiki_created_at: 2026-09-06T22:04:49Z
wiki_modified_at: 2026-09-06T22:04:49Z
downloaded_at: 2026-09-07T22:18:02Z
---

# RAG-паттерны

**RAG-паттерны** (англ. *RAG Patterns*) — это набор архитектурных и методологических подходов для построения систем **Retrieval-Augmented Generation** (RAG). Эти паттерны предназначены для решения фундаментальных проблем [больших языковых моделей (LLM)](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели"), таких как галлюцинации, устаревание знаний и недостаток доменной специфики, путём интеграции LLM с внешними, динамически доступными источниками данных<sup>[\[1\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-lewis2020-1)</sup>. Эволюция RAG прошла путь от простых линейных конвейеров к сложным модульным и агентным системам<sup>[\[2\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-survey2024-2)</sup>.

## Основные паттерны RAG

С развитием технологии появилось множество RAG‑паттернов, каждый из которых решает определённые задачи и имеет свои компромиссы между качеством, скоростью и стоимостью.

- **Classic RAG (Классический RAG)** — базовый подход, где запрос пользователя векторизуется для поиска релевантных фрагментов (чанков) в векторной БД; найденные чанки подаются в LLM вместе с вопросом для генерации ответа<sup>[\[1\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-lewis2020-1)</sup>.

<!-- -->

- **Multi‑Query RAG (Множественные запросы)** — LLM генерирует несколько перефразированных/уточнённых вариантов исходного запроса; поиск выполняется по всем вариантам, результаты объединяются, что повышает полноту (*recall*)<sup>[\[3\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-langchain-multiquery-3)</sup>.

<!-- -->

- **HyDE ([Hypothetical Document Expansion](https://systems-analysis.info/wiki/Hypothetical_Document_Expansion "Hypothetical Document Expansion"))** — для преодоления «семантического разрыва» между коротким запросом и длинными документами. LLM сначала генерирует «гипотетический» документ-ответ, затем его эмбеддинг используется для поиска, что часто улучшает качество извлечения<sup>[\[4\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-hyde-4)</sup>.

<!-- -->

- **[Hybrid Retrieval](https://systems-analysis.info/wiki/Hybrid_Retrieval "Hybrid Retrieval") (Гибридный поиск)** — комбинация семантического (векторного) и лексического (BM25) поиска. Гибридные схемы стали стандартом для продакшен‑систем: векторный поиск покрывает смысловые соответствия, а BM25 находит точные термины/ID/акронимы; результаты объединяются фьюжном<sup>[\[5\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-weaviate-hybrid-5)[\[6\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-qdrant-hybrid-6)[\[7\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-milvus-fulltext-7)</sup>.

<!-- -->

- **Re‑ranking (Дополнительное ранжирование)** — двухэтапный процесс: быстрый ретривер отдаёт набор кандидатов (например, топ‑100), далее кросс‑энкодер (или иной реранкер) пересчитывает релевантность и отбирает лучшие (например, топ‑5) для LLM<sup>[\[8\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-nogueira2019-8)[\[9\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-cohere-rerank-9)</sup>.

<!-- -->

- **Query Routing (Маршрутизация запросов)** — в системах с несколькими разнородными источниками данных (разные индексы/БД/API) запрос направляется к наилучшему источнику с помощью роутера (LLM‑селектор или классификатор); включает fallback‑стратегии<sup>[\[10\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-llama-router-10)</sup>.

<!-- -->

- **Agentic/Web RAG (Агентный RAG)** — LLM выступает как [агент](https://systems-analysis.info/wiki/AI-%D0%B0%D0%B3%D0%B5%D0%BD%D1%82 "AI-агент"): декомпозирует сложные вопросы, планирует итерации и использует инструменты (векторный поиск, веб‑поиск) с обратной связью. Типичная реализация — парадигма ReAct<sup>[\[11\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-react-11)</sup>; для веб‑ориентированного сбора и обязательного цитирования см. WebGPT<sup>[\[12\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-webgpt-12)</sup>.

### Смежные и развивающиеся парадигмы

- **[GraphRAG (Графовый RAG)](https://systems-analysis.info/wiki/GraphRAG "GraphRAG")** — использует граф знаний как источник и механизм выбора контекста; поиск идёт по структуре связей между сущностями и по тексту, повышая интерпретируемость и качество на multi‑hop вопросах<sup>[\[13\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-graphrag-13)[\[14\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-graphrag-project-14)</sup>.
- **[MM‑RAG (Мультимодальный RAG)](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG) "MM-RAG (Multimodal RAG)")** — работа с текстом и визуальными источниками (сканы/схемы/таблицы). Пример: VisRAG демонстрирует VLM‑ориентированный ретрив и генерацию на мультимодальных документах<sup>[\[15\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-visrag-15)</sup>.
- **[Packaging & Context Handling](https://systems-analysis.info/wiki/Packaging_%26_Context_Handling "Packaging & Context Handling") (Упаковка контекста)** — способы интеграции найденных чанков в промпт: *Stuff*, *Map‑Reduce*, *Refine*, *Tree‑of‑Chunks (RAPTOR)*<sup>[\[16\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-raptor-16)</sup>.

## Сравнительная таблица паттернов

| Паттерн              | Когда применять                                                   | Влияние на качество                                                                                                                                                                                                                                                                                                                                                                                                                     | Стоимость / Задержка | Риски и ограничения                                             |
|----------------------|-------------------------------------------------------------------|-----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|----------------------|-----------------------------------------------------------------|
| **Classic RAG**      | PoC и простые Q&A над гомогенной базой                            | Базовый уровень; сильно зависит от эмбеддингов<sup>[\[1\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-lewis2020-1)</sup>                                                                                                                                                                                                                                                         | Низкая               | Чувствительность к формулировкам; риск нерелевантного контекста |
| **Hybrid Retrieval** | В большинстве прод‑сценариев; много кодов/акронимов/ID            | Повышает полноту; покрывает точные термины<sup>[\[5\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-weaviate-hybrid-5)[\[6\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-qdrant-hybrid-6)[\[7\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-milvus-fulltext-7)</sup> | Низкая/Средняя       | Настройка весов фьюжна; два индекса                             |
| **Re‑ranking**       | Критичен, когда важна высокая точность                            | Существенный прирост precision на топ‑k<sup>[\[8\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-nogueira2019-8)[\[9\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-cohere-rerank-9)</sup>                                                                                                                                   | Средняя/Высокая      | Доп. задержка/стоимость                                         |
| **Multi‑Query**      | Короткие/многоаспектные запросы                                   | Повышает recall<sup>[\[3\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-langchain-multiquery-3)</sup>                                                                                                                                                                                                                                                                             | Средняя              | Избыточные/шумные перефразы                                     |
| **HyDE**             | Короткие/неоднозначные запросы с большим «семантическим разрывом» | Улучшает качество ретрива *zero‑shot*<sup>[\[4\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-hyde-4)</sup>                                                                                                                                                                                                                                                                       | Средняя              | Зависит от качества «гипотетического» текста                    |
| **Query Routing**    | Несколько источников (док‑база, SQL, API, веб)                    | Повышает релевантность за счёт правильного источника<sup>[\[10\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-llama-router-10)</sup>                                                                                                                                                                                                                                              | Средняя              | Ошибка маршрута = провал поиска                                 |
| **Agentic/Web RAG**  | Сложные, исследовательские, многоэтапные запросы                  | Решает задачи за пределами линейного конвейера<sup>[\[11\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-react-11)[\[12\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-webgpt-12)</sup>                                                                                                                                      | Высокая              | Сложность, риск зацикливания; нужны гардрейлы                   |

Сравнение ключевых RAG-паттернов

## Практическая реализация и архитектура

### Этапы внедрения

1.  **Proof of Concept (PoC):** Начните с **Classic RAG** на ограниченном, но репрезентативном наборе данных, чтобы проверить качество эмбеддингов и базовый ретрив<sup>[\[1\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-lewis2020-1)</sup>.
2.  **Minimum Viable Product (MVP):** Внедрите **Hybrid Retrieval** и **Re‑ranking** как наилучшее соотношение «усилие/эффект»<sup>[\[5\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-weaviate-hybrid-5)[\[8\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-nogueira2019-8)</sup>.
3.  **Production:** Добавьте трансформации запросов (**HyDE**, **Multi‑Query**) и при необходимости **Query Routing**; настройте observability (логирование ретрива/реранка/ответов) и A/B‑тестирование<sup>[\[3\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-langchain-multiquery-3)[\[10\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-llama-router-10)</sup>.

### Ключевые компоненты

- **Чанкинг (Chunking):** Один из самых критичных факторов качества. Наивный фиксированный размер часто разрывает смысловые единицы. Рекомендуются структурно‑ориентированные (по разметке) или рекурсивные сплиттеры (параграф → предложение → слово)<sup>[\[17\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-rcsplit-17)[\[18\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-llama-hier-18)</sup>.
- **Эмбеддинги и метаданные:** Храните с каждым чанком document_id, страницу/секцию, заголовок, даты; это необходимо для фильтрации и корректного цитирования источников.
- **Гибридный ретрив и реранк:** Используйте BM25+вектор с фьюжном (или RRF), затем кросс‑энкодер для переранжирования на небольшом пуле кандидатов<sup>[\[5\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-weaviate-hybrid-5)[\[6\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-qdrant-hybrid-6)[\[8\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-nogueira2019-8)</sup>.
- **Упаковка контекста:** Выбирайте *Map‑Reduce*, *Refine* или *Tree‑of‑Chunks* для длинных корпусов<sup>[\[16\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-raptor-16)[\[18\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-llama-hier-18)</sup>.

### Распространённые ошибки (антипаттерны)

- **Только векторный поиск** без BM25 → провалы на кодах/ID/акронимах<sup>[\[5\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-weaviate-hybrid-5)[\[7\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-milvus-fulltext-7)</sup>.
- **Слишком крупный/мелкий чанк** → потеря контекста или «размывание» эмбеддинга<sup>[\[17\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-rcsplit-17)</sup>.
- **Отсутствие реранка в проде** → LLM получает шумный контекст<sup>[\[8\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-nogueira2019-8)</sup>.
- **Нет observability** и трейсинга источников → невозможно разбирать причины ошибок (см. оценку RAG).

## Оценка качества и метрики

Оценка проводится на уровне ретрива (оффлайн) и end‑to‑end (генерация).

### Метрики ретривера

- **Hit Rate, Recall@k, MRR** — покрытие и позиция релевантных документов.
- **Context Precision & Recall** — насколько извлечённый контекст без «мусора» и покрывает всё нужное (реализовано в RAGAS)<sup>[\[19\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-ragas-19)</sup>.

### Метрики генератора (end‑to‑end)

- **Faithfulness / Groundedness** — соответствие ответа предоставленному контексту.
- **Answer Relevancy (Релевантность ответа)** — соответствие исходному вопросу.

Для автоматизации метрик используются open‑source фреймворки: **RAGAS**, **TruLens** (*RAG triad*: context relevance, groundedness, answer relevance), **DeepEval**<sup>[\[20\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-trulens-20)[\[21\]](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_note-deepeval-21)</sup>.

## См. также

- [Retrieval-Augmented Generation (RAG)](https://systems-analysis.info/wiki/Retrieval%E2%80%91Augmented_Generation_(RAG) "Retrieval‑Augmented Generation (RAG)")
- [Векторные базы данных](https://systems-analysis.info/wiki/%D0%92%D0%B5%D0%BA%D1%82%D0%BE%D1%80%D0%BD%D1%8B%D0%B5_%D0%B1%D0%B0%D0%B7%D1%8B_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85 "Векторные базы данных")
- [Embedding](https://systems-analysis.info/wiki/Embedding "Embedding")
- [AI-агент](https://systems-analysis.info/wiki/AI-%D0%B0%D0%B3%D0%B5%D0%BD%D1%82 "AI-агент")
- [GraphRAG](https://systems-analysis.info/wiki/GraphRAG "GraphRAG")
- [MM-RAG](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG) "MM-RAG (Multimodal RAG)")
- [Оценка и бенчмарки LLM](https://systems-analysis.info/wiki/%D0%9E%D1%86%D0%B5%D0%BD%D0%BA%D0%B0_LLM "Оценка LLM")

## Литература

- Lewis, P., Perez, E., et al. (2020). *Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks*. NeurIPS. <a href="https://arxiv.org/abs/2005.11401" class="external text" rel="nofollow">arXiv:2005.11401</a>.
- Fan, W., Ding, Y., et al. (2024). *A Survey on RAG Meeting LLMs: Towards Retrieval-Augmented Large Language Models*. KDD. DOI:10.1145/3637528.3671470; <a href="https://arxiv.org/abs/2405.06211" class="external text" rel="nofollow">arXiv:2405.06211</a>.
- Gao, L., Ma, X., Lin, J., Callan, J. (2023). *Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)*. ACL 2023. <a href="https://aclanthology.org/2023.acl-long.99/" class="external text" rel="nofollow">ACL Anthology</a>; <a href="https://arxiv.org/abs/2212.10496" class="external text" rel="nofollow">arXiv:2212.10496</a>.
- Nogueira, R., Cho, K. (2019). *Passage Re‑ranking with BERT*. <a href="https://arxiv.org/abs/1901.04085" class="external text" rel="nofollow">arXiv:1901.04085</a>.
- Weaviate Docs. *Hybrid search (BM25+Vector)*. <a href="https://docs.weaviate.io/weaviate/concepts/search/hybrid-search" class="external autonumber" rel="nofollow">[1]</a>.
- Qdrant Docs. *Hybrid Queries*. <a href="https://qdrant.tech/documentation/concepts/hybrid-queries/" class="external autonumber" rel="nofollow">[2]</a>.
- Milvus Docs. *Full‑Text Search* / *Hybrid Search*. <a href="https://milvus.io/docs/full-text-search.md" class="external autonumber" rel="nofollow">[3]</a> / <a href="https://milvus.io/docs/hybrid_search_with_milvus.md" class="external autonumber" rel="nofollow">[4]</a>.
- LangChain Docs. *MultiQueryRetriever*. <a href="https://python.langchain.com/docs/how_to/MultiQueryRetriever/" class="external autonumber" rel="nofollow">[5]</a>.
- Cohere Docs. *Rerank — best practices*. <a href="https://docs.cohere.com/docs/reranking-best-practices" class="external autonumber" rel="nofollow">[6]</a>.
- LlamaIndex Docs. *Routing (query routers/selectors)*. <a href="https://docs.llamaindex.ai/en/stable/module_guides/querying/router/" class="external autonumber" rel="nofollow">[7]</a>.
- Yao, S., et al. (2023). *ReAct: Synergizing Reasoning and Acting in Language Models*. ICLR. <a href="https://arxiv.org/abs/2210.03629" class="external text" rel="nofollow">arXiv:2210.03629</a>.
- Nakano, R., et al. (2021). *WebGPT: Browser‑assisted question‑answering with human feedback*. <a href="https://arxiv.org/abs/2112.09332" class="external text" rel="nofollow">arXiv:2112.09332</a>.
- Microsoft Research Blog. *GraphRAG: Unlocking LLM discovery on narrative private data*. (2024). <a href="https://www.microsoft.com/en-us/research/blog/graphrag-unlocking-llm-discovery-on-narrative-private-data/" class="external autonumber" rel="nofollow">[8]</a>.
- Microsoft Research. *Project GraphRAG*. (2024). <a href="https://www.microsoft.com/en-us/research/project/graphrag/" class="external autonumber" rel="nofollow">[9]</a>.
- Yu, S., et al. (2024). *VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents*. <a href="https://arxiv.org/abs/2410.10594" class="external text" rel="nofollow">arXiv:2410.10594</a>.
- Sarthi, P., et al. (2024). *RAPTOR: Recursive Abstractive Processing for Tree‑Organized Retrieval*. <a href="https://arxiv.org/abs/2401.18059" class="external text" rel="nofollow">arXiv:2401.18059</a>.
- Es, S., et al. (2024). *RAGAs: Automated Evaluation of Retrieval Augmented Generation*. EACL (Demo). <a href="https://aclanthology.org/2024.eacl-demo.16/" class="external autonumber" rel="nofollow">[10]</a>.
- TruLens Docs. *RAG Triad*. <a href="https://www.trulens.org/getting_started/core_concepts/rag_triad/" class="external autonumber" rel="nofollow">[11]</a>.
- DeepEval (GitHub). *The LLM Evaluation Framework*. <a href="https://github.com/confident-ai/deepeval" class="external autonumber" rel="nofollow">[12]</a>.
- LangChain Docs. *RecursiveCharacterTextSplitter*. <a href="https://python.langchain.com/docs/how_to/recursive_text_splitter/" class="external autonumber" rel="nofollow">[13]</a>.
- LlamaIndex Docs. *HierarchicalNodeParser*; *Response Synthesis (Tree/Refine)*. <a href="https://docs.llamaindex.ai/en/stable/api/llama_index.core.node_parser.HierarchicalNodeParser.html" class="external autonumber" rel="nofollow">[14]</a>; <a href="https://docs.llamaindex.ai/en/stable/examples/low_level/response_synthesis/" class="external autonumber" rel="nofollow">[15]</a>.

## Примечания

1.  <span id="cite_note-lewis2020-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-lewis2020_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-lewis2020_1-1)</sup> <sup>[1,2](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-lewis2020_1-2)</sup> <sup>[1,3](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-lewis2020_1-3)</sup> Lewis, P., Perez, E., et al. (2020). *Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks*. NeurIPS. arXiv:2005.11401.</span>
2.  <span id="cite_note-survey2024-2">[↑](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-survey2024_2-0) Fan, W., Ding, Y., et al. (2024). *A Survey on RAG Meeting LLMs: Towards Retrieval-Augmented Large Language Models*. KDD. DOI:10.1145/3637528.3671470; arXiv:2405.06211.</span>
3.  <span id="cite_note-langchain-multiquery-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-langchain-multiquery_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-langchain-multiquery_3-1)</sup> <sup>[3,2](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-langchain-multiquery_3-2)</sup> LangChain Docs. *MultiQueryRetriever*. <a href="https://python.langchain.com/docs/how_to/MultiQueryRetriever/" class="external free" rel="nofollow">https://python.langchain.com/docs/how_to/MultiQueryRetriever/</a></span>
4.  <span id="cite_note-hyde-4">↑ <sup>[4,0](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-hyde_4-0)</sup> <sup>[4,1](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-hyde_4-1)</sup> Gao, L., Ma, X., Lin, J., Callan, J. (2023). *Precise Zero‑Shot Dense Retrieval without Relevance Labels*. ACL 2023. arXiv:2212.10496; ACL Anthology: 2023.acl‑long.99.</span>
5.  <span id="cite_note-weaviate-hybrid-5">↑ <sup>[5,0](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-weaviate-hybrid_5-0)</sup> <sup>[5,1](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-weaviate-hybrid_5-1)</sup> <sup>[5,2](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-weaviate-hybrid_5-2)</sup> <sup>[5,3](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-weaviate-hybrid_5-3)</sup> <sup>[5,4](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-weaviate-hybrid_5-4)</sup> Weaviate Docs. *Hybrid search (BM25+Vector)*. <a href="https://docs.weaviate.io/weaviate/concepts/search/hybrid-search" class="external free" rel="nofollow">https://docs.weaviate.io/weaviate/concepts/search/hybrid-search</a></span>
6.  <span id="cite_note-qdrant-hybrid-6">↑ <sup>[6,0](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-qdrant-hybrid_6-0)</sup> <sup>[6,1](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-qdrant-hybrid_6-1)</sup> <sup>[6,2](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-qdrant-hybrid_6-2)</sup> Qdrant Docs. *Hybrid Queries*. <a href="https://qdrant.tech/documentation/concepts/hybrid-queries/" class="external free" rel="nofollow">https://qdrant.tech/documentation/concepts/hybrid-queries/</a></span>
7.  <span id="cite_note-milvus-fulltext-7">↑ <sup>[7,0](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-milvus-fulltext_7-0)</sup> <sup>[7,1](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-milvus-fulltext_7-1)</sup> <sup>[7,2](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-milvus-fulltext_7-2)</sup> Milvus Docs. *Full‑Text Search* и *Hybrid Search*. <a href="https://milvus.io/docs/full-text-search.md" class="external free" rel="nofollow">https://milvus.io/docs/full-text-search.md</a>; <a href="https://milvus.io/docs/hybrid_search_with_milvus.md" class="external free" rel="nofollow">https://milvus.io/docs/hybrid_search_with_milvus.md</a></span>
8.  <span id="cite_note-nogueira2019-8">↑ <sup>[8,0](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-nogueira2019_8-0)</sup> <sup>[8,1](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-nogueira2019_8-1)</sup> <sup>[8,2](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-nogueira2019_8-2)</sup> <sup>[8,3](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-nogueira2019_8-3)</sup> <sup>[8,4](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-nogueira2019_8-4)</sup> Nogueira, R., Cho, K. (2019). *Passage Re‑ranking with BERT*. arXiv:1901.04085.</span>
9.  <span id="cite_note-cohere-rerank-9">↑ <sup>[9,0](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-cohere-rerank_9-0)</sup> <sup>[9,1](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-cohere-rerank_9-1)</sup> Cohere Docs. *Rerank — best practices*. <a href="https://docs.cohere.com/docs/reranking-best-practices" class="external free" rel="nofollow">https://docs.cohere.com/docs/reranking-best-practices</a></span>
10. <span id="cite_note-llama-router-10">↑ <sup>[10,0](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-llama-router_10-0)</sup> <sup>[10,1](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-llama-router_10-1)</sup> <sup>[10,2](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-llama-router_10-2)</sup> LlamaIndex Docs. *Routing (query routers/selectors)*. <a href="https://docs.llamaindex.ai/en/stable/module_guides/querying/router/" class="external free" rel="nofollow">https://docs.llamaindex.ai/en/stable/module_guides/querying/router/</a></span>
11. <span id="cite_note-react-11">↑ <sup>[11,0](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-react_11-0)</sup> <sup>[11,1](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-react_11-1)</sup> Yao, S., et al. (2023). *ReAct: Synergizing Reasoning and Acting in Language Models*. ICLR 2023. arXiv:2210.03629.</span>
12. <span id="cite_note-webgpt-12">↑ <sup>[12,0](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-webgpt_12-0)</sup> <sup>[12,1](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-webgpt_12-1)</sup> Nakano, R., et al. (2021). *WebGPT: Browser‑assisted question‑answering with human feedback*. arXiv:2112.09332.</span>
13. <span id="cite_note-graphrag-13">[↑](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-graphrag_13-0) Microsoft Research Blog. *GraphRAG: Unlocking LLM discovery on narrative private data*. 2024. <a href="https://www.microsoft.com/en-us/research/blog/graphrag-unlocking-llm-discovery-on-narrative-private-data/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/blog/graphrag-unlocking-llm-discovery-on-narrative-private-data/</a></span>
14. <span id="cite_note-graphrag-project-14">[↑](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-graphrag-project_14-0) Microsoft Research. *Project GraphRAG*. <a href="https://www.microsoft.com/en-us/research/project/graphrag/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/project/graphrag/</a></span>
15. <span id="cite_note-visrag-15">[↑](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-visrag_15-0) Yu, S., et al. (2024). *VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents*. arXiv:2410.10594; OpenReview: zG459X3Xge.</span>
16. <span id="cite_note-raptor-16">↑ <sup>[16,0](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-raptor_16-0)</sup> <sup>[16,1](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-raptor_16-1)</sup> Sarthi, P., et al. (2024). *RAPTOR: Recursive Abstractive Processing for Tree‑Organized Retrieval*. arXiv:2401.18059.</span>
17. <span id="cite_note-rcsplit-17">↑ <sup>[17,0](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-rcsplit_17-0)</sup> <sup>[17,1](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-rcsplit_17-1)</sup> LangChain Docs. *RecursiveCharacterTextSplitter*. <a href="https://python.langchain.com/docs/how_to/recursive_text_splitter/" class="external free" rel="nofollow">https://python.langchain.com/docs/how_to/recursive_text_splitter/</a></span>
18. <span id="cite_note-llama-hier-18">↑ <sup>[18,0](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-llama-hier_18-0)</sup> <sup>[18,1](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-llama-hier_18-1)</sup> LlamaIndex Docs. *HierarchicalNodeParser* и *Tree Summarization*. <a href="https://docs.llamaindex.ai/en/stable/api/llama_index.core.node_parser.HierarchicalNodeParser.html" class="external free" rel="nofollow">https://docs.llamaindex.ai/en/stable/api/llama_index.core.node_parser.HierarchicalNodeParser.html</a>; <a href="https://docs.llamaindex.ai/en/stable/examples/low_level/response_synthesis/" class="external free" rel="nofollow">https://docs.llamaindex.ai/en/stable/examples/low_level/response_synthesis/</a></span>
19. <span id="cite_note-ragas-19">[↑](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-ragas_19-0) Es, S., et al. (2024). *RAGAs: Automated Evaluation of Retrieval Augmented Generation*. EACL (Demo). <a href="https://aclanthology.org/2024.eacl-demo.16/" class="external free" rel="nofollow">https://aclanthology.org/2024.eacl-demo.16/</a></span>
20. <span id="cite_note-trulens-20">[↑](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-trulens_20-0) TruLens Docs. *RAG Triad*. <a href="https://www.trulens.org/getting_started/core_concepts/rag_triad/" class="external free" rel="nofollow">https://www.trulens.org/getting_started/core_concepts/rag_triad/</a></span>
21. <span id="cite_note-deepeval-21">[↑](https://systems-analysis.info/wiki/RAG-%D0%BF%D0%B0%D1%82%D1%82%D0%B5%D1%80%D0%BD%D1%8B#cite_ref-deepeval_21-0) DeepEval (GitHub). <a href="https://github.com/confident-ai/deepeval" class="external free" rel="nofollow">https://github.com/confident-ai/deepeval</a></span>
