Retrieval-augmented generation (RAG) (KO)

From Systems analysis Wiki
Jump to navigation Jump to search

Retrieval-Augmented Generation (RAG) (한국어: 검색 증강 생성) — 이는 인공지능 분야의 방법론으로, 생성형 언어 모델 (LLM)이 외부 정보 소스에 접근하여 응답의 정확도와 신뢰성을 향상시키는 방식이다. 즉, 모델이 응답을 생성하기 전에 관련 데이터를 검색(예: 문서 데이터베이스, 웹사이트 또는 DB에서)하고, 검색된 정보를 응답 생성에 활용한다[1][2]. 이러한 접근법은 최신 소스의 지식으로 '보강'하는 효과를 제공하며, 제한된 '메모리' 용량과 오래된 정보로 인한 LLM 자체의 한계를 극복하는 데 도움이 된다[3]. RAG 시스템은 생성된 응답 내에서 특정 문서를 참조(예: 각주 형태로)할 수 있어 투명성이 높아지고 사용자가 사실을 검증할 수 있다[1]. 그 결과 환각(hallucination) — 모델이 자신 있게 거짓 정보를 제공하는 경우 — 의 위험이 줄어든다[1][3]. RAG는 LLM의 지식 기반을 사실상 무한대로 확장하고, 재훈련 없이 최신 데이터를 활용할 수 있게 한다[4].

방법론의 기원과 발전

정보 검색과 자동 응답 생성을 결합하는 아이디어는 현대 LLM이 등장하기 훨씬 이전에 시작되었다. 1970년대에 이미 텍스트 데이터베이스에서 주어진 질문에 대한 답을 찾는 question-answering 시스템 구축 시도가 있었다[1]. 1990년대에는 자연어 검색을 대중화한 웹 서비스 Ask Jeeves가 등장했으며, 2011년에는 IBM Watson 시스템이 퀴즈쇼 Jeopardy!에서 인간 참가자를 이기며 AI의 가능성을 입증했다[1].

현대적 발전 단계는 신경망 기반 언어 모델의 도입과 관련이 있다. Retrieval-Augmented Generation이라는 독자적 접근법은 2020년 Facebook AI Research, 런던 유니버시티 칼리지 등의 Patrick Lewis 주도 연구팀에 의해 제안되었다[1]. NeurIPS 2020에서 채택된 이들의 논문은 RAG 모델을 기술하고 있는데, 이는 외부 '비파라메트릭' 지식 저장소에 미분 가능한 방식으로 접근하는 생성형 seq2seq 모델(예: BART)이다[5]. 저자들은 영어 위키피디아 전체를 외부 지식 기반으로 활용하여, 신경망 알고리즘인 Dense Passage Retrieval을 사용해 검색 가능한 벡터 인덱스(약 2,100만 개의 텍스트 단편)로 표현했다[5]. 입력 쿼리에 대해 RAG 모델은 인덱스에서 가장 적합한 단편을 추출하여 응답 생성 컨텍스트에 추가한다. 이 메커니즘은 Natural Questions, WebQuestions 등의 오픈 도메인 지식 기반 테스트에서 새로운 최고 성능(state-of-the-art)을 달성했다[2]. RAG 모델의 응답은 여러 소스의 정보를 합성한 덕분에 이전 생성형 접근법보다 더 구체적이고 사실적으로 정확했다[2]. 곧이어 Facebook은 RAG 소스 코드를 공개했으며, 모델은 HuggingFace Transformers 라이브러리와 관련 데이터셋에 통합되어 개발자들이 자신의 프로젝트에 쉽게 RAG를 적용할 수 있게 되었다[2]. 2020년 이후 RAG 방법론은 빠르게 인기를 얻었으며, 저자의 말에 따르면 다소 어색한 약어임에도 불구하고 이 접근법은 수백 편의 학술 논문을 낳고 수많은 상업 서비스의 기반이 되며 널리 확산되었다[1].

RAG의 작동 원리

Retrieval-Augmented Generation의 개념도: 검색 모듈(왼쪽)이 지식 기반에서 관련 문서를 추출하고, 생성형 모델(오른쪽)이 검색된 정보를 고려하여 사용자 쿼리에 대한 응답을 생성한다[6]. 이 접근법을 통해 LLM은 응답 생성 시 최신 외부 데이터에 의존할 수 있다. 다이어그램은 사용자 쿼리가 벡터로 변환되어 유사한 텍스트 단편 검색에 활용되고, 이후 모델의 컨텍스트에 연결되어 모델의 지식을 '확장'하고 응답의 정확도를 높이는 과정을 보여준다.

RAG 시스템은 일반적으로 두 가지 주요 구성 요소로 이루어진다: 검색 모듈(retriever)과 응답 생성 모듈(generator)[6]. 준비 단계에서 지식 기반의 벡터 인덱스가 구성된다: 모든 문서(텍스트)가 단편으로 분리되고 임베딩 모델에 의해 숫자 벡터로 변환되어, 이후 검색을 위한 특수 데이터베이스에 저장된다[6]. 사용자 쿼리가 입력되면 동일한 임베딩 모델이 쿼리를 벡터로 인코딩하고, 벡터 공간의 최근접 이웃 검색이 수행되어 지식 인덱스에서 가장 유사한 상위 K개의 단편이 선택된다(예: K = 5)[6]. 이 단편들은 쿼리 주제에 관한 관련 사실을 담은 외부 컨텍스트로 간주된다.

다음 단계에서 구성된 컨텍스트는 생성형 모델에 의해 활용된다. 원래 질문과 검색된 텍스트 단편들이 LLM(예: seq2seq 트랜스포머 또는 명령 지향 모델)의 입력으로 제공되어 최종 응답을 생성한다[2]. 언어 모델은 이렇게 자신의 학습된(파라메트릭) 지식뿐만 아니라 제공된 외부 데이터에도 조건부로 의존한다. RAG의 초기 구현에서 생성기 역할은 사전 훈련된 BART 모델이 담당했으며, 외부 '메모리'는 DPR 방식으로 인덱싱된 Wikipedia 컬렉션으로 표현되었다[5].

Fusion - 지식 통합 접근법

RAG의 중요한 특징은 모델이 검색된 여러 문서의 정보를 결합하는 방식이다. 단순히 모든 텍스트를 연결하는 것과 달리, RAG는 late fusion('결과의 후기 병합')이라는 접근법을 사용한다. 생성형 모델이 K개의 각 단편을 병렬로 처리하여 신뢰도 점수와 함께 가상의 응답을 생성하고, 이후 이 변형들을 최종 출력으로 통합한다[2]. 이 방법을 통해 RAG는 개별 소스 어디에도 질문에 대한 직접적이고 완전한 답이 없는 경우에도 응답을 합성할 수 있다. 예를 들어, 필요한 정보가 여러 기사에 분산되어 있을 때, 모델은 여러 문서의 '단서'를 하나의 응답으로 결합할 수 있다[2]. (활용 문서 수를 늘리면 일반적으로 응답의 완전성이 높아지지만, 텍스트 일관성이 약간 저하된다는 점이 언급되어 있다[7].)

구현 변형

2020년 원본 논문에서는 RAG 아키텍처의 두 가지 수정안이 제안되었다[6]. RAG-Sequence 모드에서 생성형 모델은 검색된 고정된 문서 집합을 받아 전체 응답을 한 번에 생성한다. 반면 RAG-Token 모드에서는 동적 업데이트가 허용된다: 각 토큰 생성 단계에서 모델이 응답 정확도를 높이기 위해 필요할 경우 재검색을 수행하고 추가 텍스트 단편을 불러올 수 있다. 두 접근법 모두 유사하게 높은 품질을 보인다. RAG-Sequence가 더 단순하고 빠르며, RAG-Token은 이론적으로 긴 응답에서 더 다양한 정보를 고려할 수 있다[6].

RAG의 장점

  • 최신성과 사실적 정확성. 외부 데이터를 연결함으로써 LLM은 모델 파라미터만이 아닌 실제 정보에 기반하여 더 정확하고 근거 있는 응답을 제공할 수 있다. 이는 모델 응답에서 오래되거나 단순히 지어낸 정보의 위험을 크게 줄인다[3][1]. 고정된 '지식 컷오프'를 가진 모델과 달리, RAG는 최신 데이터 소스에 대한 접근을 통해 모델 학습 완료 후에 발생한 사건이나 사실에 관한 질문에도 응답할 수 있다[4].
  • 투명성과 사용자 신뢰. RAG 시스템은 응답의 근거가 된 정보 소스(예: 기사, 보고서 또는 데이터베이스)에 대한 링크를 제공할 수 있다[1]. 본질적으로 모델은 각주가 달린 학술 논문처럼 응답을 구성하여 각 사실의 신뢰성을 검증할 수 있게 한다. 인용된 출처의 존재는 사용자의 신뢰를 높이고 정보의 검증을 용이하게 한다.
  • 특정 도메인에 대한 특화. Retrieval-augmentation은 언어 모델 자체를 변경하지 않고도 모델의 작동을 특정 지식 도메인에 비교적 쉽게 적용할 수 있게 한다. 이를 위해 LLM에 원하는 주제의 전문 지식 기반을 제공하면 된다. 의료 논문, 법률 문서 또는 회사의 기술 매뉴얼이든 상관없다. 파라미터상으로 범용적인 모델이 선별된 데이터셋에서 사실을 끌어오므로 해당 분야의 전문가 역할을 하게 된다[4][8]. 예를 들어, RAG 기반 법률 보조 시스템은 검색 범위를 특정 관할권의 법령 집합(특정 국가의 법률)으로 제한하여 응답이 해당 법률에 부합하도록 보장할 수 있다[8].
  • 유연성과 지식 업데이트 가능성. 전통적인 모델에서 새로운 지식을 추가하거나 잘못된 사실을 수정하려면 확장된 데이터셋으로 재학습(fine-tuning)을 수행해야 했으며, 이는 시간과 리소스 면에서 비용이 많이 든다. RAG는 이 문제를 해결한다: 지식을 업데이트하려면 외부 데이터베이스를 업데이트하거나 추가 소스를 연결하면 되고, 모델은 즉시 새 정보를 활용하기 시작한다[2]. 이를 통해 시스템의 최신성을 쉽게 유지할 수 있다. 실질적으로 모델 작동 중단 없이 데이터를 실시간으로 '핫' 교체할 수도 있다[1].
  • 효율성과 리소스 절약. RAG 접근법은 모든 정보를 파라미터에 담으려는 초대형 모델 훈련보다 종종 더 실용적이다. 검색을 통합함으로써, 신경망 자체에 모든 사실을 기억시키려 하지 않고도 중간 규모의 모델로 유사한 결과를 달성할 수 있다[6]. 또한 RAG 파이프라인 구현은 비교적 간단하다: 기존 도구(Framework, 라이브러리)가 있으며, 개발자들은 몇 줄의 코드로 기본 RAG 프로토타입을 구축할 수 있음을 보여준다[1]. 따라서 RAG는 AI 도입의 총 비용을 줄인다: 각 작업에 맞는 새 모델을 훈련하는 대신 검색 메커니즘을 설정하고 적절한 데이터를 제공하면 된다.

RAG의 문제점과 한계

명백한 장점에도 불구하고, Retrieval-Augmented Generation은 검색 구성 요소와 언어 모델 자체 모두로부터 한계를 상속받는다[9]. 아래에 RAG 시스템에 내재된 주요 문제점들이 나열되어 있다:

  • 검색 품질에 대한 의존성. 얻어진 응답은 추출된 데이터가 관련성 있고 신뢰할 수 있는 정도에 따라 정확하다. 검색 모듈이 질문과 관련 없거나 오류를 포함한 문서를 반환하면, 생성형 모델은 이 사실들을 '수정'할 수 없으며 그에 기반한 응답을 생성한다[8]. 따라서 외부 지식 기반의 품질과 최신성이 RAG의 정확도를 직접적으로 결정한다. 문서 검색이 관련성을 유지하도록 인덱스를 정기적으로 업데이트하고 순위 알고리즘을 조정해야 한다.
  • 높은 복잡성과 리소스 집약성. RAG 시스템이 작동하려면 LLM 자체뿐만 아니라 검색을 위한 인프라도 필요하다: 대규모 데이터베이스의 저장 및 업데이트, 인덱싱, 쿼리 실행 시간. 이 모든 것이 계산 비용을 증가시키고 언어 모델만 사용할 때보다 응답 속도를 낮출 수 있다[8]. 최악의 경우, 검색 단계의 지연이나 매우 많은 양의 데이터 처리가 시스템을 느리게 할 수 있다. 실제로 응답 품질과 성능 사이에서 균형을 맞춰야 한다. 예를 들어 응답 시간을 정상 범위 내로 유지하기 위해 지식 기반 크기나 검색 깊이를 제한하는 방식으로 파이프라인을 최적화해야 한다.
  • 데이터 요구사항과 유지관리. RAG가 효과적으로 작동하려면 품질 높고, 구조화되고, 접근 가능한 외부 데이터가 필요하다. 외부 지식 기반이 체계적으로 구성되어 있지 않거나 노이즈를 포함하면 검색 모델이 유용한 정보를 찾는 데 어려움을 겪을 수 있다[8]. 또한 필요한 데이터가 항상 공개되거나 저렴한 것도 아니다: 기업들은 자체 knowledge base를 구축하고 유지해야 한다. 이는 추가 비용을 발생시키고 데이터를 최신 상태로 유지하는 노력을 요구한다(예: 새 문서 추가, 오래된 정보 정리). RAG의 약점은 지식 기반을 최신 상태로 유지하는 데 대한 의존성이다.
  • 일부 LLM 오류의 불가피성. RAG가 환각을 크게 줄이지만 잘못된 응답을 완전히 제거하는 것이 항상 가능한 것은 아니다[9]. 생성형 모델은 여전히 논리적 오류를 범하거나 정보를 부적절하게 일반화할 수 있으며, 특히 제공된 컨텍스트가 불충분하거나 모순될 경우 그렇다[9]. 실질적으로 RAG는 오류의 성격을 변환한다: 노골적으로 지어낸 사실('환각') 대신 지식 통합 오류가 더 자주 나타난다. 예를 들어 모델이 중요한 단편을 놓치거나 서로 다른 소스들을 부적절하게 연결할 수 있다. 따라서 의료, 법률 등 책임이 큰 응용 분야에서는 여전히 시스템 응답의 검증과 수정을 위한 인간의 참여가 필요하다.

RAG의 적용 분야

Retrieval-Augmented Generation 방법론은 지식 추출 및 활용과 관련된 수많은 시나리오에서 적용 사례를 찾았다. 아래에 RAG가 가장 큰 이점을 보이는 주요 영역이 나열되어 있다:

  • 질문-응답 시스템챗봇. RAG는 높은 정확도로 사용자 질문에 답하고 출처 링크를 제공할 수 있는 가상 어시스턴트와 챗봇을 만들 수 있게 한다. 고객 지원 분야에서 이러한 봇은 회사의 내부 지식 기반(FAQ, 참조 기사)에 접근하여 고객 요청에 즉각적인 답변을 제공함으로써 직원의 부담을 줄인다[8]. 전통적인 FAQ 시스템과 달리, RAG 봇은 자연스러운 언어로 응답을 구성하면서도 사용자의 문제에 특화된 최신 데이터로 이를 '뒷받침'한다.
  • 의료헬스케어. 전문 의료 데이터베이스(과학 논문, 임상 프로토콜, 참고 문헌)로 보강된 생성형 모델은 의사나 환자의 지능형 보조 도구로 활용될 수 있다. 예를 들어, 시스템은 희귀 진단에 관한 질문에 의료 문헌에서 최신 연구를 찾아 답변할 수 있다[8]. 의료 분야에서 RAG의 중요한 장점은 의사의 신뢰에 필수적인 일차 자료(예: 임상 시험 결과)를 참조할 수 있다는 것이다. 이러한 시스템은 의사 결정 지원, 증상 확인, 의대생 교육 등에 활용되어 최신 의학 지식에 대한 접근을 제공한다.
  • 법률금융. 법률 실무와 금융 분석에서는 정보의 정확성과 검증 가능성이 특히 중요하다. RAG 시스템은 전문가들이 필요한 데이터를 빠르게 찾는 데 도움을 줄 수 있다: 예를 들어, 변호사는 모델을 통해 현재 사건과 관련된 판례 또는 법률 조항을 찾아 인용하고, 금융 분석가는 최신 경제 보고서나 시장 뉴스에서 발췌문을 신속하게 얻을 수 있다[8]. 이때 모델의 각 응답에는 특정 문서(규범적 행위, 보고서, 기사)에 대한 링크가 포함될 수 있어 산업 표준에 부합하고 전문가의 후속 수작업을 용이하게 한다.
  • 과학 연구콘텐츠 제작. 기자, 연구자, 작가들은 RAG를 활용하여 자료 준비 시 사실과 출처 검색을 가속화할 수 있다. 예를 들어, 모델은 여러 신뢰할 수 있는 출판물에서 정보를 '수집'하여 팩트체킹과 인용 선별에 드는 시간을 크게 줄일 수 있다[8]. RAG 기반 연구 보조 도구는 관련 논문 링크, 공개 데이터베이스의 데이터(예: 국제 보고서의 통계), 심지어 초벌 번역까지 자동으로 추출하여 저자들이 분석 업무에 집중할 수 있게 한다. 이러한 도구들은 언론, 학계, 문헌 리뷰 준비 등에서 활용되고 있다.
  • 기업 지식문서 검색. 많은 조직에서 귀중한 정보의 상당 부분이 텍스트 문서 형태로 저장된다: 규정, 매뉴얼, 보고서, 서신, 로그 파일. RAG는 언어를 통해 이러한 비정형 데이터를 대화형으로 검색하는 방법을 제공한다. 직원이 질문('원격 직원의 휴가 정책에 대해 뭐라고 나와 있나요?')을 하면, 모델이 내부 문서의 해당 섹션을 찾아 인용하고 요약 응답을 구성한다[1]. 이는 업무 효율성을 높인다: 신입 직원이 더 빠르게 질문에 대한 답을 찾고, 지원 부서는 인시던트 데이터베이스를 빠르게 검색하는 도구를 얻으며, 경영진은 축적된 텍스트 데이터를 분석하는 방법을 갖게 된다. 대형 IT 기업들은 이미 기업용 솔루션에 RAG 접근법을 도입하고 있다: Microsoft, Google, IBM, AWS 등의 기술이 LLM과 조직 데이터 검색을 통합하고 있다[1].

전망과 향후 연구

Retrieval-Augmented Generation 방법론은 활발히 발전하고 있으며, 향후 몇 년간 그 기능이 더욱 확장될 것으로 예상된다. 한 가지 방향은 멀티모달 RAG로, 여기서 외부 정보는 텍스트뿐만 아니라 이미지, 오디오/비디오 또는 센서 데이터까지 포함할 수 있다. 실험들은 언어 모델과 시각적 데이터베이스 검색의 결합 가능성을 보여주며, 이를 통해 설명과 관련 텍스트에 기반하여 이미지나 비디오 내용에 관한 질문에 답할 수 있게 된다[2]. 또 다른 중요한 방향은 여러 지식 소스의 동시 활용이다: 미래의 RAG 시스템은 다양한 데이터베이스(예: Wikipedia, 전문 백과사전, 사용자 개인 메모)의 데이터를 결합하여 이 모든 이질적인 정보를 고려한 응답을 합성할 수 있을 것이다[2].

연구자들은 또한 RAG의 신뢰성과 안전성을 높이는 과제에 직면해 있다. 외부 데이터에 포함될 수 있는 편견과 오류의 전파 위험을 최소화하고 응답의 일관성을 보장해야 한다. 원본 RAG 개발팀은 이미 이 방향으로 조치를 취했다. 예를 들어, 초기 지식 기반을 상대적으로 검증되고 중립적인 소스인 Wikipedia 기사만으로 제한했다[2]. 향후에는 모델이 확실히 품질 높은 컨텍스트를 받을 수 있도록 특수 필터와 문서 선별 방법이 개발될 예정이다. 또한 연구는 검색 메커니즘 자체의 개선에 집중되고 있다: 복잡하거나 모호한 표현의 쿼리에 대해서도 더 정확하게 이해하고 관련 정보를 찾을 수 있는 새로운 랭킹시맨틱 인덱싱 알고리즘이 개발되고 있다.

마지막으로, RAG와 언어 모델 훈련 과정의 더 깊은 통합이 관심을 받고 있다. 이미 검색 메커니즘이 추론 단계뿐만 아니라 LLM의 사전 훈련이나 fine-tuning 시에도 활용되는 접근법들이 등장하고 있다[10]. 이는 모델의 사실성을 더욱 높이고 정적으로 가중치에 기록된 지식에 대한 의존도를 줄일 수 있다. 2024년에 발표된 리뷰에 따르면, 연구 커뮤니티는 RAG 생태계 발전에 큰 가능성을 보고 있다: 인프라 최적화(검색 가속화, 메모리 비용 절감)부터 RAG 시스템 품질 평가를 위한 표준 benchmark 개발까지[3]. 이 모든 것은 생성형 모델을 지속적으로 업데이트되는 외부 지식을 다룰 때 더 정확하고, 다재다능하며, 안전하게 만들기 위한 것으로, 이는 차세대 신뢰할 수 있는 인공지능으로 나아가는 핵심 단계이다.

참조

  • Retrieval-Augmented Generation (RAG)이란 무엇인가 — NVIDIA 블로그
  • Retrieval-Augmented Generation for Large Language Models: A Survey — arXiv 학술 리뷰
  • Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks — RAG 원본 논문
  • RAG란? 적용, 한계 및 과제 — Bright Data 블로그

문헌

  • Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401.
  • Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open-Domain Question Answering. arXiv:2004.04906.
  • Guu, K. et al. (2020). REALM: Retrieval-Augmented Language Model Pre-Training. arXiv:2002.08909.
  • Qu, Y. et al. (2020). RocketQA: An Optimized Training Approach to Dense Passage Retrieval for Open-Domain Question Answering. arXiv:2010.08191.
  • Izacard, G.; Grave, E. (2021). Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering. arXiv:2007.01282.
  • Borgeaud, S. et al. (2022). Improving Language Models by Retrieving from Trillions of Tokens. arXiv:2112.04426.
  • Wei, J. et al. (2022). Chain of Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Wang, X. et al. (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171.
  • Kojima, T. et al. (2022). Large Language Models are Zero-Shot Reasoners. arXiv:2205.11916.
  • Yao, S. et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629.
  • Mialon, G. et al. (2023). Retrieval-Augmented Generation for Large Language Models: A Survey. arXiv:2312.10997.
  • Madaan, A. et al. (2023). Self-Refine: Iterative Refinement with Self-Feedback. arXiv:2303.17651.
  • Yang, Z. et al. (2023). Re-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning. arXiv:2302.04858.
  • Barnett, S. et al. (2024). Seven Failure Points When Engineering a Retrieval Augmented Generation System. arXiv:2401.05856.
  • Wang, Y. et al. (2024). Self-Instruct: Aligning Language Models with Self-Generated Instructions. arXiv:2212.10560.
  • Han, H. et al. (2025). Retrieval-Augmented Generation with Graphs (GraphRAG). arXiv:2501.00309.

각주

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 «What Is Retrieval-Augmented Generation aka RAG». NVIDIA Blogs. [1]
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 «Facebook open-sources RAG, an AI model that retrieves documents to answer questions». VentureBeat. [2]
  3. 3.0 3.1 3.2 3.3 Mialon, Grégoire et al. «Retrieval-Augmented Generation for Large Language Models: A Survey». arXiv. [3]
  4. 4.0 4.1 4.2 «Applied AI Software Engineering: RAG». Pragmatic Engineer. [4]
  5. 5.0 5.1 5.2 Lewis, Patrick et al. «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks». arXiv. [5]
  6. 6.0 6.1 6.2 6.3 6.4 6.5 6.6 «How RAG Makes LLMs Smarter». Exxact Blog. [6]
  7. «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks». arXiv. [7]
  8. 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 «What Is RAG? Use Cases, Limitations, and Challenges». Bright Data Blog. [8]
  9. 9.0 9.1 9.2 Lewis, Patrick et al. «Seven Failure Points When Engineering a Retrieval Augmented Generation System». arXiv. [9]
  10. «Генерация, дополненная поиском». Википедия. [10]