LLM error mitigation — LLM 오류 감소 방법 및 실천
대형 언어 모델(LLM)의 오류 감소란 트랜스포머 아키텍처 기반 인공지능 시스템의 정확성, 신뢰성 및 안전성을 향상시키기 위한 방법과 기술의 총체를 말한다. 오류 문제, 특히 환각(hallucination) 문제는 LLM을 중요한 분야에 폭넓게 도입하는 데 있어 핵심적인 장벽 중 하나이다. 2024–2025년 연구에 따르면, 공개적으로 사용 가능한 LLM의 환각 발생 빈도는 3%에서 16% 사이인 것으로 나타났다[1].
오류 유형 분류
현대적인 LLM 오류 분류 체계는 여러 주요 범주를 포함하며, 각 범주마다 완화(mitigation)를 위한 특정 접근 방식이 필요하다.
환각(Hallucination)
환각은 그럴듯하지만 사실적으로 잘못된 콘텐츠를 생성하는 현상을 말한다. 황(Huang) 등(2023)의 연구에 따르면 두 가지 주요 유형이 구별된다[2]:
- 사실적 환각 — 검증 가능한 사실과의 불일치로, 존재하지 않는 사실을 만들어 내는 것(조작)을 포함한다. 2024년 연구에서 스탠퍼드 대학교는 LLM이 존재하지 않는 판례 120건 이상을 날조했음을 발견했다[3].
- 논리적 환각 — 추론 과정에서 논리적 순서가 무너지는 현상.
2024년 통계에 따르면, 챗봇은 27%의 경우에 환각을 일으키며, 생성된 텍스트의 46%에는 사실적 오류가 포함되어 있다[3].
체계적 편향(Bias)
LLM의 편향은 사회적 선입견(예: 특정 직업을 특정 성별과 연결 짓는 것)과 성능에 있어서의 인구통계학적 차이로 나타난다. 2024년 연구에 따르면 10개의 테스트된 모델 중에서 서로 다른 인구통계학적 집단에 대한 평가 점수의 차이가 10점 만점에 최대 4점에 달할 수 있는 것으로 나타났다.
독성(Toxicity)
독성은 모욕적이거나 해롭거나 차별적인 콘텐츠를 생성하는 것으로 정의된다. 독성 지표는 모델과 사용 맥락에 따라 넓은 범위에서 다양하게 나타난다.
오류 감소 방법
오류에 대응하는 전략은 크게 두 가지 그룹으로 나눌 수 있다: 모델과 학습 과정을 수정하는 방법, 그리고 추론(inference) 단계에서 적용되는 방법이다.
모델 및 학습 과정 수정
Fine-tuning 및 Instruction Tuning
Supervised Fine-Tuning (SFT)은 사전 학습된 모델을 특정 작업에 적응시킬 수 있게 한다. 계산 비용을 줄이기 위해 LoRA 및 QLoRA와 같은 Parameter-Efficient Fine-Tuning (PEFT) 방법이 사용되며, 이를 통해 효율성을 유지하면서 추가 학습 비용을 최대 99%까지 절감할 수 있다.
인간 피드백 기반 강화 학습(RLHF)
RLHF는 두 단계로 이루어진 프로세스로, 먼저 인간의 선호도를 바탕으로 보상 모델을 학습시키고, 이후 기본 LLM이 해당 보상을 최대화하는 응답을 생성하도록 최적화된다. 이 방법은 InstructGPT 및 GPT-4 모델에서 효과가 입증되었으며, 사용자 기대에 대한 부합도를 크게 향상시켰다[4].
Constitutional AI
Anthropic이 개발한 Constitutional AI 방법은 RLHF의 대안이다. 인간으로부터의 직접적인 피드백 대신, 모델이 일련의 원칙('헌법')을 따르도록 학습된다. 이를 통해 인간 감독의 필요성을 80~90% 줄이고 유해 콘텐츠 생성을 효과적으로 방지한다[5].
아키텍처적 해결책
- Mixture of Experts (MoE): 계산 비용의 비례적 증가 없이 모델 용량을 크게 늘릴 수 있는 희소 활성화 아키텍처. GPT-4는 각각 2,200억 개의 파라미터를 가진 8명의 전문가를 사용하는 것으로 추정된다.
- 어텐션 메커니즘 수정: Grouped Query Attention (GQA) (Llama 3 모델에서 사용)와 Sparse Attention 같은 기법은 계산 복잡성과 메모리 요구량을 줄여 더 긴 컨텍스트를 처리할 수 있게 한다.
추론(인퍼런스) 단계의 방법
Retrieval-Augmented Generation (RAG)
RAG는 사실적 오류를 줄이는 가장 효과적인 방법 중 하나이다. 응답을 생성하기 전에 시스템이 외부 지식 베이스(예: 위키피디아, 기업 문서, 학술 논문)에 접근하여 관련 정보를 추출하고 원래 쿼리와 함께 모델에 전달한다. 이를 통해 응답이 검증된 사실에 '기반'을 두게 된다. RAG 시스템은 TriviaQA benchmark에서 56.8%의 exact match를 달성하며, 사실적 오류 감소에 있어 기존 모델보다 60~80% 뛰어난 성능을 보인다.
고급 프롬프팅(prompting) 기법
- Chain-of-Thought (CoT): 모델이 최종 답변을 내놓기 전에 단계별 추론 체인을 생성하도록 유도하는 프롬프팅 기법. 논리적·수학적 계산이 필요한 작업에서 결과를 크게 향상시킨다.
- Chain of Draft (CoD): CoT의 발전된 형태로, 모델이 자신의 답변 초안을 반복적으로 수정하여 훨씬 적은 수의 token을 사용하면서도 CoT와 비견되는 정확도를 달성한다.
내재적 자기 교정(Intrinsic Self-Correction)
2024년 TACL 연구에 따르면 외부 정보 없이 LLM이 스스로 교정하는 능력은 제한적이다. 효과적인 자기 교정은 일반적으로 계산 검증을 위한 코드 인터프리터나 사실 검증을 위한 검색 엔진과 같은 외부 도구의 사용을 필요로 한다[6].
오류 평가 방법
오류 감소의 진전을 측정하기 위해 특화된 지표와 benchmark가 사용된다.
- 전통적인 지표: Perplexity, BLEU, ROUGE. 이 지표들은 유창성과 n-그램 일치도 평가에는 유용하지만 사실적 정확성 평가에는 취약하다.
- 현대적 접근법:
- FactScore는 긴 텍스트를 원자적 사실로 분해하고 지식 베이스에 의해 뒷받침되는 사실의 비율을 평가한다.
- SAFE (Search-Augmented Factuality Evaluator)는 Google의 방법으로, 검색을 활용하여 사실을 확인하며 인간 평가와 72%의 일치율을 달성하고 비용은 20배 저렴하다.
- TruthfulQA는 모델이 널리 퍼진 오해를 생성하는 것을 피하는 능력에 초점을 맞춘 benchmark이다.
참고 문헌
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions. arXiv:2311.05232.
- Min, S. et al. (2023). FActScore: Fine-Grained Atomic Evaluation of Factual Precision in Long-Form Text Generation. arXiv:2305.14251.
- Wei, J. et al. (2024). Long-Form Factuality in Large Language Models (SAFE). arXiv:2403.18802.
- Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401.
- Hu, E. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Madaan, A. et al. (2023). Self-Refine: Iterative Refinement with Self-Feedback. arXiv:2303.17651.
- Wang, X. et al. (2022). Self-Consistency Improves Chain-of-Thought Reasoning in Language Models. arXiv:2203.11171.
- Anthropic (2024). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Maslej, N. et al. (2024). Artificial Intelligence Index Report 2024. arXiv:2405.19522.
각주
- ↑ «Hallucination Leaderboard». Vectara. (2024-2025). Проверено 4 июля 2025.
- ↑ Huang, L., et al. (2023). «A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions». arXiv:2311.05232.
- ↑ 3.0 3.1 Stanford Human-Centered AI (2024). «AI Index Report 2024».
- ↑ OpenAI (2024). «Learning to Reason with LLMs». Technical Blog.
- ↑ Anthropic (2024). «Constitutional AI: Harmlessness from AI Feedback». Research Paper.
- ↑ «When Can LLMs Actually Correct Their Own Mistakes?». Transactions of the Association for Computational Linguistics. (2024).