Tree of Thoughts (ToT) (KO)
Tree of Thoughts (ToT) (생각의 나무) — 대형 언어 모델(LLM)의 추론을 관리하기 위한 혁신적인 프레임워크로, 여러 추론 경로를 체계적으로 탐색함으로써 LLM이 의식적인 문제 해결을 수행할 수 있게 해준다. 이 개념은 2023년 프린스턴 대학교와 Google DeepMind 연구자들에 의해 제안되었다[1].
ToT는 널리 알려진 Chain of Thought(CoT) 기법의 확장이자 일반화이다. CoT에서 추론이 단일한 선형 단계 시퀀스로 표현되는 것과 달리, ToT는 사고 과정을 트리 형태로 구성한다. 각 노드는 중간 상태(「생각」)이며, 가지는 추론의 가능한 전개 경로를 나타낸다. 이를 통해 모델은 여러 옵션을 병렬로 탐색하고, 그 유망성을 평가하며, 막다른 길(backtracking)을 발견했을 때 이전 단계로 되돌아가 의식적인 선택을 내릴 수 있다[1][2].
작동 원리
ToT 프레임워크는 문제 해결 과정을 상태 트리 탐색으로 구성한다. 네 가지 핵심 구성 요소의 순환적 상호작용을 기반으로 동작한다[1]:
1. 문제의 「생각」으로의 분해: 원래 문제를 「생각」이라고 불리는 더 작은 하위 단계로 분해한다. CoT에서 「생각」이 단순히 다음 토큰인 것과 달리, ToT에서 「생각」은 의미론적으로 유의미한 단위(예: 수학 문제의 방정식 또는 글 계획의 단락)로서 해결에 가까워지게 하는 역할을 한다.
2. 생각 생성: 각 단계에서 현재 상태(트리 노드)에 대해 모델이 여러 개의 잠재적인 다음 「생각」(가지)을 생성한다. 이를 위해 두 가지 전략이 사용된다:
- 샘플링(sample): 모델이 여러 개의 후속 옵션을 독립적으로 생성한다. 다양한 아이디어가 유용한 창의적 과제에 적합하다.
- 제안(propose): 모델이 순차적으로 옵션을 생성하며, 해결 공간이 제한된 과제에 더 효율적이다.
3. 상태 평가: 생성된 「생각」들은 LLM 자체에 의해 유망성이 평가된다. 평가는 수치(예: 0~1 척도) 또는 범주(「확실」, 「가능」, 「불가능」)로 이루어질 수 있다. 이는 탐색을 유망한 가지 방향으로 안내하는 휴리스틱 함수이다.
4. 탐색 알고리즘: 생각 트리를 체계적으로 탐색하기 위해 고전적인 탐색 알고리즘이 사용된다:
- 너비 우선 탐색(BFS): 다음 레벨로 넘어가기 전에 한 레벨의 모든 노드를 탐색한다. 최단 경로 발견을 보장하지만 더 많은 메모리를 필요로 한다.
- 깊이 우선 탐색(DFS): 다른 가지로 돌아가기 전에 한 가지의 끝까지 탐색한다. 메모리 효율이 높으며, 탐색 공간이 깊지만 넓지 않은 과제에 적합하다.
이 프레임워크는 직관적인 아이디어 생성(LLM 활용)과 의식적이고 체계적인 계획 및 옵션 탐색을 결합하여 문제 해결 시 인간의 사고를 모방한다[2].
다른 추론 방법과의 비교
ToT와 Chain of Thought (CoT)의 비교
ToT는 CoT의 직접적인 일반화이다. CoT를 가지 폭이 1인 트리로 볼 수 있다면, ToT는 임의의 폭을 가진 트리를 탐색할 수 있다. 이는 핵심적인 장점을 제공한다[3]:
- 대안 탐색: ToT는 여러 해결 경로를 고려할 수 있는 반면, CoT는 하나의 선형 경로로 제한된다.
- 되돌아가기(backtracking) 가능성: ToT는 추론의 가지가 막다른 길에 다다랐을 때 모델이 「뒤로 돌아갈」 수 있게 하며, 이는 CoT에서는 불가능하다.
- 전체적 계획: ToT는 여러 미래 단계의 평가를 기반으로 전략적 선택을 내릴 수 있다.
ToT와 Self-Consistency의 비교
Self-Consistency는 여러 개의 독립적인 「생각의 사슬」을 생성하고 투표를 통해 가장 빈번한 답을 선택한다. 이 방법은 CoT의 신뢰성을 향상시키지만, CoT와 마찬가지로 해결의 분기 구조를 탐색할 수 없다. 반면 ToT는 독립적인 시도뿐만 아니라 그들 간의 상호 관계도 중요한 복잡한 계획 과제에서 더 실질적인 향상을 보여줄 수 있다[1].
실험 결과
ToT의 저자들은 비자명한 계획이나 탐색이 필요한 세 가지 과제에서 그 효과를 입증하였다.
- Game of 24: 주어진 네 개의 숫자로 기본 산술 연산을 사용하여 24를 만드는 수학 퍼즐. GPT-4를 사용한 표준 프롬프팅은 성공률 7.3%, Chain of Thought는 4%를 기록했다. 너비 우선 탐색(b=5)을 사용한 ToT는 74%의 성공률을 달성하여 CoT보다 18.5배 우수한 성능을 보였다[1][4].
- 창의적 글쓰기: 지정된 마지막 문장으로 구성된 네 단락의 일관된 텍스트를 생성하는 과제에서, ToT로 생성된 텍스트는 10점 만점에 평균 일관성 점수 7.56을 받은 반면, CoT는 6.15를 받았다. 100번의 비교 중 41회에서 사람들이 ToT가 생성한 텍스트를 선호했으며, CoT는 21회였다[5].
- 미니 크로스워드(5x5): ToT는 단어의 60%를 올바르게 채운 반면, CoT는 불과 1%에 그쳤다[6].
한계와 미래 방향
인상적인 결과에도 불구하고, ToT 프레임워크에는 몇 가지 한계가 있다:
- 계산 복잡성: ToT는 여러 「생각」을 생성하고 평가해야 하기 때문에, 표준 방법보다 훨씬 많은 계산 자원(토큰 5~100배)을 필요로 한다[1].
- 구현의 복잡성: ToT 도입은 생각 생성기, 상태 평가기, 탐색 알고리즘 등 모든 구성 요소를 구축하고 조정하는 데 상당한 엔지니어링 노력이 필요하다.
- 평가 품질 의존성: 프레임워크 전체의 효율성은 LLM이 중간 상태를 적절히 평가할 수 있는 능력에 크게 의존하며, 이는 항상 보장되지 않는다.
미래 연구는 효율성 향상, 최적화 자동화, 그리고 더 스마트하고 자율적인 에이전트를 만들기 위해 강화 학습과 같은 다른 방법들과 ToT를 통합하는 데 초점을 맞추고 있다.
참고 링크
- GitHub의 Tree of Thoughts 공식 저장소.
- Tree of Thoughts (ToT) — Prompt Engineering Guide의 가이드.
참고 문헌
- Yao, S. et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arXiv:2305.10601.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Wang, X. et al. (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171.
- Kojima, T. et al. (2022). Large Language Models are Zero-Shot Reasoners. arXiv:2205.11916.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Lyu, Q. et al. (2023). Faithful Chain-of-Thought Reasoning. arXiv:2301.13379.
- Ling, Z. et al. (2023). Deductive Verification of Chain of Thought Reasoning. arXiv:2306.03872.
- Yao, S. et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629.
- Besta, M. et al. (2023). Graph of Thoughts: Solving Elaborate Problems with Large Language Models. arXiv:2308.09687.
- Lightman, H. et al. (2023). Let's Verify Step by Step. arXiv:2305.20050.
- Lanham, T. et al. (2023). Measuring Faithfulness in Chain-of-Thought Reasoning. arXiv:2307.13702.
- Yang, B. et al. (2025). Hallucination Detection in Large Language Models with Metamorphic Relations. arXiv:2502.15844.
주석
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Yao, S., Yu, D., Zhao, J., et al. (2023). «Tree of Thoughts: Deliberate Problem Solving with Large Language Models». arXiv. [1]
- ↑ 2.0 2.1 «What is Tree of Thoughts Prompting?». IBM. [2]
- ↑ «Tree of Thoughts vs Chain of Thought». Substack.
- ↑ «...18.5 times improvement...». arXiv.
- ↑ «...41 out of 100 comparisons...». OpenReview.
- ↑ «...CoT: 1% success rate...». arXiv.