Tree of Thoughts (ToT) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Tree of Thoughts (ToT) (Puno ng mga Kaisipan) — ito ay isang makabagong framework para sa pamamahala ng pangangatwiran ng malalaking modelo ng wika (LLM), na nagbibigay-daan sa kanila na magsagawa ng malay na paglutas ng mga gawain sa pamamagitan ng sistematikong pagsisiyasat ng maraming landas ng pangangatwiran. Ang konsepto ay ipinakita noong 2023 ng mga mananaliksik mula sa Princeton University at Google DeepMind[1].

Ang ToT ay isang pagpapalawak at pagbubuo ng sikat na teknik na "chain of thought" (Chain of Thought, CoT). Hindi tulad ng CoT, kung saan ang pangangatwiran ay isang solong linear na pagkakasunud-sunod ng mga hakbang, inaayos ng ToT ang proseso ng pag-iisip sa anyo ng isang puno, kung saan ang bawat node ay isang intermediate na estado ("kaisipan"), at ang mga sanga ay mga posibleng landas ng pag-unlad ng pangangatwiran. Nagbibigay-daan ito sa modelo na sabay-sabay na suriin ang ilang mga pagpipilian, suriin ang kanilang pananaw, bumalik sa mga nakaraang hakbang kapag natuklasan ang mga dead end (backtracking) at gumawa ng malay na pagpili[1][2].

Prinsipyo ng Pagtatrabaho

Inaayos ng framework ng ToT ang proseso ng paglutas ng gawain bilang isang paghahanap sa puno ng mga estado. Ang pagtatrabaho nito ay batay sa siklikal na pakikipag-ugnayan ng apat na pangunahing bahagi[1]:

1. Decomposition ng gawain sa mga "kaisipan": Ang orihinal na problema ay nahahati sa mas maliliit na mga sub-gawain-hakbang, na tinatawag na "mga kaisipan". Hindi tulad ng CoT, kung saan ang "kaisipan" ay simpleng susunod na token, sa ToT ang "kaisipan" ay isang semantikong makabuluhang yunit (halimbawa, isang equation sa isang matematikong gawain o isang talata sa isang plano ng teksto), na naglalapitan sa solusyon.

2. Pagbuo ng mga kaisipan: Sa bawat hakbang, para sa kasalukuyang estado (node ng puno) ay bumubuo ang modelo ng ilang potensyal na susunod na "mga kaisipan" (mga sanga). Para dito, ginagamit ang dalawang estratehiya:

  • Sampling (sample): Ang modelo ay independiyenteng bumubuo ng ilang mga variant ng pagpapatuloy. Angkop para sa mga malikhaing gawain, kung saan kapaki-pakinabang ang malawak na hanay ng mga ideya.
  • Pagmumungkahi (propose): Ang modelo ay sunud-sunod na bumubuo ng mga variant, na mas epektibo para sa mga gawain na may limitadong espasyo ng mga solusyon.

3. Pagtatasa ng mga estado: Ang mga nabuong "kaisipan" ay sinusuri ng mismong LLM upang matukoy ang kanilang pananaw. Ang pagtatasa ay maaaring maging numerikal (halimbawa, sa sukat mula 0 hanggang 1) o kategorikal ("tiyak", "posible", "imposible"). Ito ay isang heuristic na function na nagdidirekta ng paghahanap patungo sa mga promising na sanga.

4. Algorithm ng paghahanap: Para sa sistematikong pagsisiyasat ng puno ng mga kaisipan, ginagamit ang mga klasikong algorithm ng paghahanap:

  • Paghahanap sa lapad (BFS): Sinisiyasat ang lahat ng node sa isang antas bago lumipat sa susunod. Ginagarantiyahan ang paghahanap ng pinakamaikling landas, ngunit nangangailangan ng mas maraming memorya.
  • Paghahanap sa lalim (DFS): Sinisiyasat ang isang sanga hanggang sa katapusan bago bumalik at subukan ang isa pa. Mas matipid sa memorya at angkop para sa mga gawain na may malalim ngunit hindi masyadong malawak na espasyo ng paghahanap.

Ang framework na ito ay ginagaya ang pag-iisip ng tao sa paglutas ng mga problema, pinagsasama ang intuitive na pagbuo ng mga ideya (gamit ang LLM) sa malay, sistematikong pagpaplano at pagsusuri ng mga pagpipilian[2].

Paghahambing sa Ibang mga Paraan ng Pangangatwiran

ToT kumpara sa Chain of Thought (CoT)

Ang ToT ay isang direktang pagbubuo ng CoT. Kung ang CoT ay maaaring ilarawan bilang isang puno na may lapad ng branching na katumbas ng 1, ang ToT ay nagbibigay-daan sa pagsisiyasat ng isang puno na may arbitrary na lapad. Nagbibigay ito ng mga pangunahing kalamangan[3]:

  • Pagsisiyasat ng mga alternatibo: Maaaring isaalang-alang ng ToT ang ilang mga landas ng solusyon, habang ang CoT ay limitado sa isang linear na landas.
  • Posibilidad ng pag-atras: Nagbibigay-daan ang ToT sa modelo na "bumalik", kung ang sanga ng pangangatwiran ay nagsara sa isang dead end, na imposible sa CoT.
  • Pandaigdigang pagpaplano: Nagbibigay-daan ang ToT na gumawa ng estratehikong pagpili batay sa pagtatasa ng ilang mga susunod na hakbang.

ToT kumpara sa Self-Consistency

Ang Self-Consistency ay bumubuo ng maraming independiyenteng "chain of thought" at pinipili ang pinaka-madalas na sagot sa pamamagitan ng pagboto. Ang pamamaraang ito ay nagpapabuti ng pagiging maaasahan ng CoT, ngunit, tulad ng CoT, hindi ito nagbibigay-daan sa pagsisiyasat ng branched na istraktura ng solusyon. Ang ToT, sa kabilang banda, ay maaaring magpakita ng mas makabuluhang mga pagpapabuti sa mga kumplikadong gawain ng pagpaplano, kung saan mahalaga hindi lamang ang mga independiyenteng pagtatangka, kundi pati na rin ang kanilang kaugnayan[1].

Mga Resulta ng Eksperimento

Ipinakita ng mga may-akda ng ToT ang pagiging epektibo nito sa tatlong mga gawain na nangangailangan ng hindi karaniwang pagpaplano o paghahanap.

  • Laro 24: Isang matematikong puzzle, kung saan kailangan mong makuha ang bilang na 24 mula sa apat na ibinigay na numero gamit ang mga pangunahing operasyon ng aritmetika. Ang pamantayang prompting gamit ang GPT-4 ay nagpakita ng tagumpay na 7.3%, ang Chain of Thought — 4%. Ang ToT na may paghahanap sa lapad (b=5) ay umabot sa 74% ng tagumpay, na 18.5 beses na mas mahusay kaysa sa CoT[1][4].
  • Malikhaing Pagsulat: Sa gawain ng pagbuo ng magkakaugnay na teksto mula sa apat na talata na may mga ibinigay na huling pangungusap, ang mga teksto na nilikha gamit ang ToT ay nakatanggap ng average na marka ng coherence na 7.56 sa 10, habang ang CoT — 6.15. Sa 41 sa 100 na paghahambing, pinili ng mga tao ang teksto na nabuo ng ToT, kumpara sa 21 para sa CoT[5].
  • Mini-crosswords (5x5): Wastong pinunan ng ToT ang 60% ng mga salita, habang ang CoT — 1% lamang[6].

Mga Limitasyon at Mga Hinaharap na Direksyon

Sa kabila ng kahanga-hangang mga resulta, ang framework ng ToT ay may ilang mga limitasyon:

  • Computational complexity: Ang ToT ay nangangailangan ng mas maraming computational resources (5–100 beses na mas maraming token), kaysa sa mga pamantayang pamamaraan, dahil sa pangangailangan na bumuo at suriin ang maraming "mga kaisipan"[1].
  • Kahirapan sa pagpapatupad: Ang pagpapatupad ng ToT ay nangangailangan ng makabuluhang mga pagsisikap sa engineering para sa paglikha at pag-configure ng lahat ng mga bahagi: generator ng mga kaisipan, evaluator ng mga estado at algorithm ng paghahanap.
  • Pag-asa sa kalidad ng pagtatasa: Ang pagiging epektibo ng buong framework ay lubos na nakasalalay sa kakayahan ng LLM na sapat na suriin ang mga intermediate na estado, na hindi palaging garantisado.

Ang mga hinaharap na pananaliksik ay nakatuon sa pagpapataas ng kahusayan, pag-automate ng optimization at pagsasama ng ToT sa ibang mga pamamaraan, tulad ng reinforcement learning, para lumikha ng mas matalinong at autonomous na mga agent.

Mga Sanggunian

  • Opisyal na repositoryo ng Tree of Thoughts sa GitHub.
  • Tree of Thoughts (ToT) — gabay sa Prompt Engineering Guide.

Panitikan

  • Yao, S. et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arXiv:2305.10601.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Wang, X. et al. (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171.
  • Kojima, T. et al. (2022). Large Language Models are Zero-Shot Reasoners. arXiv:2205.11916.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Lyu, Q. et al. (2023). Faithful Chain-of-Thought Reasoning. arXiv:2301.13379.
  • Ling, Z. et al. (2023). Deductive Verification of Chain of Thought Reasoning. arXiv:2306.03872.
  • Yao, S. et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629.
  • Besta, M. et al. (2023). Graph of Thoughts: Solving Elaborate Problems with Large Language Models. arXiv:2308.09687.
  • Lightman, H. et al. (2023). Let's Verify Step by Step. arXiv:2305.20050.
  • Lanham, T. et al. (2023). Measuring Faithfulness in Chain-of-Thought Reasoning. arXiv:2307.13702.
  • Yang, B. et al. (2025). Hallucination Detection in Large Language Models with Metamorphic Relations. arXiv:2502.15844.

Mga Tala

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Yao, S., Yu, D., Zhao, J., et al. (2023). «Tree of Thoughts: Deliberate Problem Solving with Large Language Models». arXiv. [1]
  2. 2.0 2.1 «What is Tree of Thoughts Prompting?». IBM. [2]
  3. «Tree of Thoughts vs Chain of Thought». Substack.
  4. «...18.5 times improvement...». arXiv.
  5. «...41 out of 100 comparisons...». OpenReview.
  6. «...CoT: 1% success rate...». arXiv.