Tree of Thoughts (ToT) (ES)

From Systems analysis Wiki
Jump to navigation Jump to search

Tree of Thoughts (ToT) (Árbol de Pensamientos) es un innovador framework para gestionar el razonamiento de los grandes modelos de lenguaje (LLM), permitiéndoles resolver problemas de forma deliberada mediante la exploración sistemática de múltiples cadenas de razonamiento. El concepto fue presentado en 2023 por investigadores de la Universidad de Princeton y Google DeepMind[1].

ToT es una extensión y generalización de la popular técnica «cadena de pensamiento» (Chain of Thought, CoT). A diferencia de CoT, donde el razonamiento es una única secuencia lineal de pasos, ToT organiza el proceso de pensamiento en forma de un árbol, donde cada nodo es un estado intermedio («pensamiento») y las ramas son posibles caminos para el desarrollo del razonamiento. Esto permite al modelo explorar varias opciones en paralelo, evaluar su potencial, retroceder a pasos anteriores al encontrar callejones sin salida (backtracking) y tomar decisiones deliberadas[1][2].

Principio de funcionamiento

El framework ToT organiza el proceso de resolución de problemas como una búsqueda en un árbol de estados. Su funcionamiento se basa en la interacción cíclica de cuatro componentes clave[1]:

  1. Descomposición del problema en «pensamientos»: El problema original se divide en subproblemas o pasos más pequeños, llamados «pensamientos». A diferencia de CoT, donde un «pensamiento» es simplemente el siguiente token, en ToT un «pensamiento» es una unidad semánticamente significativa (por ejemplo, una ecuación en un problema matemático o un párrafo en el borrador de un texto) que acerca a la solución.
  1. Generación de pensamientos: En cada paso, para el estado actual (nodo del árbol), el modelo genera varios «pensamientos» potenciales siguientes (ramas). Para ello, se utilizan dos estrategias:
  • Muestreo (sample): El modelo genera de forma independiente varias opciones de continuación. Es adecuado para tareas creativas donde es útil tener un amplio espectro de ideas.
  • Propuesta (propose): El modelo genera variantes de forma secuencial, lo cual es más eficiente para tareas con un espacio de soluciones limitado.
  1. Evaluación de estados: Los «pensamientos» generados son evaluados por el propio LLM para determinar su potencial. La evaluación puede ser numérica (por ejemplo, en una escala de 0 a 1) o categórica («seguro», «posible», «imposible»). Esta es una función heurística que dirige la búsqueda hacia las ramas más prometedoras.
  1. Algoritmo de búsqueda: Para explorar sistemáticamente el árbol de pensamientos, se utilizan algoritmos de búsqueda clásicos:
  • Búsqueda en anchura (BFS): Explora todos los nodos de un nivel antes de pasar al siguiente. Garantiza encontrar el camino más corto, pero requiere más memoria.
  • Búsqueda en profundidad (DFS): Explora una rama hasta el final antes de retroceder y probar otra. Es más eficiente en cuanto a memoria y es adecuado para tareas con un espacio de búsqueda profundo pero no demasiado amplio.

Este framework imita el pensamiento humano en la resolución de problemas, combinando la generación intuitiva de ideas (con la ayuda de un LLM) con una planificación sistemática y deliberada y la exploración de variantes[2].

Comparación con otros métodos de razonamiento

ToT en comparación con Chain of Thought (CoT)

ToT es una generalización directa de CoT. Si CoT puede representarse como un árbol con un ancho de ramificación igual a 1, ToT permite explorar un árbol con un ancho arbitrario. Esto proporciona ventajas clave[3]:

  • Exploración de alternativas: ToT puede considerar múltiples caminos de solución, mientras que CoT está limitado a una única ruta lineal.
  • Capacidad de retroceso (backtracking): ToT permite al modelo «retroceder» si una rama de razonamiento llega a un callejón sin salida, lo cual es imposible en CoT.
  • Planificación global: ToT permite tomar decisiones estratégicas basadas en la evaluación de varios pasos futuros.

ToT en comparación con Self-Consistency

Self-Consistency genera múltiples «cadenas de pensamiento» independientes y elige la respuesta más frecuente mediante votación. Este método mejora la fiabilidad de CoT, pero, al igual que CoT, no permite explorar una estructura de solución ramificada. ToT, por su parte, puede mostrar mejoras más significativas en tareas de planificación complejas, donde no solo son importantes los intentos independientes, sino también su interrelación[1].

Resultados experimentales

Los autores de ToT demostraron su eficacia en tres tareas que requieren una planificación o búsqueda no trivial.

  • Juego del 24: Un rompecabezas matemático donde se debe obtener el número 24 a partir de cuatro números dados utilizando operaciones aritméticas básicas. El prompting estándar con GPT-4 mostró una tasa de éxito del 7.3%, mientras que Chain of Thought alcanzó el 4%. ToT con búsqueda en anchura (b=5) logró un 74% de éxito, lo que es 18.5 veces mejor que CoT[1][4].
  • Escritura creativa: En la tarea de generar un texto coherente de cuatro párrafos con las últimas oraciones predefinidas, los textos creados con ToT obtuvieron una puntuación media de coherencia de 7.56 sobre 10, mientras que CoT obtuvo 6.15. En 41 de 100 comparaciones, los humanos prefirieron el texto generado por ToT, frente a 21 para CoT[5].
  • Minicrucigramas (5x5): ToT rellenó correctamente el 60% de las palabras, mientras que CoT solo el 1%[6].

Limitaciones y futuras direcciones

A pesar de sus impresionantes resultados, el framework ToT tiene varias limitaciones:

  • Complejidad computacional: ToT requiere significativamente más recursos computacionales (de 5 a 100 veces más tokens) que los métodos estándar, debido a la necesidad de generar y evaluar múltiples «pensamientos»[1].
  • Complejidad de implementación: La implementación de ToT requiere un esfuerzo de ingeniería considerable para crear y configurar todos los componentes: el generador de pensamientos, el evaluador de estados y el algoritmo de búsqueda.
  • Dependencia de la calidad de la evaluación: La eficacia de todo el framework depende en gran medida de la capacidad del LLM para evaluar adecuadamente los estados intermedios, lo cual no siempre está garantizado.

Las futuras investigaciones se centran en aumentar la eficiencia, automatizar la optimización e integrar ToT con otros métodos, como el aprendizaje por refuerzo, para crear agentes más inteligentes y autónomos.

Enlaces externos

Bibliografía

  • Yao, S. et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arXiv:2305.10601.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Wang, X. et al. (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171.
  • Kojima, T. et al. (2022). Large Language Models are Zero-Shot Reasoners. arXiv:2205.11916.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Lyu, Q. et al. (2023). Faithful Chain-of-Thought Reasoning. arXiv:2301.13379.
  • Ling, Z. et al. (2023). Deductive Verification of Chain of Thought Reasoning. arXiv:2306.03872.
  • Yao, S. et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629.
  • Besta, M. et al. (2023). Graph of Thoughts: Solving Elaborate Problems with Large Language Models. arXiv:2308.09687.
  • Lightman, H. et al. (2023). Let’s Verify Step by Step. arXiv:2305.20050.
  • Lanham, T. et al. (2023). Measuring Faithfulness in Chain-of-Thought Reasoning. arXiv:2307.13702.
  • Yang, B. et al. (2025). Hallucination Detection in Large Language Models with Metamorphic Relations. arXiv:2502.15844.

Referencias

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Yao, S., Yu, D., Zhao, J., et al. (2023). «Tree of Thoughts: Deliberate Problem Solving with Large Language Models». arXiv. [1]
  2. 2.0 2.1 «What is Tree of Thoughts Prompting?». IBM. [2]
  3. «Tree of Thoughts vs Chain of Thought». Substack.
  4. «...18.5 times improvement...». arXiv.
  5. «...41 out of 100 comparisons...». OpenReview.
  6. «...CoT: 1% success rate...». arXiv.