Saltar al contenido principal

Registro de investigación de Bean Labs

LATS: Búsqueda de Árbol de Agentes de Lenguaje: Razonamiento, Actuación y Planificación en un Solo Marco de Trabajo

Publicado Actualizado por última vez 6 min de lecturaMike ThriftMike Thrift
LATS: Búsqueda de Árbol de Agentes de Lenguaje: Razonamiento, Actuación y Planificación en un Solo Marco de Trabajo

Documento: https://arxiv.org/abs/2310.04406

En esta página

He estado pensando en qué viene después del Árbol de Pensamientos — si puedes buscar sobre pasos de razonamiento, ¿por qué no buscar también sobre acciones? Eso es exactamente lo que hace LATS (Búsqueda de Árbol de Agentes de Lenguaje), y por qué lo estoy leyendo ahora. El artículo de Andy Zhou, Kai Yan, Michal Shlapentokh-Rothman, Haohan Wang y Yu-Xiong Wang (ICML 2024, arXiv:2310.04406) es la síntesis más clara hasta ahora de razonamiento, actuación y planificación en un solo marco de agente, y los resultados son genuinamente difíciles de descartar.

El artículo

El problema central que aborda LATS es una brecha estructural en el trabajo previo sobre agentes. ReAct entrelaza razonamiento y actuación, pero no tiene mecanismo para revertir e intentar una ruta diferente cuando una trayectoria sale mal. El Árbol de Pensamientos permite la ramificación sobre pasos de razonamiento, pero opera sobre conocimiento interno del LM — no puede llamar herramientas ni recibir retroalimentación externa durante la búsqueda. Reflexion añade autocorrección verbal, pero su bucle de reintento lineal se compromete con una nueva trayectoria sin explorar alternativas. LATS fusiona las tres ideas con una columna vertebral de Búsqueda de Árbol de Monte Carlo (MCTS) adecuada, permitiendo a los agentes LLM explorar múltiples ramas, recibir retroalimentación real del entorno y retroceder cuando una ruta falla.

El mecanismo técnico es un bucle MCTS de seis pasos: Selección (elegir el siguiente nodo a explorar mediante la fórmula UCT), Expansión (muestrear n acciones candidatas del LM), Evaluación (puntuar cada nodo con una función de valor híbrida), Simulación (ejecutar hasta un estado terminal), Propagación hacia atrás (actualizar los valores de los ancestros) y Reflexión (en caso de fallo, generar un resumen verbal de lo que salió mal y almacenarlo como contexto). La función de valor merece atención: V(s) = λ·LM(s) + (1−λ)·SC(s), donde LM(s) es la propia estimación del LM sobre la calidad de la trayectoria después de recibir la retroalimentación del entorno, y SC(s) es una puntuación de autoconsistencia basada en la frecuencia con la que esa acción se muestrea entre nodos hermanos. Esto no es un modelo de recompensa entrenado — la función de valor está completamente impulsada por el prompt.

Ideas clave

  • En HumanEval, GPT-4 + LATS alcanza 92.7% de pass@1, frente al 91.0% de GPT-4 + Reflexion y el 56.9% de GPT-3.5 + ReAct por sí solo. GPT-3.5 + LATS salta al 83.8%.
  • En HotPotQA, LATS (CoT + ReAct) alcanza 0.71 de Coincidencia Exacta frente al 0.32 de la línea base ReAct — más que duplicando la precisión en múltiples saltos.
  • En WebShop (navegación web + compra), LATS puntúa 75.9 (38.0% de éxito) frente a Reflexion con 64.2 (35.0%) — una brecha significativa en una tarea que requiere gestionar estado a través de muchas páginas.
  • En Game of 24 (un rompecabezas de razonamiento puro), LATS alcanza 0.44 de éxito frente al 0.20 de ToT, a pesar de usar la misma base GPT-4.
  • Sorprendentemente, LATS expande menos nodos para encontrar una solución que ToT (promedio de 66.65 vs. 84.05 nodos en HotPotQA a k=50) y usa menos tokens (173,290 vs. 210,215), aunque teóricamente parece más costoso.

Qué se sostiene — y qué no

Los números de referencia son reales y el marco es conceptualmente limpio. La formulación UCT proporciona un equilibrio exploración-explotación basado en principios que el BFS/DFS ad-hoc de ToT carece. Integrar la retroalimentación externa del entorno en la función de valor — en lugar de la introspección pura del LM — es el movimiento correcto, y los resultados lo demuestran.

Pero el artículo lleva una suposición crítica que los autores reconocen sin someter a pruebas de estrés completas: LATS requiere la capacidad de revertir el entorno a un estado anterior. Sin checkpointing, no puedes ramificar el árbol — una vez que se toma una acción, estás comprometido. Los autores señalan que para tareas de LM esto a menudo es manejable mediante "copiar y pegar textos históricos de entrada", pero para entornos de acción reales (bases de datos, sistemas de archivos, APIs con efectos secundarios) esto es un requisito difícil que muchos sistemas de producción no pueden cumplir. Los resultados de WebShop, aunque mejores que las líneas base, muestran que en entornos complejos las autorreflexiones tienden a volverse genéricas en lugar de específicas — los agentes pueden estancarse y repetir errores superficialmente diferentes pero estructuralmente idénticos. El artículo lo señala pero no ofrece remedio.

Tampoco hay una ablación que aísle la contribución de la estructura MCTS frente al diseño de la función de valor. Es plausible que un enfoque de ramificación más simple con la misma función de valor híbrida cierre gran parte de la brecha, y los autores no prueban esto directamente.

Por qué esto importa para la IA financiera

Los libros de contabilidad de Beancount son un entorno casi ideal para la búsqueda de árboles estilo LATS por una razón principal: cada libro está respaldado por un repositorio git. El requisito de reversión de estado — la restricción difícil que hace que LATS sea poco práctico en muchos entornos reales — se satisface trivialmente con git checkout o git stash. Un agente de escritura podría proponer entradas de diario candidatas en múltiples ramas, puntuarlas contra las restricciones del balance (la función de valor) y confirmar solo la ruta de mayor puntuación. Las ramas fallidas reciben una reflexión verbal: "La entrada registrada violó Activos = Pasivos + Patrimonio porque el tipo de cuenta estaba mal clasificado."

El diseño de la función de valor híbrida es directamente aplicable también. Para un agente de libro de contabilidad, LM(s) puntuaría una entrada propuesta por ajuste semántico (¿esto parece la categoría correcta?), mientras que SC(s) rastrearía la consistencia con la que el agente clasifica transacciones pasadas similares — una verificación de autoconsistencia natural arraigada en la historia del propio libro.

La reversión de estado es el único lugar donde retrocedería en la analogía financiera. Los libros reales a menudo tienen efectos posteriores: una entrada registrada desencadena una factura que desencadena un flujo de trabajo de pago. En esos casos, la suposición de LATS se rompe. Específicamente para Beancount, donde el libro es un archivo de texto plano bajo control git y los cambios ocurren localmente antes de que se active cualquier desencadenante posterior, la suposición se sostiene — pero esto es una restricción de diseño a mantener explícita.

Qué leer a continuación

  • Planificación basada en MCTS sin modelos de entorno: "Razonar con Modelos de Lenguaje es Planificar con Modelos del Mundo" (Hao et al., 2023, arXiv:2305.14992) — RAP, sobre el que LATS se construye y mejora.
  • ¿Qué tan bien generaliza la función de valor del LM? "Verifiquemos Paso a Paso" (Lightman et al., 2023, arXiv:2305.20050) — modelos de recompensa de proceso como alternativa a las funciones de valor basadas en prompt.
  • Planificación segura en múltiples pasos bajo irreversibilidad: "Toma de Decisiones con Modelos de Lenguaje mediante Solicitudes Sucesivas" (Creswell et al., 2023) — un enfoque de planificación más simple que evita el requisito de reversión de estado.

Comparte este artículo

Fuente: https://beancount.io/es/bean-labs/research-logs/2026/05/10/lats-language-agent-tree-search-reasoning-acting-planning

Publicado: 10 de mayo de 2026

Actualizado por última vez: 14 de septiembre de 2026