Cuando pregunto qué necesita hacer de manera confiable un agente de escritura en Beancount, la respuesta no es "generar texto" — es "ejecutar una secuencia de acciones en un entorno estructurado sin desviarse del camino". AgentBench (Liu et al., Tsinghua, ICLR 2024) es uno de los primeros intentos serios de medir esa capacidad a escala, y la instantánea de 2023 aún contiene lecciones dignas de extraer.
El artículo
AgentBench, de Xiao Liu y 21 coautores de la Universidad Tsinghua, define ocho entornos diseñados para probar la resistencia de los LLMs como agentes interactivos en lugar de generadores pasivos de texto. Cinco entornos son originales: SO (interacción con bash), Base de Datos (generación de SQL y recuperación de errores), Grafo de Conocimiento (consultas estructuradas basadas en herramientas), Juego de Cartas Digital (competencia estratégica multi-ronda) y Acertijos de Pensamiento Lateral (diálogo deductivo). Tres se adaptan de conjuntos de datos previos: House-Holding de ALFWorld, Web Shopping de WebShop y Web Browsing de Mind2Web. El artículo evalúa 27 modelos — modelos comerciales de API y modelos de código abierto de hasta 70B — a lo largo de aproximadamente 4,000 generaciones del split de desarrollo y 13,000 del split de prueba, e informa tanto las tasas de éxito por entorno como una puntuación general compuesta.
Ideas clave
- GPT-4 lidera con una puntuación general de 4.01. Claude-2 obtiene 2.49, GPT-3.5-turbo 2.32. CodeLlama-34B, el modelo de código abierto más fuerte en el momento de la presentación, solo obtiene 0.96. Los modelos de API promedian 2.24 frente a 0.42 para los modelos de código abierto.
- GPT-4 obtiene 42.4% en SO, 32.0% en Base de Datos y 78.0% en House-Holding — la dispersión muestra qué entornos recompensan el seguimiento de instrucciones versus el razonamiento estructurado.
- "Límite de Tarea Excedido" es el modo de fallo dominante: el 67.9% de los fallos del Grafo de Conocimiento alcanzan el presupuesto de pasos antes de resolver la tarea. Eso es un fallo de razonamiento de largo horizonte, no un déficit de conocimiento.
- Los errores de cumplimiento de formato representan el 53.3% de los fallos de Base de Datos — el agente produce SQL sintácticamente inválido o envuelve las consultas en prosa que el evaluador no puede analizar.
- La selección de acciones inválidas impulsa el 64.1% de los fallos de House-Holding — el agente nombra una acción no disponible en el estado actual.
- El entrenamiento en código tiene "efectos contradictorios entre tareas": ayuda en entornos de seguimiento de procedimientos pero puede perjudicar el razonamiento general en entornos cargados de diálogo.
Lo que se sostiene — y lo que no
La decisión de diseño central — evaluación interactiva, multi-entorno y multi-turno — es correcta y sigue siendo poco utilizada. La mayoría de los benchmarks de LLM aún miden la calidad de generación de un solo turno; AgentBench insiste correctamente en que los agentes deben seguir tomando decisiones hasta que la tarea se complete o el presupuesto se agote.
Dicho esto, la instantánea está desactualizada en formas que importan. La brecha entre GPT-4 (4.01) y el mejor modelo de código abierto (0.96) parecía alarmante a mediados de 2023, pero para 2025 se ha cerrado en gran medida. Modelos como Llama 3.1 70B o Qwen 2.5 72B ahora superan los obstáculos de seguimiento de instrucciones y cumplimiento de formato que eran novedosos hace dos años. Leer el artículo como "el código abierto no puede hacer tareas de agente" sería un error; leerlo como "el cumplimiento de formato y la consistencia de largo horizonte son los problemas difíciles" sigue siendo correcto.
También hay una compensación entre amplitud y profundidad. Ocho entornos suenan completos, pero cada uno es relativamente superficial. WebArena (Zhou et al., 2024) cubre 812 tareas plantillas de largo horizonte solo para navegación web; OSWorld (Xie et al., 2024) evalúa 369 tareas reales de escritorio en Ubuntu y Windows. AgentBench puede dar una señal transversal entre entornos, pero no reemplaza un benchmark específico de dominio una vez que sabes qué entorno te importa.
La taxonomía de modos de fallo en la Tabla 4 es probablemente la contribución más duradera. Los autores dividen los fallos en límite de tarea excedido, error de formato, acción inválida y algunos otros. Estos no son bugs de implementación — son debilidades estructurales en cómo los LLMs mantienen el estado, rastrean las acciones disponibles y producen salida analizable bajo presión multi-turno. Cualquier sistema de agente serio tiene que abordarlos.
Por qué esto importa para la IA financiera
Los tres modos de fallo dominantes se mapean casi directamente a lo que esperaría que fallara en un agente de escritura en Beancount.
Límite de Tarea Excedido es el modo de fallo de conciliación de libros. Cerrar un período a través de múltiples cuentas significa verificar saldos iniciales, emparejar débitos y créditos, identificar discrepancias y proponer correcciones — una cadena que fácilmente llega a 10–20 pasos. Un agente que alcanza el presupuesto de contexto o de pasos a mitad de la cadena y se rinde no solo falla con elegancia; puede dejar el libro en un estado parcialmente modificado.
Error de Formato es el modo de fallo de registro de transacciones. Beancount tiene una sintaxis estricta: un asiento mal formado (falta de moneda, sangría incorrecta, bandera inválida) es un error de análisis que corrompe el archivo. Un agente que genera prosa alrededor de su salida de Beancount, o produce sintaxis que se ve correcta en el formato equivocado, es inútil. Este es el problema central del artículo CRITIC aplicado a un dominio más estricto.
Acción Inválida es el problema de seguridad de la escritura. Un agente de Beancount que opera en un libro real tiene un conjunto limitado de operaciones seguras: añadir una transacción, corregir una bandera, mover un asiento. Alucinar una acción fuera de ese conjunto — por ejemplo, eliminar una cuenta que aún tiene posiciones abiertas — es un fallo de corrección que puede no salir a la superficie hasta una auditoría.
El hallazgo de que "el entrenamiento en código tiene efectos contradictorios" también es relevante. La escritura en Beancount está más cerca de la generación de código que de la recuperación de conocimiento, por lo que un modelo pre-entrenado en código debería encajar de forma natural. Pero si el entrenamiento en código perjudica el seguimiento de diálogo en entornos multi-turno, una evaluación híbrida como la de AgentBench es necesaria para sacar a la luz esos intercambios antes de la implementación.
Qué leer a continuación
- WebArena (Zhou et al., 2024; arXiv:2307.13854) — 812 tareas de navegación web en un entorno de navegador en vivo; la continuación más profunda del nivel web de AgentBench.
- OSWorld (Xie et al., 2024; NeurIPS 2024) — benchmark completo de entorno de escritorio que incluye tareas de sistema de archivos y GUI; el entorno SO de OSWorld es un sucesor directo y más profundo del nivel SO de AgentBench.
- TAU-bench (Yao et al., 2024) — evalúa agentes en entornos de API minoristas y de aerolíneas con uso real de herramientas y simulación de usuarios; el benchmark publicado más cercano a tratar un libro de Beancount como un entorno.





