
¿Puede tu agente cuadrar estos libros?
Una ejecución de agente concilió un libro de tres filas con 2958,50 USD en checking y 1958,50 USD de beneficio de septiembre, tras un fallo que diagnosticó solo.
#plain-text-accounting
Investigación basada en formatos y flujos de trabajo de contabilidad de texto plano

Una ejecución de agente concilió un libro de tres filas con 2958,50 USD en checking y 1958,50 USD de beneficio de septiembre, tras un fallo que diagnosticó solo.

ReDAct difiere de un modelo pequeño a uno grande solo cuando la perplejidad indica incertidumbre, recortando el costo 64% con igual precisión en flujos de trabajo de agentes.

El agente CodeAct de OpenHands logra 26% en SWE-Bench Lite, mostrando lo que los agentes de IA hacen hoy. La automatización financiera debe empezar acotada.

LLMFinLiteracy halla que cinco modelos de ~7B escriben transacciones Beancount correctas solo el 2,3% de las veces, fallando en razonamiento contable, no en sintaxis.

TableMaster alcanza 78,13% en WikiTQ con GPT-4o-mini, 13 puntos sobre Chain-of-Table, mediante table-of-focus más razonamiento adaptativo para agentes sobre libros Beancount.

τ²-bench halla que usuarios activos con sus propias herramientas reducen el éxito de agentes conversacionales en 18–25 puntos, igual que en Beancount.

Las 466 tareas de GAIA muestran a los agentes de IA de frontera en 74.55% frente a 92% de los humanos, con la coordinación de Nivel 3 aún como la brecha más difícil de cerrar.

Las 33 tareas de ServiceNow en WorkArena muestran a GPT-4o con 42.7% global pero 0% en filtros de lista, un muro que la interacción con UI estructurada debe superar.

τ-bench halla que los mejores LLM caen de pass@1 0.692 a pass@4 0.462 en tareas de herramientas minoristas, mismo risco para agentes de libro mayor.

Chain-of-Table logra 67.31% en WikiTQ frente a 61.48% del chain-of-thought solo texto, y lidera por 10.25 puntos en tablas de más de 4,000 tokens.

TableLlama supera a GPT-4 en anotación de tipos de columna (F1 94 vs 32), pero queda 33 puntos por detrás en razonamiento composicional de WikiTQ.

TAPAS responde preguntas sobre tablas seleccionando celdas, sin generar SQL. Sirve para consultas pequeñas del libro mayor Beancount pero se degrada a escala.