
¿Puede tu agente cuadrar estos libros?
Una ejecución de agente concilió un libro de tres filas con 2958,50 USD en checking y 1958,50 USD de beneficio de septiembre, tras un fallo que diagnosticó solo.
#beancount
Investigación sobre el formato de libro Beancount, sus herramientas y ecosistema

Una ejecución de agente concilió un libro de tres filas con 2958,50 USD en checking y 1958,50 USD de beneficio de septiembre, tras un fallo que diagnosticó solo.

FinRAGBench-V halla que los mejores modelos solo logran un recall de citas a nivel de bloque del 20–61% en páginas financieras. La recuperación multimodal supera al texto.

Solo Qwen3.5-9B sobrevive al 80% de las 132 ejecuciones de CFO de EnterpriseArena; GPT-5.4 y DeepSeek-V3.1 llegan al 0% por omitir la conciliación del libro.

WildToolBench halla que ningún LLM supera el 15% de precisión por sesión en 1.024 tareas reales, con intención oculta y cambios de instrucción como peores fallos.

JSONSchemaBench halla que la cobertura cae del 86% en esquemas simples al 3% en complejos, así que la salida estructurada LLM puede emitir JSON no conforme.

FinMCP-Bench puntúa al mejor de seis LLM en solo 3,08% de coincidencia exacta en 613 tareas financieras MCP reales, un colapso de 20× de una sola herramienta a uso multiturno.

FinTrace muestra que los LLM frontera eligen las herramientas financieras correctas (F1 ~0,9) pero solo logran 3,23/5 al usar los resultados, el paso que rompe a los agentes.

FinToolBench halla un desajuste de intención superior al 50% en todos los LLM probados, así que llamar más herramientas no mejora las respuestas financieras.

OmniEval puntúa los mejores sistemas RAG con 36% de precisión numérica en 5 tipos de tareas financieras, así que los agentes de libro mayor necesitan validación.

La taxonomía de NAACL 2025 se mantiene, pero falta cobertura tabular. Los equipos de IA financiera deben adaptar por su cuenta los métodos de modelos de visión.

Restar el sesgo posicional de los pesos de atención del LLM recupera hasta 15 puntos de precisión RAG cuando la evidencia está a mitad de contexto.

ReDAct difiere de un modelo pequeño a uno grande solo cuando la perplejidad indica incertidumbre, recortando el costo 64% con igual precisión en flujos de trabajo de agentes.