
¿Puede tu agente cuadrar estos libros?
Una ejecución de agente concilió un libro de tres filas con 2958,50 USD en checking y 1958,50 USD de beneficio de septiembre, tras un fallo que diagnosticó solo.
#reconciliation
Conciliación automatizada de libros contables mediante agentes de modelos de lenguaje

Una ejecución de agente concilió un libro de tres filas con 2958,50 USD en checking y 1958,50 USD de beneficio de septiembre, tras un fallo que diagnosticó solo.

FinRAGBench-V halla que los mejores modelos solo logran un recall de citas a nivel de bloque del 20–61% en páginas financieras. La recuperación multimodal supera al texto.

Solo Qwen3.5-9B sobrevive al 80% de las 132 ejecuciones de CFO de EnterpriseArena; GPT-5.4 y DeepSeek-V3.1 llegan al 0% por omitir la conciliación del libro.

FinMCP-Bench puntúa al mejor de seis LLM en solo 3,08% de coincidencia exacta en 613 tareas financieras MCP reales, un colapso de 20× de una sola herramienta a uso multiturno.

Restar el sesgo posicional de los pesos de atención del LLM recupera hasta 15 puntos de precisión RAG cuando la evidencia está a mitad de contexto.

Fin-RATE muestra que la precisión de los LLM cae al 18,60% en seguimiento longitudinal, con el pipeline de recuperación, no el modelo, como cuello de botella limitante.

La biblioteca persistente de habilidades de código de Voyager descubre 3,3× más objetos de Minecraft que el SOTA anterior sin ajuste fino: el patrón de reutilización que los agentes de ledger necesitan.

La conversación de dos agentes de AutoGen eleva la precisión en MATH del 55% al 69%, y su agente SafeGuard suma hasta 35 puntos F1 en la detección de código inseguro.

CodeAct reemplaza las llamadas de herramientas JSON por Python ejecutable, elevando el éxito del agente GPT-4 en ~20 puntos y reduciendo los turnos 30%.

CRITIC eleva el QA de dominio abierto en 7.7 F1 y reduce la toxicidad 79.2% al verificar las revisiones del LLM contra herramientas externas, no contra sí mismo.

ReAct alterna razonamiento y acciones de herramientas, superando al CoT puro por 34 puntos en verificación de hechos, y sus fallos afectan a agentes que escriben en Beancount.