
Pot el vostre agent equilibrar aquests llibres?
Una execució d'agent va conciliar un llibre de tres files amb 2958,50 USD de corrent i 1958,50 USD de benefici del setembre, recuperant-se d'una fallada que va diagnosticar.
#reconciliation
Conciliació automatitzada de llibres amb agents de models de llenguatge

Una execució d'agent va conciliar un llibre de tres files amb 2958,50 USD de corrent i 1958,50 USD de benefici del setembre, recuperant-se d'una fallada que va diagnosticar.

FinRAGBench-V (EMNLP 2025) és el primer banc de proves a gran escala per a RAG multimodal amb citacions visuals en finances, que cobreix més de 112.000 pàgines de documents i 1.394 parells de preguntes i respostes anotats per humans. Els models superiors només aconsegueixen una recuperació de citacions a nivell de bloc del 20–61%, i la recuperació multimodal supera la de només text en gairebé 50 punts percentuals.

Només Qwen3.5-9B supera el 80% de les 132 execucions de CFO d'EnterpriseArena; GPT-5.4 i DeepSeek-V3.1 arriben al 0%. La conciliació de llibres omesa causa les fallades.

FinMCP-Bench puntua el millor de sis LLM en només un 3,08% de coincidència exacta en 613 tasques financeres MCP reals, un col·lapse de 20× d'una sola eina a l'ús multi-torn.

Restar el biaix posicional dels pesos d'atenció dels LLM recupera fins a 15 punts de precisió RAG quan l'evidència és al mig del context, cosa que ajuda els agents financers.

Fin-RATE mostra que la precisió dels LLM cau un 18,60% en seguiment longitudinal, amb la canalització de recuperació, no el model, com el coll d'ampolla limitant.

La biblioteca persistent de skills de codi de Voyager descobreix 3,3× més ítems de Minecraft que l'SOTA anterior sense fine-tuning—el patró de reutilització que necessiten els agents de llibres majors.

La conversa de dos agents d'AutoGen eleva la precisió en MATH del 55% al 69%, i el seu agent SafeGuard afegeix fins a 35 punts F1 en la detecció de codi insegur.

CodeAct substitueix les crides d'eines JSON per Python executable, elevant l'èxit de l'agent GPT-4 en ~20 punts i reduint els torns un 30%.

CRITIC millora el QA de domini obert en 7.7 F1 i redueix la toxicitat un 79.2% verificant les revisions del LLM contra eines externes, no contra si mateix.

ReAct intercala raonament i accions d'eines i supera la CoT pura en 34 punts en verificació de fets. Els seus modes de fallada condicionen els agents que escriuen a Beancount.