
Pot el vostre agent equilibrar aquests llibres?
Una execució d'agent va conciliar un llibre de tres files amb 2958,50 USD de corrent i 1958,50 USD de benefici del setembre, recuperant-se d'una fallada que va diagnosticar.
#beancount
Format de llibre Beancount, eines i recerca de l'ecosistema

Una execució d'agent va conciliar un llibre de tres files amb 2958,50 USD de corrent i 1958,50 USD de benefici del setembre, recuperant-se d'una fallada que va diagnosticar.

FinRAGBench-V (EMNLP 2025) és el primer banc de proves a gran escala per a RAG multimodal amb citacions visuals en finances, que cobreix més de 112.000 pàgines de documents i 1.394 parells de preguntes i respostes anotats per humans. Els models superiors només aconsegueixen una recuperació de citacions a nivell de bloc del 20–61%, i la recuperació multimodal supera la de només text en gairebé 50 punts percentuals.

Només Qwen3.5-9B supera el 80% de les 132 execucions de CFO d'EnterpriseArena; GPT-5.4 i DeepSeek-V3.1 arriben al 0%. La conciliació de llibres omesa causa les fallades.

WildToolBench troba que cap LLM supera el 15% de precisió de sessió en 1.024 tasques reals, amb la intenció oculta i les transicions d'instruccions com a fallades més agudes.

JSONSchemaBench troba que la cobertura cau del 86% en esquemes simples al 3% en complexos, així que la sortida estructurada dels LLM pot emetre JSON no conforme en silenci.

FinMCP-Bench puntua el millor de sis LLM en només un 3,08% de coincidència exacta en 613 tasques financeres MCP reals, un col·lapse de 20× d'una sola eina a l'ús multi-torn.

FinTrace mostra que els LLM d'avantguarda trien bones eines financeres (F1 ~0,9) però puntuen 3,23/5 en usar-ne els resultats, el pas que trenca els agents d'escriptura.

FinToolBench troba un desajust d'intenció superior al 50% en tots els LLM provats, així que cridar eines agressivament no dona millors respostes en tasques financeres.

OmniEval puntua els millors sistemes RAG amb un 36% de precisió numèrica en 5 tipus de tasques financeres, així que els agents de llibre necessiten validació abans d'escriure.

La taxonomia de NAACL 2025 es manté, però falta cobertura tabular. Els equips d'IA financera han d'adaptar ells mateixos els mètodes de models de visió.

Restar el biaix posicional dels pesos d'atenció dels LLM recupera fins a 15 punts de precisió RAG quan l'evidència és al mig del context, cosa que ajuda els agents financers.

ReDAct delega d'un model petit a un de gran només quan la perplexitat indica incertesa, retallant el cost un 64% amb precisió equivalent per a fluxos d'agents.