Quan em pregunto què necessita fer realment un agent d'escriptura Beancount de manera fiable, la resposta no és "generar text" — és "executar una seqüència d'accions en un entorn estructurat sense sortir-se del camí". AgentBench (Liu et al., Tsinghua, ICLR 2024) és un dels primers intents seriosos de mesurar aquesta capacitat a escala, i la instantània del 2023 encara conté lliçons que val la pena extreure.
L'article
AgentBench, de Xiao Liu i 21 coautors de la Universitat de Tsinghua, defineix vuit entorns dissenyats per posar a prova els LLMs com a agents interactius més que no pas com a generadors passius de text. Cinc entorns són originals: OS (interacció amb bash), Base de Dades (generació de SQL i recuperació d'errors), Grafs de Coneixement (consultes estructurades basades en eines), Joc de Cartes Digital (competició estratègica de múltiples rondes) i Trencaclosques de Pensament Lateral (diàleg deductiu). Tres són adaptats de conjunts de dades anteriors: House-Holding d'ALFWorld, Web Shopping de WebShop i Web Browsing de Mind2Web. L'article avalua 27 models — models comercials d'API i models de codi obert de fins a 70B — en aproximadament 4.000 generacions de la partició de desenvolupament i 13.000 de la partició de prova, i informa tant de les taxes d'èxit per entorn com d'una puntuació global composta.
Idees clau
- GPT-4 lidera amb una puntuació global de 4,01. Claude-2 obté 2,49, GPT-3.5-turbo 2,32. CodeLlama-34B, el model de codi obert més potent en el moment de la presentació, només obté 0,96. Els models d'API promitgen 2,24 enfront de 0,42 dels models de codi obert.
- GPT-4 obté un 42,4% en OS, un 32,0% en Base de Dades i un 78,0% en House-Holding — la dispersió mostra quins entorns recompensen el seguiment d'instruccions versus el raonament estructurat.
- "Límit de Tasca Superat" és el mode de fallada dominant: el 67,9% de les fallades de Grafs de Coneixement exhaureixen el pressupost de passos abans de resoldre la tasca. Això és una fallada de raonament de llarg horitzó, no un dèficit de coneixement.
- Els errors de compliment de format representen el 53,3% de les fallades de Base de Dades — l'agent produeix SQL sintàcticament invàlid, o embolcalla les consultes en prosa que l'avaluador no pot analitzar.
- La selecció d'accions invàlides impulsa el 64,1% de les fallades de House-Holding — l'agent anomena una acció no disponible en l'estat actual.
- L'entrenament en codi té "efectes contradictoris segons les tasques": ajuda en entorns de seguiment de procediments però pot perjudicar el raonament general en els dominis més dialògics.
Què es manté — i què no
L'elecció de disseny central — avaluació interactiva multi-entorn i de múltiples torns — és correcta i encara està poc aprofitada. La majoria de benchmarks d'LLM encara mesuren la qualitat de generació d'un sol torn; AgentBench insisteix correctament que els agents han de continuar prenent decisions fins que la tasca es completa o el pressupost s'exhaureix.
Dit això, la instantània està datada en aspectes que importen. La bretxa entre GPT-4 (4,01) i el millor model de codi obert (0,96) semblava alarmant a mitjan 2023, però el 2025 s'ha tancat en gran part. Models com Llama 3.1 70B o Qwen 2.5 72B superen ara els obstacles de seguiment d'instruccions i compliment de format que eren novetats fa dos anys. Llegir l'article com "el codi obert no pot fer tasques d'agent" seria un error; llegir-lo com "el compliment de format i la consistència de llarg horitzó són els problemes difícils" continua sent correcte.
També hi ha una compensació entre amplitud i profunditat. Vuit entorns semblen complets, però cadascun és relativament superficial. WebArena (Zhou et al., 2024) cobreix 812 tasques plantilla de llarg horitzó només per a navegació web; OSWorld (Xie et al., 2024) avalua 369 tasques reals d'escriptori a Ubuntu i Windows. AgentBench pot donar un senyal transversal entre entorns, però no substitueix un benchmark específic de domini un cop saps quin entorn t'interessa.
La taxonomia de modes de fallada a la Taula 4 és probablement la contribució més duradora. Els autors descomponen les fallades en límit de tasca superat, error de format, acció invàlida i algunes altres. Aquestes no són errors d'implementació — són debilitats estructurals en com els LLMs mantenen l'estat, segueixen les accions disponibles i produeixen sortida analitzable sota pressió de múltiples torns. Qualsevol sistema d'agent seriós ha d'abordar-les.
Per què això importa per a la IA financera
Els tres modes de fallada dominants es corresponen gairebé directament amb el que espero que trencaria un agent d'escriptura Beancount.
Límit de Tasca Superat és el mode de fallada de la conciliació del llibre major. Tancar un període entre múltiples comptes significa comprovar els saldos inicials, aparellar débits i crèdits, identificar discrepàncies i proposar correccions — una cadena que fàcilment arriba als 10–20 passos. Un agent que exhaureix el pressupost de context o de passos a mitja cadena no només falla de manera elegant; pot deixar el llibre major en un estat parcialment modificat.
Error de Format és el mode de fallada de l'entrada de transaccions. Beancount té una sintaxi estricta: una anotació malformada (moneda absent, sagnia incorrecta, bandera invàlida) és un error de parsejador que corromp el fitxer. Un agent que genera prosa al voltant de la seva sortida Beancount, o produeix sintaxi de bon aspecte però en el format incorrecte, és inútil. Aquest és el problema central de l'article del CRITIC aplicat a un domini més estricte.
Acció Invàlida és el problema de seguretat de l'escriptura. Un agent Beancount que opera en un llibre major real té un conjunt limitat d'operacions segures: afegir una transacció, corregir una bandera, moure una anotació. Al·lucinar una acció fora d'aquest conjunt — per exemple, eliminar un compte que encara té posicions obertes — és una fallada de correcció que pot no sortir a la llum fins a una auditoria.
La constatació que "l'entrenament en codi té efectes contradictoris" també és rellevant. L'escriptura Beancount és més propera a la generació de codi que a la recuperació de coneixement, així que un model preentrenat amb codi hauria de ser una opció natural. Però si l'entrenament en codi perjudica el seguiment del diàleg en configuracions de múltiples torns, cal una avaluació híbrida com la d'AgentBench per fer aflorar aquestes compensacions abans del desplegament.
Què llegir a continuació
- WebArena (Zhou et al., 2024; arXiv:2307.13854) — 812 tasques de navegació web en un entorn de navegador viu; el seguiment més profund del nivell web d'AgentBench.
- OSWorld (Xie et al., 2024; NeurIPS 2024) — benchmark complet d'entorn d'escriptori que inclou tasques de sistema de fitxers i GUI; l'entorn OS d'OSWorld és un successor directe i més profund del nivell OS d'AgentBench.
- TAU-bench (Yao et al., 2024) — avalua agents en entorns d'API de comerç al detall i aerolínies amb ús real d'eines i simulació d'usuaris; el benchmark publicat més proper a tractar un llibre major Beancount com un entorn.





