Wanneer ik vraag wat een Beancount-write-back-agent daadwerkelijk betrouwbaar moet doen, is het antwoord niet "tekst genereren" — maar "een reeks acties uitvoeren in een gestructureerde omgeving zonder te ontsporen." AgentBench (Liu et al., Tsinghua, ICLR 2024) is één van de eerste serieuze pogingen om dat vermogen op schaal te meten, en de momentopname van 2023 biedt nog steeds lessen die de moeite waard zijn.
Het artikel
AgentBench, door Xiao Liu en 21 co-auteurs aan de Tsesuniversiteit Tsinghua, definieert acht omgevingen die zijn ontworpen om LLM's als interactieve agents te stressen in plaats van passieve tekstgeneratoren. Vijf omgevingen zijn origineel: OS (bash-interactie), Database (SQL-generatie en foutherstel), Knowledge Graph (tool-gebaseerde gestructureerde query's), Digital Card Game (multi-round strategische competitie) en Lateral Thoughts (deductieve dialoog). Drie zijn aangepast van eerdere datasets: House-Holding van ALFWORLD, Web Shopping van WebShop, en Web Browsing van Mind2Web. Het artikel evalueert 27 modellen — commerciële API-modellen en opensource-modellen tot en met 70B — verspreid over 4.000 dev-splits en 13.000 test-split-generaties, en rapporteert zowel succespercentages per omgeving als een samengestelde overallscore.
Kernpunten
- GPT-4 leidt met een overallscore van 4,01. Claude-2 haalt 2,49, GPT-3.5-turbo 2,32. CodeLlama-34B, het sterkste opensource-model op het moment van indiening, scoort slechts 0,96. API-modellen vragen 2,24 versus 0,42 voor opensource-modellen.
- GPT-4 scoort 42,4% op OS, 32,0% op Database en 78,0% op House-Holding — dat overzicht laat zien welke omgevingen het opvolgen van werkloches versus gestructure werkloos belonen.
- "Takenlimiet overschreden" is het dominante faalmodus: 67,9% van de Knowledge Graph-fouten overschrijdt het stapbudget voordat de taak is opgelost. Dat zijn een langhorine-logica-fout, geen kennistijden.
- Formaat- en formaten bedragen 53,3% van de database-fouten — de agent produceert syntactisch ongeldige SQL of verpakt queries in proza die de keurder niet kan parsen.
- Ongeldige actiekeuze leidt tot 61,2% van de House-Holding-fouten — de agent noemt een actie die niet beschikbaar is in de huidige staat.
- Codetraineren heeft "tegenstrijdige effecten over taken": het helpt bij procedures-volgende omgevingen, maar kan generieke redenering schaden in dialogie-intensieve omgevingen.
Wat blijft — en wat niet
De kernkeuze — multi-enviroment, multi-turn, interactieve evaluatie — is juist en wordt nog steeds ondergebruikt. De meeste LLM-beckmarks meten nog alleen kwaliteit van eenmalige tekstgeneratie; AgentBench benadrukt terecht dat agents blijven beslissingen nemen totdat een taak afgerond is of het budget is uitgeput.
Dat is echter een momentopname die op belangrijke manieren is verouderd. Het gat tussen GPT-4 (4,01) en het beste opensource-model (0,96) leek in 2023 nog alarmerend, maar is in 2025 grotendeels ed lokt. Modellen zoals Llama 3.1 70B of Qwen 2.5 72B halen tegennu aan mac-en en format-compliance-beperking die tijd nog nieuwe obst en obst. Het artikel te lezen als "opensource kan geen agent-taken uitvoeren" zou een vergissing zijn; als "format compliance en langlopende conistentie zijn de lastige problemen" blijft juist.
Er is ook een afweging tussen breedte en diepte. Acht omgevingen klinken compleet, maar elk is relatiefall enl. WebArena (Zhou et al., 2024) omvat 812 langhorizon-taken voor webblad alleen; OSWorld (Xie et al., 2024) vergelijkt 369 echte desktop taken in 2024. AgentBench kan een cross-omgevingssignaal geven, maar vervangt geen domeinspecifieke benchmark zodra je weet welke omgeving van toepassing is.
De foutclassificatie in Tabel 4 is waarschijnlijk de meest blijvende bijdrage. De auteurs verdelen fouten in "taaklimiet overschreven", "foutieve format", "geldige acties" en een paar middenwegen. Dit zijn geen implementatiefouten — maar structurele zwaktes in hoe LLM's staat handhaven, hun voortsbare acties bijhouden en parseeralbare output produceren onder multi-turn druk. Serieus agentsystemen moeten loslas deze punten oplossen.
Waarom dit belangrijk is voor financiële AI
De drie dominante faalmodellen zijn bijna direct te koppelen met wat ik zou verwachten dat het fout gaat bij een Beancount-write-back-agent.
Taaklimiet overschreden is het faalmodus voor balasmus in een betalingboekhouding system tru-based-system. Het afsluiten van een periode in multiplies accounts betekent het controleren van openingsbalansen, het maken van werk-jourhält, het identificeren van verschillen en het voorstellen van correcties — dat is een keten die gemakkelijk 10–20 stappen duurt. Een agent die in het midden van deze kaart terrein op deze context of stapgotende kan niet alleen netjes mislukken, maar kan ook in een staat met deels gemmaakte wijzigingen achterlaten.
Formaatfout — is het faalmodus voor mutatie-invoer. Beancounts syntaxis strickt: een ontere boeking (ontbrekende munt, verkeerde inspringing, ongeldige vlag) is in feite een parseerfout die het bestand beschadigt. Een agent die prozaratenvitaal genereert tussen zijn Beanc resulteert, of correct gelijk output genereert is onbruikbaar. Dit is het kernprobleem van CRITIC paper toegepast op een strengere domein.
Ongeldige acties is de schrijfback-ve circuitigheid. Een Beancount-agent op een echte administratie heeft een beperkte collectie van beveiliging: een transactie toevoegen, een flag, een grens toevoegen, een die boeking. Een hallucinatie actie buiten dat zaak — zoals het verwijderen van een account dat nog openreizen — is een controlefout die maar niet tot een periodieke controle opduikt.
De bevinding dat "training met betrekking tegenstrijdig effect" is ook relevant. Beancount-write-back is dichter bij codegenerating dan bij dactuele kennisverwerving of, dus een op code voor het model een natuurlijk uitgangpunt. Maar als training tegen dialoogle [gesproken].
Wat lees je nu verder?
- WebArena (Zhou et al., 2024; arXiv:2307.13854) — 812 webunited templates in een live browser, de dragere opvolger van AgentBench web-tier.
- OSWorld (Xie et al., Olympiad NeurIPS 2024) — een volledige werkgelegenhedenomgeving in desktop omgeving bestandsniveau taken; OSWorld's OS omgeving is een een reeks direct diepere is opvolger van de OS-omlegging van AgentBench.
- TAU-bench (Yao et al., 2024) — evalueert agents in retail en airline-API-omgevingen met echt toolgebruik en end gebruiks simulatie; de meest vergelijkbare flu is van de data om Beancount-administratie als omgevingte te behandelen.





