Keď sa pýtam, čo vlastne musí Beancount write-back agent spoľahlivo robiť, odpoveď nie je „generovať text" — je to „vykonať postupnosť akcií v štruktúrovanom prostredí bez toho, aby sa vymkol z koľají." AgentBench (Liu et al., Tsinghua, ICLR 2024) je jedným z prvých vážnych pokusov zmerať túto schopnosť vo veľkom rozsahu a snímka z roku 2023 stále obsahuje poučenia, ktoré stoja za vyťaženie.
Článok
AgentBench, od Xiao Liua a 21 spoluautorov z Univerzity Tsinghua, definuje osem prostredí navrhnutých na záťažové testovanie LLM ako interaktívnych agentov, nie pasívnych generátorov textu. Päť prostredí je originálnych: OS (interakcia s bash), Databáza (generovanie SQL a obnova po chybách), Znalostný graf (štruktúrované dotazy založené na nástrojoch), Digitálna kartová hra (viackolová strategická súťaž) a Hádanky laterálneho myslenia (deduktívny dialóg). Tri sú upravené z predchádzajúcich datasetov: House-Holding z ALFWorld, Web Shopping z WebShop a Web Browsing z Mind2Web. Článok hodnotí 27 modelov — komerčné API modely a open-source modely až do 70B — na približne 4 000 generáciách dev-split a 13 000 generáciách test-split a uvádza ako miery úspešnosti pre jednotlivé prostredia, tak aj kompozitné celkové skóre.
Kľúčové myšlienky
- GPT-4 vedie s celkovým skóre 4,01. Claude-2 dosahuje 2,49, GPT-3.5-turbo 2,32. CodeLlama-34B, najsilnejší open-source model v čase podania, dosahuje len 0,96. API modely v priemere dosahujú 2,24 oproti 0,42 pre open-source modely.
- GPT-4 dosahuje 42,4 % na OS, 32,0 % na Databáze a 78,0 % na House-Holding — rozptyl ukazuje, ktoré prostredia odmeňujú plnenie inštrukcií oproti štruktúrovanému uvažovaniu.
- „Prekročený limit úlohy" je dominantný spôsob zlyhania: 67,9 % zlyhaní Znalostného grafu narazí na rozpočet krokov pred vyriešením úlohy. To je zlyhanie dlhohorizontového uvažovania, nie deficit vedomostí.
- Chyby zhody s formátom predstavujú 53,3 % zlyhaní Databázy — agent produkuje syntakticky neplatný SQL alebo obaľuje dotazy v próze, ktorú hodnotiteľ nedokáže spracovať.
- Výber neplatnej akcie poháňa 64,1 % zlyhaní House-Holding — agent pomenuje akciu, ktorá nie je dostupná v aktuálnom stave.
- Tréning na kóde má „protichodné účinky naprieč úlohami": pomáha prostrediam založeným na postupoch, ale môže poškodiť všeobecné uvažovanie v prostrediach náročných na dialóg.
Čo platí — a čo nie
Jadro dizajnu — viacprostredové, viackolové, interaktívne vyhodnocovanie — je správne a stále nedostatočne využívané. Väčšina LLM benchmarkov stále meria kvalitu jednokolového generovania; AgentBench správne trvá na tom, že agenti musia pokračovať v rozhodovaní, až kým nie je úloha hotová alebo vyčerpaný rozpočet.
To však znamená, že snímka je zastaraná spôsobmi, ktoré majú význam. Priepasť medzi GPT-4 (4,01) a najlepším open-source modelom (0,96) vyzerala v polovici roku 2023 alarmujúco, ale do roku 2025 sa do značnej miery uzavrela. Modely ako Llama 3.1 70B alebo Qwen 2.5 72B teraz zvládajú prekážky v plnení inštrukcií a zhode s formátom, ktoré boli pred dvoma rokmi novými prekážkami. Čítať článok ako „open-source nedokáže agentické úlohy" by bola chyba; čítať ho ako „zhoda s formátom a dlhohorizontová konzistentnosť sú tie ťažké problémy" zostáva správne.
Existuje tiež kompromis medzi šírkou a hĺbkou. Osem prostredí znie komplexne, ale každé je relatívne plytké. WebArena (Zhou et al., 2024) pokrýva 812 dlhohorizontových šablónovaných úloh len pre webové prehliadanie; OSWorld (Xie et al., 2024) benchmarkuje 369 reálnych desktopových úloh na Ubuntu a Windows. AgentBench môže poskytnúť signál naprieč prostrediami, ale nenahrádza doménovo špecifický benchmark, keď už viete, o ktoré prostredie vám ide.
Taxonómia spôsobov zlyhania v Tabuľke 4 je pravdepodobne najtrvalejším prínosom. Autori rozdeľujú zlyhania na prekročený limit úlohy, chybu formátu, neplatnú akciu a niekoľko ďalších. Nie sú to implementačné chyby — sú to štrukturálne slabiny v tom, ako LLM udržiavajú stav, sledujú dostupné akcie a produkujú spracovateľný výstup pod viackolovým tlakom. Každý seriózny agentový systém sa nimi musí zaoberať.
Prečo je to dôležité pre finančnú AI
Tri dominantné spôsoby zlyhania sa takmer priamo mapujú na to, čo by podľa mňa rozbilo Beancount write-back agenta.
Prekročený limit úlohy je spôsob zlyhania pri odsúhlasovaní účtovnej knihy. Uzavretie obdobia naprieč viacerými účtami znamená kontrolu počiatočných zostatkov, párovanie debetov a kreditov, identifikáciu nezrovnalostí a navrhovanie opráv — reťazec, ktorý ľahko dosiahne 10–20 krokov. Agent, ktorý narazí na kontextový alebo krokový rozpočet uprostred reťazca a vzdá to, nielenže zlyhá elegantne; môže zanechať účtovnú knihu v čiastočne upravenom stave.
Chyba formátu je spôsob zlyhania pri zadávaní transakcií. Beancount má prísnu syntax: chybne formovaný zápis (chýbajúca mena, nesprávne odsadenie, neplatná vlajka) je chyba parsera, ktorá poškodí súbor. Agent, ktorý generuje prózu okolo svojho Beancount výstupu alebo produkuje správne vyzerajúcu syntax v nesprávnom formáte, je nepoužiteľný. To je základný problém článku CRITIC aplikovaný na prísnejšiu doménu.
Neplatná akcia je problém bezpečnosti write-backu. Beancount agent pracujúci na reálnej účtovnej knihe má obmedzený súbor bezpečných operácií: pridať transakciu, opraviť vlajku, presunúť zápis. Halucinovanie akcie mimo tohto súboru — napríklad zmazanie účtu, ktorý má stále otvorené pozície — je chyba správnosti, ktorá nemusí vyjsť najavo až do auditu.
Zistenie, že „tréning na kóde má protichodné účinky", je tiež relevantné. Beancount write-back je bližšie ku generovaniu kódu ako k získavaniu vedomostí, takže model predtrénovaný na kóde by mal byť prirodzenou voľbou. Ale ak tréning na kóde poškodzuje sledovanie dialógu vo viackolových nastaveniach, je potrebné hybridné vyhodnocovanie ako AgentBench, aby sa tieto kompromisy odhalili pred nasadením.
Čo čítať ďalej
- WebArena (Zhou et al., 2024; arXiv:2307.13854) — 812 webových úloh prehliadania v živom prehliadačovom prostredí; hlbší follow-up k webovej vrstve AgentBench.
- OSWorld (Xie et al., 2024; NeurIPS 2024) — plný desktopový benchmark zahŕňajúci súborový systém a GUI úlohy; OS prostredie OSWorld je priamym, hlbším nástupcom OS vrstvy AgentBench.
- TAU-bench (Yao et al., 2024) — hodnotí agentov v maloobchodných a leteckých API prostrediach s reálnym používaním nástrojov a simuláciou používateľov; najbližší publikovaný benchmark k tomu, aby sa Beancount účtovná kniha považovala za prostredie.





