
Dokáže váš agent vyrovnať tieto knihy?
Jeden beh agenta zosúladil trojriadkovú knihu na 2958,50 USD bežný účet a 1958,50 USD septembrový zisk, pričom sa zotavil z jedného zlyhania, ktoré sám diagnostikoval.
Otvorené experimenty a zistenia z Bean Labs — výskumnej iniciatívy Finance AI Agent od Beancount.io.

Jeden beh agenta zosúladil trojriadkovú knihu na 2958,50 USD bežný účet a 1958,50 USD septembrový zisk, pričom sa zotavil z jedného zlyhania, ktoré sám diagnostikoval.

FinRAGBench-V zisťuje, že špičkové modely dosahujú len 20 – 61 % citovania blokov na finančných stránkach. Multimodálne vyhľadávanie prekonáva textové o takmer 50 bodov.

Len Qwen3.5-9B prežije 80 % zo 132-mesačných CFO behov EnterpriseArena, kým GPT-5.4 a DeepSeek-V3.1 dosahujú 0 %. Príčinou zlyhaní je vynechané odsúhlasenie hlavnej knihy.

WildToolBench: žiadne LLM neprekročí 15 % presnosti relácie na 1 024 úlohách reálnych používateľov, pričom skrytý zámer a prechody inštrukcií sú najostrejšie zlyhania.

Verbalizovaná dôvera GPT-4 dosahuje len ~62,7 % AUROC, sotva nad úrovňou náhody. Finanční agenti vnímajúci neistotu potrebujú lepšiu kalibráciu.

JSONSchemaBench zisťuje, že pokrytie klesá z 86 % pri jednoduchých schémach na 3 % pri zložitých, takže štruktúrovaný výstup LLM môže ticho vytvoriť nevyhovujúci JSON.

FinMCP-Bench dáva najlepšiemu zo šiestich LLM len 3,08 % presnej zhody na 613 reálnych finančných úlohách MCP, teda 20-násobný prepad pri viackolovom použití.

FinTrace ukazuje, že špičkové LLM vyberú správne finančné nástroje (F1 ~0,9), ale v použití výsledkov dosahujú len 3,23/5, čo je krok, ktorý láme agentov zapisujúcich späť.

FinToolBench zisťuje nesúlad zámeru nad 50 % u každého testovaného LLM, takže agresívne volanie nástrojov neznamená lepšie odpovede na finančné úlohy.

OmniEval hodnotí najlepšie RAG systémy na 36 % numerickej presnosti v 5 typoch finančných úloh, takže agenti pre hlavnú knihu potrebujú validáciu pred zápisom položiek.

Taxonómia z NAACL 2025 platí, ale pokrytie tabuliek chýba. Tímy finančnej AI si musia metódy pre vizuálne modely prispôsobiť samy.

Odčítanie pozičnej odchýlky z váh pozornosti LLM obnoví až 15 bodov presnosti RAG, keď dôkaz leží uprostred kontextu, čo pomáha pipeline finančných agentov.