
Kan jouw agent deze boeken sluitend krijgen?
Eén agent-run stemde een grootboek met drie regels af op 2958,50 USD checking en 1958,50 USD septemberwinst, herstellend van één fout die hij zelf diagnosticeerde.
Open experimenten en bevindingen van Bean Labs — het Finance AI Agent-onderzoeksinitiatief van Beancount.io.

Eén agent-run stemde een grootboek met drie regels af op 2958,50 USD checking en 1958,50 USD septemberwinst, herstellend van één fout die hij zelf diagnosticeerde.

FinRAGBench-V vindt dat topmodellen slechts 20–61% block-level citatie-recall halen op financiële pagina's. Multimodale retrieval verslaat tekst-only met bijna 50 punten.

Alleen Qwen3.5-9B overleeft 80% van EnterpriseArena's 132-maandelijkse CFO-runs; GPT-5.4 en DeepSeek-V3.1 halen 0%. Gemiste ledger-reconciliatie veroorzaakt dit.

WildToolBench vindt geen LLM boven 15% sessienauwkeurigheid op 1.024 taken van echte gebruikers, met verborgen intentie en instructieovergangen als scherpste faalmodi.

Verbalized GPT-4-vertrouwen haalt slechts ~62,7% AUROC, nauwelijks boven toeval. Onzekerheidsbewuste finance-agenten hebben betere kalibratie nodig dan dat.

JSONSchemaBench vindt dat dekking instort van 86% bij eenvoudige schema's naar 3% bij complexe, dus LLM-gestructureerde output kan stilzwijgend niet-conforme JSON uitzenden.

FinMCP-Bench scoort de beste van zes LLM's op slechts 3,08% exacte match op 613 echte MCP-financiële taken, een 20×-instorting van single-tool naar multi-turn gebruik.

FinTrace toont dat frontier-LLM's de juiste financiële tools kiezen (F1 ~0,9) maar slechts 3,23/5 scoren op het gebruik van de resultaten, de stap die write-back-agents breekt.

FinToolBench vindt intentie-mismatch boven 50% bij elke geteste LLM, dus agressief tools aanroepen betekent niet betere antwoorden op financiële taken.

OmniEval scoort de beste RAG-systemen op 36% numerieke nauwkeurigheid over 5 financiële taaktypes, dus grootboek-agents hebben validatie nodig vóór het schrijven van boekingen.

De NAACL 2025-taxonomie houdt stand, maar tabeldekking ontbreekt. Finance-AI-teams moeten methoden voor vision-modellen zelf aanpassen.

Positiebias aftrekken van LLM-attentiegewichten herstelt tot 15 punten RAG-nauwkeurigheid wanneer bewijs midden in de context staat, wat finance-agent-pijplijnen helpt.