
Kan jouw agent deze boeken sluitend krijgen?
Eén agent-run stemde een grootboek met drie regels af op 2958,50 USD checking en 1958,50 USD septemberwinst, herstellend van één fout die hij zelf diagnosticeerde.
#plain-text-accounting
Onderzoek gebaseerd op plain-text accountingformaten en workflows

Eén agent-run stemde een grootboek met drie regels af op 2958,50 USD checking en 1958,50 USD septemberwinst, herstellend van één fout die hij zelf diagnosticeerde.

ReDAct stelt uit van een klein naar een groot model alleen wanneer perplexity onzekerheid signaleert: 64% lagere kosten bij gelijke nauwkeurigheid voor agents.

OpenHands' CodeAct-agent scoort 26% op SWE-Bench Lite en toont wat AI-agents vandaag betrouwbaar doen. Financie-automatisering moet nauw afgebakend beginnen, niet autonoom.

LLMFinLiteracy vindt dat vijf ~7B-modellen slechts 2,3% van de tijd correcte Beancount-transacties schrijven, falend op boekhoudkundig redeneren, niet op syntaxis.

TableMaster behaalt 78,13% op WikiTQ met GPT-4o-mini, 13 punten boven Chain-of-Table, via table-of-focus plus adaptief redeneren voor agents op Beancount-grootboeken.

τ²-bench vindt dat actieve gebruikers met eigen tools conversationele agent-succes met 18–25 punten verlagen. Beancount-agents met gedeelde schrijftoegang verliezen hetzelfde.

GAIA's 466 taken tonen frontier AI-agents op 74,55% versus 92% voor mensen, waarbij Level 3-coördinatie nog steeds het moeilijkste gat is.

WorkArena's 33 ServiceNow-taken tonen GPT-4o op 42,7% overall maar 0% op lijstfilters, een muur die gestructureerde UI-interactie moet slechten.

τ-bench vindt dat top-LLM's dalen van pass@1 0,692 naar pass@4 0,462 op retail-tool-taken. Write-back-agents op een grootboek staan voor dezelfde consistentieklif.

Chain-of-Table haalt 67,31% op WikiTQ tegen 61,48% voor tekstuele chain-of-thought, en leidt met 10,25 punten op tabellen boven 4.000 tokens.

TableLlama verslaat GPT-4 bij kolomtype-annotatie (F1 94 versus 32), maar blijft 33 punten achter bij WikiTQ compositioneel redeneren.

TAPAS beantwoordt tabelvragen door cellen te selecteren, nooit door SQL te genereren. Het past bij kleine Beancount-grootboekquery's maar bezwijkt op schaal.