Naar hoofdinhoud springen

AI-benchmarking voor deboekhouding: hoe u meet of uw LLM de cijfers goed heeft

Gepubliceerd 13 min leestijdMike ThriftMike Thrift
AI-benchmarking voor deboekhouding: hoe u meet of uw LLM de cijfers goed heeft

Uw AI-boekhoudtool heeft zojuist 200 facturen verwerkt terwijl u uw koffie dronk. Snel, onvermoeibaar, zelfverzekerd — en mogelijk op veertig daarvan fout. Uit een enquête van september 2026 bleek dat 62% van de professionals in financiële dienstverlening zegt dat een door AI gegenereerde fout al een klant heeft bereikt, terwijl 93% van de auditafdelingen nu AI gebruikt, maar 60% geen formele strategie hiervoor heeft. De kloof tussen die twee cijfers is waar onjuiste boeken, mislukte audits en ongemakkelijke klantgesprekken leven.

De ongemakkelijke waarheid: leveranciers citeren nauwkeurigheidscijfers die zijn gemeten op schone, zorgvuldig geselecteerde documenten, en uw inbox bevat van alles behalve dat. Verfrommelde bonnen, facturen van meerdere pagina's met regels in drie valuta, creditnota's die op facturen lijken, leveranciers die elk kwartaal hun lay-out wijzigen — dat is de echte testset. Als u AI ergens in uw boekhoudworkflow gebruikt, heeft u uw eigen benchmark nodig: een herhaalbare manier om te meten wat het model goed doet, wat het fout doet en of het verbetert of stilletjes afdwaalt. Deze handleiding laat zien hoe u er een opbouwt.

Waarom 'het ziet er goed uit' geen meting is

Grote taalmodellen maken geen fouten zoals mensen dat doen. Een vermoeide boekhouder verwisselt twee cijfers en de fout ziet eruit als een fout. Een LLM hallucineert een plausibel factuurtotaal met volle overtuiging, formatteert het prachtig en gaat verder. Zoals een team dat jarenlang modellen op documentextractie testte het verwoordde: het model geeft je toch een zelfverzekerd antwoord — geen redenatie, geen oordeel, alleen het getal lezen, en zelfs de beste modellen kunnen dat niet met 100% nauwkeurigheid.

Die faalmodus heeft echte gevolgen. Auditors testen nu expliciet door AI gegenereerde werkdocumenten, en bedrijven die vertrouwen op AI-output zonder de conclusies te onderbouwen, te testen en te documenteren, moeten een materiële tekortkoming in hun financiële controles verwachten. Gehallucineerde cijfers in financiële verslaglegging zien er zelden overduidelijk fout uit — een verzonnen totaal van een regelitem telt nog steeds op in een spreadsheet die het model ook heeft gegenereerd. De enige verdediging is meting: weten welk foutpercentage uw tool daadwerkelijk op uw documenten heeft, continu gevolgd.

Er is ook goed nieuws dat het meten waard is. In rechtstreekse tests tegen menselijke factuurbeoordelaars bereikten LLM's tot 92% nauwkeurigheid bij factuurgoedkeuringsbeslissingen, waarmee ze het plafond van 72% van ervaren juristen overtroffen — terwijl ze vele malen sneller en goedkoper werkten. AI kan mensen echt overtreffen bij goed gedefinieerde extractietaken. Het punt van benchmarken is niet om te bewijzen dat AI slecht is; het is om precies te ontdekken waar de uwe goed is, zodat u de onderdelen die het goed doet kunt automatiseren en de onderdelen die het niet goed doet kunt begeleiden.

De drie taken die het waard zijn om te benchmarken

Boekhoud-AI doet veel dingen, maar drie taken dragen het meeste risico en het meeste volume. Benchmark ze afzonderlijk, want een model dat uitblinkt in de ene kan falen in de andere.

1. Factuurextractie

Het halen van gestructureerde velden — leveranciersnaam, factuurnummer, datums, regelitems, subtotalen, btw, totaal, valuta — uit pdf's en scans. Dit is de taak met het hoogste volume en de meest gebenchmarkte: openbare testsets zoals DocILE beoordelen modellen op 55 factuurvelden, en zelfs toonaangevende modellen falen op ongeveer 26% van de velden. Besteed speciale aandacht aan regelitems, btw-inclusieve versus btw-exclusieve totalen en facturen in meerdere valuta, waar fouten zich ophopen.

2. Onkostenclassificatie

Elke transactie toewijzen aan de juiste rekening of categorie — maaltijden versus entertainment, benodigdheden versus apparatuur, betalingen aan aannemers versus loonadministratie. Dit is een beoordelingstaak vermomd als een labelingstaak: het 'juiste' antwoord hangt af van uw rekeningschema en uw fiscale posities, dus nauwkeurigheid wordt hier altijd gemeten aan uw regels, niet aan een universele sleutel. Volg de precisie en recall per categorie, want een model dat over het geheel 98% nauwkeurig is, kan nog steeds elk software-abonnement verkeerd classificeren.

3. Financiële invoer en boeking

Het omzetten van brondocumenten in daadwerkelijke journaalposten — correcte rekeningen, correcte debet/credit-richting, correcte bedragen, correcte perioden. Dit is de taak waar kleine fouten zich opstapelen: een verkeerd geclassificeerde uitgave is één verkeerde cel, maar een verkeerd geboekte post stroomt door naar uw proefbalans, uw jaarrekening en uw belastingaangifte. Benchmark het end-to-end, van document tot geboekte post, niet alleen veld voor veld.

Bouw eerst uw ground-truth-set op

Een benchmark is slechts zo eerlijk als zijn antwoordsleutel. Voordat u een model test, verzamelt u 50 tot 100 echte documenten uit uw eigen workflow en labelt u ze handmatig — zorgvuldig, want elke labelfout wordt later een onterechte mislukking.

Streef naar een realistische mix, niet naar een schone. Een goede ground-truth-set bestaat ongeveer voor tweederde uit gewone documenten en eenderde uit probleemgevallen: scans van lage kwaliteit, handgeschreven aantekeningen op bonnen, facturen van meerdere pagina's, overzichten met tientallen regelitems, creditnota's, anderstalige facturen en documenten van uw rommeligste leveranciers. Een gepubliceerde evaluatie van factuuragenten gebruikte precies deze verdeling — 35 schone en 15 probleemfacturen — en de problemset is waar elk interessant falen zich voordeed.

Label op veldniveau, niet alleen 'goed of fout per document'. Noteer voor elke factuur de leverancier, het factuurnummer, de factuurdatum, de vervaldatum, elk regelitem met aantal en eenheidsprijs, subtotaal, btw-bedrag en totaalbedrag. Noteer voor uitgaven de juiste rekening onder uw huidige rekeningschema. Bewaar de labels in een eenvoudige spreadsheet of JSON-bestand, versiebeheerd naast uw boeken, zodat u dezelfde test opnieuw kunt uitvoeren tegen elk nieuw model of elke promptwijziging. Die versiebeheerde antwoordsleutel is het duurzame bezit; modellen komen en gaan.

Weersta de verleiding om de AI zijn eigen testset te laten labelen. Modelondersteunde labeling is prima voor een eerste concept, maar elk label moet worden geverifieerd door een mens die het tegen het brondocument controleert. Een antwoordsleutel die het model voor zichzelf schreef, is een spiegel, geen meting.

De statistieken die er echt toe doen

Dashboards van leveranciers houden van één enkel kopcijfer. Voor boekhoudwerk heeft u een kleine familie van statistieken nodig, omdat verschillende fouten verschillende kosten met zich meebrengen.

Nauwkeurigheid op veldniveau is uw hoofdstatistiek: van alle velden die u over alle testdocumenten hebt opgevraagd, welk deel kwam exact overeen met de antwoordsleutel? Wees streng — 'bij benadering' telt niet in de boekhouding. Een totaal van € 12.540 is niet € 12.450, en een model dat afrondt, herformatteert of 'behulpzaam' datums corrigeert, is een model dat uw boeken bewerkt zonder toestemming.

Exact-match-percentage is de strengere broer: welk deel van de documenten kwam terug met elk veld correct? Dit is het getal dat uw reviewwerklast voorspelt. Het verschil tussen 82% en 94% veldnauwkeurigheid klinkt bescheiden tot u het vertaalt: bij 82% heeft ongeveer één op de vijf facturen een mens nodig; bij 94% één op de zeventien.

Precisie en recall per veld vertellen u waar de fouten zitten. Precisie vraagt: wanneer het model dit veld invulde, hoe vaak was het dan juist? Recall vraagt: wanneer het veld in het document bestond, hoe vaak vond het model het dan? Lage precisie bij factuurtotalen betekent verzonnen cijfers — gevaarlijk. Lage recall bij regelitems betekent overgeslagen rijen — ook gevaarlijk, maar tenminste zichtbaar. Splits dit uit per veld, want '95% nauwkeurig' kan een model verbergen dat nooit een datum mist en regelmatig btw-bedragen verzint.

Straight-through-rate is de zakelijke statistiek: welk deel van de documenten stroomde van inbox naar geboekte post met nul menselijke aanrakingen? Goed gebouwde productiepijplijnen die OCR combineren met LLM-extractie en deterministische validatie rapporteren ongeveer 77% straight-through met 99% nauwkeurigheid op veldniveau — en, net zo belangrijk, ze weten welke 23% ze naar een mens moeten sturen. Een benchmark die de routeringsbeslissing niet meet, meet slechts de helft van het systeem.

Kosten en latentie per document maken het beeld compleet. Een toonaangevend model dat twee punten hoger scoort maar twintig keer meer per factuur kost, kan de moeite waard zijn voor complexe documenten en onverantwoord voor eenvoudige — maar alleen uw benchmark kan u vertellen waar die grens ligt. Houd euro's per document en seconden per document bij naast nauwkeurigheid, anders optimaliseert u voor een cijfer terwijl uw factuurverwerkingsrekening verdrievoudigt.

Hoe u de test uitvoert

Met een antwoordsleutel en statistieken in de hand is de procedure eenvoudig:

  1. Vries de testset in. Vergrendel uw 50–100 documenten en labels voordat u iets test. Voeg nooit een document toe aan de testset nadat u het model erop hebt zien falen — dat verandert meting in training.
  2. Voer blind uit. Geef het model alleen de ruwe documenten, met dezelfde prompt en instellingen die u in productie gebruikt. Geen hints, geen pogingen opnieuw, geen cherry-picking.
  3. Scoor automatisch. Vergelijk uitvoer met labels veld voor veld met een script, niet door te kijken. Geautomatiseerd scoren is wat hergebruik goedkoop maakt, en hergebruik is het hele punt.
  4. Classificeer elke fout. Bouw een foutentaxonomie terwijl u mislukkingen bekijkt: gehallucineerde velden (verzonnen waarden), verwisselde regelitems, verkeerde leverancier bij overzichten van meerdere leveranciers, verwarring tussen btw-inclusief en btw-exclusief, valutafouten, herinterpretatie van datumformaten, overgeslagen pagina's. Patronen in de taxonomie worden uw verbeterlijst — betere prompts, voorbewerkingsstappen of validatieregels.
  5. Voeg een validatielaag toe en test opnieuw. De best presterende opstellingen combineren de LLM met deterministische controles: tellen regelitems op tot het subtotaal? Is subtotaal plus btw gelijk aan het totaal? Staat de leverancier op de goedgekeurde lijst? Ligt de datum in een open periode? Meet de nauwkeurigheid met en zonder deze waarborgen om te zien wat elke laag u oplevert.
  6. Voer opnieuw uit volgens schema. Modellen veranderen onder u — leveranciers updaten gewichten, schaffen versies af en passen gedrag aan zonder aankondiging. Voer uw benchmark maandelijks opnieuw uit, en elke keer dat u van model, prompt of voorbewerking wisselt. Een benchmark die u één keer hebt uitgevoerd, is een souvenir; een benchmark die u herhaalt, is een controle.

Fouten die benchmarks laten liegen

De meeste zelfgemaakte evaluaties falen op voorspelbare manieren. Vermijd deze vijf:

Testen op vijf schone facturen. Een kleine, nette testset bewijst dat het model nette documenten kan lezen — iets wat u al wist. Als uw testset geen scans, geen handschrift en geen randgevallen heeft, meet uw 100%-score uw testset, niet uw model.

Het model zichzelf laten beoordelen. Scoren met LLM-as-beoordelaar is gemakkelijk en systematisch genereus, vooral bij de eigen output van het model. Als u geautomatiseerde beoordeling gebruikt, controleer dan elke run handmatig een steekproef en gebruik een ander model als beoordelaar dan het geteste model.

De kop scoren en regelitems negeren. Kopvelden (leverancier, datum, totaal) zijn het makkelijke deel. Geld zit verborgen in regelitems — verkeerde aantallen, verwijderde rijen, verkeerd gelezen eenheidsprijzen. Een benchmark die regelitems overslaat, auditeert de envelop en negeert de brief.

OCR-nauwkeurigheid verwarren met extractienauwkeurigheid. Elk woord correct lezen en het juiste getal in het juiste veld plaatsen zijn verschillende vaardigheden. Traditionele OCR kan een pagina perfect transcriberen terwijl het niets begrijpt; een LLM kan de lay-out begrijpen terwijl het een vlekkerig cijfer verkeerd leest. Scoor de gestructureerde output, niet het transcript.

Geen vertrouwensdrempel. Niet elk document verdient automatisering. Het professionele patroon is selectieve voorspelling: het systeem boekt extracties met hoge betrouwbaarheid automatisch en routeert extracties met lage betrouwbaarheid naar een mens. Uw benchmark moet de drempel vinden — de vertrouwensscore waaronder menselijke review meer fouten opvangt dan het kost. Deze stap overslaan betekent kiezen tussen alles reviewen (geen besparing) en alles vertrouwen (de 62%-club).

Wat 'goed genoeg' eruitziet

Benchmarks helpen alleen als u weet wat u met de score moet doen. Denk in niveaus:

  • Onder 85% veldnauwkeurigheid: alleen assistentiemodus. Het model stelt een concept op, een mens verifieert elk veld. Nog steeds sneller dan handmatige invoer, maar vertrouw niets.
  • 85–95%: begeleide automatisering. Boek routinedocumenten van bekende leveranciers automatisch, routeer al het overige — nieuwe leveranciers, grote bedragen, extracties met lage betrouwbaarheid — naar review. Dit is waar de meeste kleine bedrijven zouden moeten opereren.
  • Boven 95% met validatiewaarborgen: straight-through-verwerking voor standaarddocumenten, met steekproefaudits (hercontroleer maandelijks een willekeurige 5–10%) om afwijkingen op te sporen. Zelfs hier: houd harde regels aan — geen automatische boeking boven een dollar-drempel, geen automatische boeking in afgesloten perioden, geen nieuwe leveranciers zonder goedkeuring.

Context doet er enorm toe. Factuurgoedkeuringsbeslissingen met 92% AI-nauwkeurigheid kunnen menselijke beoordelaars met 72% verslaan — maar goedkeuren is een oordeelsbeslissing met een menselijke vangrail, terwijl een verkeerd totaal naar uw grootboek boeken een stille corruptie is. Stem de autonomie af op de omkeerbaarheid: hoe moeilijker een fout ongedaan te maken is, hoe hoger de lat.

Schone boeken maken meten mogelijk

Hier is het deel dat leveranciers overslaan: u kunt onkostenclassificatie niet benchmarken zonder een consistent rekeningschema, en u kunt de nauwkeurigheid van gegevensinvoer niet scoren zonder gereconcilieerde boeken om tegen te vergelijken. De ground-truth-set die uw benchmark nodig heeft, is in wezen een deel van goed onderhouden boeken — consistent gecategoriseerd, volledig gereconcilieerd, versiebeheerd. Bedrijven met gedisciplineerde boekhouding kunnen in een middag een benchmark opbouwen; bedrijven met drie maanden aan niet-gecategoriseerde transacties in een spreadsheet kunnen er helemaal geen opbouwen, omdat er geen antwoordsleutel is.

Dat werkt twee kanten op. Hetzelfde grootboek in platte tekst dat uw financiën auditbaar maakt, maakt uw AI meetbaar: elke rekening gedefinieerd in tekst, elke boeking controleerbaar in een diff, elke correctie traceerbaar. Wanneer het model een classificatie voorstelt, kunt u precies zien welke regel het volgde of overtrad. En visualisatietools die uw grootboek als grafieken weergeven, maken de fouten van het model — en die van uzelf — in één oogopslag zichtbaar; het Fava-dashboard dat bij Beancount wordt geleverd, zet grootboekposten om in balans- en uitgavenweergaven die u elke maand kunt bekijken. Als u AI uw boeken laat aanraken, houd die boeken dan in een formaat dat u daadwerkelijk kunt inspecteren.

Meet voordat u vertrouwt

AI-adoptie in de boekhouding is geen vraag meer — met bijna negen op de tien boekhoudprofessionals die het voor klantwerk gebruiken en een verdubbelend gebruik jaar op jaar in belastingonderzoek, is de vraag of u meet wat het voor u doet. Een weekend besteed aan het opbouwen van een benchmark van 50 documenten levert u iets op dat geen enkele demo van een leverancier kan: kennis van het werkelijke foutpercentage van uw tool, op uw documenten, met uw regels — plus een herbruikbare controle die afwijkingen opvangt voordat die uw klanten of uw belastingaangifte bereikt.

Begin klein: pak vijftig facturen, label ze met de hand, scoor uw huidige tool en classificeer wat het fout doet. Wat het getal ook is, het weten plaatst u vóór op de 60% van de auditafdelingen die AI zonder enige strategie draaien. De bedrijven die floreren met boekhoud-AI zijn niet degenen die het het meest vertrouwden — het zijn degenen die het het eerst maten.

Houd uw AI-gecontroleerde boeken in platte tekst

Terwijl u AI-tools voor facturatie en onkostentracking benchmarkt en adopteert, blijft het onderhouden van duidelijke financiële administraties die u kunt inspecteren essentieel — een antwoordsleutel die u niet kunt lezen, is helemaal geen antwoordsleutel. Beancount.io biedt boekhouding in platte tekst die u volledige transparantie en controle over uw financiële gegevens geeft — geen black boxes, geen leverancierslock-in. Begin gratis en ontdek waarom ontwikkelaars en financiële professionals overstappen op boekhouding in platte tekst.

Dit artikel delen

Bron: https://beancount.io/nl/blog/2026/09/15/ai-benchmarking-accounting-llm-accuracy-invoice-expense-guide

Gepubliceerd: 15 september 2026