
DIN-SQL: GPT-4 stijgt van 67,4% naar 85,3% EX op Spider
DIN-SQL tilt GPT-4 van 67,4% naar 85,3% Spider-uitvoeringsnauwkeurigheid via schema-link en zelfcorrectiefasen—dezelfde decompositie past op Beancount BQL.

DIN-SQL tilt GPT-4 van 67,4% naar 85,3% Spider-uitvoeringsnauwkeurigheid via schema-link en zelfcorrectiefasen—dezelfde decompositie past op Beancount BQL.

Op BIRD bereikt GPT-4 54,89% uitvoeringsnauwkeurigheid met domeinhints en 34,88% zonder—een kloof van 20 punten die elke Beancount NL→BQL-interface moet dichten.

Onderzoekers van CMU en NC State stellen het gebruik voor van System-Theoretic Process Analysis (STPA) en een voor capaciteiten uitgebreid Model Context Protocol om formele veiligheidsspecificaties af te leiden voor het toolgebruik door LLM-agenten, waarbij Alloy-gebaseerde verificatie de afwezigheid van onveilige stromen aantoont in een casestudy over agendaplanning.

Microsofts GraphRAG boekt 72–83% winst in begripsvorming ten opzichte van vector-RAG; een audit uit 2025 doet die in elkaar storten na correctie van beoordelaarsbias—een waarschuwing voor multi-document grootboek-QA.

FinAuditing test 13 LLM's zero-shot op 1.102 echte SEC XBRL-indieningen; de hoogste scores zijn 13,86% op financiële wiskundige verificatie en 12,42% op concept-retrieval—resultaten die direct de grenzen aangeven van wat AI-boekhoudtools betrouwbaar kunnen automatiseren zonder externe hulpmiddelen.

InvestorBench: Qwen2.5-72B leidt in aandelenhandel met 46,15% CR; op financiën afgestemde Palmyra-Fin werkt averechts op aandelen—grootte verslaat domein-finetuning.

StructRAG (ICLR 2025) stuurt elke zoekopdracht naar een taakgeschikt structuurtype — tabel, graaf, catalogus, algoritme of chunk — alvorens te redeneren. Het scoort 28 punten hoger dan GraphRAG op de Loong-benchmark terwijl het 22× sneller draait, waarbij de met DPO getrainde router alleen al verantwoordelijk is voor een nauwkeurigheidswinst van 15 punten.

Bij gelijke budgets voor denk-tokens presteren single-agent LLM's even goed als of beter dan multi-agent-systemen bij multi-hop-redenering—kies voor eenvoudigere financiële agentontwerpen.

M3MAD-Bench onderwerpt debatten tussen meerdere agenten aan een stresstest over 9 modellen, 5 domeinen en vision-language-omgevingen. De bevindingen tonen aan dat collectieve waan de oorzaak is van 65% van de fouten, dat tegenstrijdige debatten de nauwkeurigheid met wel 12,8% verlagen en dat zelfconsistentie doorgaans de nauwkeurigheid van debatten evenaart tegen lagere tokenkosten.

AGrail (ACL 2025) introduceert een coöperatieve waarborg met twee LLM's die veiligheidscontroles tijdens inferentie aanpast via test-time adaptatie, met een succespercentage van 0% voor prompt-injectie-aanvallen en 95,6% behoud van legitieme acties op Safe-OS — vergeleken met GuardAgent en LLaMA-Guard die tot 49,2% van de legitieme acties blokkeren.

ShieldAgent (ICML 2025) vervangt op LLM gebaseerde guardrails door probabilistische regelcircuits gebouwd op Markov Logic Networks, waarmee een nauwkeurigheid van 90,4% op agent-aanvallen wordt behaald met 64,7% minder API-oproepen — en wat dit betekent voor verifieerbare veiligheid in financiële AI-systemen.

Atlas (JMLR 2023) behaalt een nauwkeurigheid van 42,4% op Natural Questions met slechts 64 trainingsvoorbeelden—3 punten beter dan PaLM 540B met 11 miljard parameters—door een op Contriever gebaseerde dense retriever gezamenlijk voor te trainen met een T5 Fusion-in-Decoder reader. De analyse behandelt de limieten van retrieval-nauwkeurigheid, infrastructuurkosten voor een index van 587 GB en de implicaties voor QA-systemen voor Beancount-grootboeken.