
LLM's scoren 2,3% op Beancount DSL-generatie: De LLMFinLiteracy-benchmark
LLMFinLiteracy vindt dat vijf ~7B-modellen slechts 2,3% van de tijd correcte Beancount-transacties schrijven, falend op boekhoudkundig redeneren, niet op syntaxis.
#transaction-validation
Valideren en verifiëren van financiële transacties met taalmo-delagenten

LLMFinLiteracy vindt dat vijf ~7B-modellen slechts 2,3% van de tijd correcte Beancount-transacties schrijven, falend op boekhoudkundig redeneren, niet op syntaxis.

GuardAgent dwingt beleid voor LLM-agents af door Python-code uit te voeren, met 98,7% nauwkeurigheid zonder taakfouten, tegen 81% en tot 71% fouten bij promptregels.

Multiagent-debat won 14,8 punten op rekenwerk, maar single agents met gelijk budget evenaren het. Dat beperkt debat als veilige controle vóór een ledger-commit.

CRITIC verhoogt open-domain QA met 7,7 F1 en verlaagt toxiciteit met 79,2% door LLM-revisies te verifiëren tegen externe tools, niet tegen zichzelf.