
FinToolBench: LLM-agenten evalueren op realistisch financieel toolgebruik
FinToolBench vindt intentie-mismatch boven 50% bij elke geteste LLM, dus agressief tools aanroepen betekent niet betere antwoorden op financiële taken.
#compliance
Onderzoek naar regelgeving, beleidshandhaving en audit trails voor financiële AI-systemen

FinToolBench vindt intentie-mismatch boven 50% bij elke geteste LLM, dus agressief tools aanroepen betekent niet betere antwoorden op financiële taken.

STPA plus capability-enhanced MCP levert formele veiligheidsspecificaties voor LLM-toolgebruik; Alloy bewijst geen onveilige flows in een kalender-casestudy.

FinAuditing toont dat top-LLM's slechts 13,86% halen op financiële wiskundeverificatie van echte SEC XBRL-documenten, wat AI-boekhoudtools zelfstandig aankunnen.

De twee-LLM-guardrail van AGrail verlaagt het succes van prompt-injectieaanvallen naar 0% terwijl 95,6% van goedaardige agentacties op Safe-OS behouden blijft.

ShieldAgent bereikt 90,4% nauwkeurigheid bij agent-aanvallen met 64,7% minder API-calls door probabilistische regelcircuits te gebruiken in plaats van LLM-guardrails.

AuditCopilot verlaagt false positives bij fraude met journaalposten van 942 naar 12, maar ablatie toont dat de LLM vooral Isolation Forest-scores synthetiseert.

Constitutional AI vervangt handmatig gelabelde schadedata door AI-feedback, zodat accounting-agents grootboekregels kunnen handhaven zonder reviewer per transactie.