
FinToolBench: Bewertung von LLM-Agenten bei der realen Nutzung von Finanztools
FinToolBench findet Intent-Mismatch über 50% bei jedem getesteten LLM, aggressives Tool-Calling bedeutet also nicht bessere Antworten bei Finanzaufgaben.
#compliance
Regulatorische Compliance, Richtliniendurchsetzung und Audit-Trail-Forschung für finanzielle KI-Systeme

FinToolBench findet Intent-Mismatch über 50% bei jedem getesteten LLM, aggressives Tool-Calling bedeutet also nicht bessere Antworten bei Finanzaufgaben.

STPA plus fähigkeitserweitertes MCP liefert formale Sicherheitsspezifikationen für LLM-Tool-Nutzung, mit Alloy-Beweis für keine unsicheren Flüsse in einer Kalender-Fallstudie.

FinAuditing zeigt: Top-LLMs erreichen nur 13,86% bei der Finanzmathematik-Prüfung echter SEC-XBRL-Einreichungen und begrenzen so die KI-Buchhaltung ohne Hilfe.

AGrails Zwei-LLM-Guardrail senkt den Erfolg von Prompt-Injection-Angriffen auf 0% und bewahrt 95,6% gutartiger Agentenaktionen auf Safe-OS.

ShieldAgent erreicht 90,4 % Genauigkeit bei Agenten-Angriffen mit 64,7 % weniger API-Aufrufen durch probabilistische Regelkreise statt LLM-Guardrails.

AuditCopilot senkt Falschpositive bei Buchungsbetrug von 942 auf 12, doch die Ablation zeigt, dass das LLM hauptsächlich Isolation-Forest-Scores synthetisiert.

Constitutional AI ersetzt handgelabelte Schadensdaten durch KI-Feedback, sodass Accounting-Agenten Ledger-Regeln durchsetzen können, ohne Prüfer pro Transaktion.