
FinToolBench: Avaluació d'agents LLM en l'ús d'eines financeres del món real
FinToolBench troba un desajust d'intenció superior al 50% en tots els LLM provats, així que cridar eines agressivament no dona millors respostes en tasques financeres.
#compliance
Recerca en compliment normatiu, aplicació de polítiques i pistes d'auditoria per a sistemes d'IA financera

FinToolBench troba un desajust d'intenció superior al 50% en tots els LLM provats, així que cridar eines agressivament no dona millors respostes en tasques financeres.

STPA més un MCP amb capacitats ampliades dona especificacions formals de seguretat per a eines LLM, i Alloy prova que no hi ha fluxos insegurs en un cas de calendari.

FinAuditing mostra que els millors LLM només arriben al 13,86% en verificar càlculs de registres XBRL reals de la SEC, cosa que limita l'automatització sense ajuda.

La barrera de dos LLM d'AGrail redueix l'èxit dels atacs d'injecció de prompts a un 0%, tot preservant el 95,6% d'accions benignes d'agents a Safe-OS.

ShieldAgent assoleix un 90,4% de precisió en atacs d'agents amb un 64,7% menys de crides a l'API gràcies a circuits de regles probabilístics en lloc de guardrails LLM.

AuditCopilot redueix els falsos positius de frau en assentaments de 942 a 12, però l'ablació mostra que el LLM principalment sintetitza puntuacions d'Isolation Forest.

La IA constitucional canvia les dades de danys etiquetades a mà per retroalimentació de la IA: els agents comptables apliquen regles del llibre sense un revisor per transacció.