
FinToolBench: Evaluando Agentes LLM en el Uso de Herramientas Financieras del Mundo Real
FinToolBench halla un desajuste de intención superior al 50% en todos los LLM probados, así que llamar más herramientas no mejora las respuestas financieras.
#compliance
Investigación sobre cumplimiento normativo, aplicación de políticas y pistas de auditoría para sistemas de IA financiera

FinToolBench halla un desajuste de intención superior al 50% en todos los LLM probados, así que llamar más herramientas no mejora las respuestas financieras.

STPA más MCP con capacidades mejoradas da especificaciones formales de seguridad para herramientas LLM, con Alloy probando flujos seguros.

FinAuditing muestra que los mejores LLM logran solo 13.86% en verificación matemática financiera de presentaciones XBRL reales de la SEC.

El guardarraíl de dos LLM de AGrail reduce el éxito de ataques de inyección de prompts a 0% y conserva el 95.6% de acciones benignas en Safe-OS.

ShieldAgent alcanza 90.4% de precisión en ataques a agentes con 64.7% menos llamadas a API usando circuitos de reglas probabilísticos en vez de guardarraíles LLM.

AuditCopilot baja los falsos positivos de fraude en asientos de 942 a 12, pero la ablación muestra que el LLM sobre todo sintetiza puntuaciones de Isolation Forest.

La IA constitucional cambia datos de daño etiquetados a mano por retroalimentación de IA, así los agentes contables aplican reglas del libro sin un revisor por transacción.