
Uso de herramientas verificablemente seguro para agentes de LLM: STPA se encuentra con MCP
STPA más MCP con capacidades mejoradas da especificaciones formales de seguridad para herramientas LLM, con Alloy probando flujos seguros.
#security
Investigación sobre seguridad y barreras de protección para agentes de IA en contextos financieros

STPA más MCP con capacidades mejoradas da especificaciones formales de seguridad para herramientas LLM, con Alloy probando flujos seguros.

El guardarraíl de dos LLM de AGrail reduce el éxito de ataques de inyección de prompts a 0% y conserva el 95.6% de acciones benignas en Safe-OS.

ShieldAgent alcanza 90.4% de precisión en ataques a agentes con 64.7% menos llamadas a API usando circuitos de reglas probabilísticos en vez de guardarraíles LLM.

GuardAgent aplica políticas de agentes LLM ejecutando código Python, con 98.7% de exactitud y sin fallos de tarea, frente a 81% y hasta 71% de fallos con reglas en el prompt.