
Verifieerbaar Veilig Toolgebruik voor LLM-agenten: STPA ontmoet MCP
STPA plus capability-enhanced MCP levert formele veiligheidsspecificaties voor LLM-toolgebruik; Alloy bewijst geen onveilige flows in een kalender-casestudy.
#security
Onderzoek naar veiligheid, beveiliging en guardrails voor AI-agenten in financiële contexten

STPA plus capability-enhanced MCP levert formele veiligheidsspecificaties voor LLM-toolgebruik; Alloy bewijst geen onveilige flows in een kalender-casestudy.

De twee-LLM-guardrail van AGrail verlaagt het succes van prompt-injectieaanvallen naar 0% terwijl 95,6% van goedaardige agentacties op Safe-OS behouden blijft.

ShieldAgent bereikt 90,4% nauwkeurigheid bij agent-aanvallen met 64,7% minder API-calls door probabilistische regelcircuits te gebruiken in plaats van LLM-guardrails.

GuardAgent dwingt beleid voor LLM-agents af door Python-code uit te voeren, met 98,7% nauwkeurigheid zonder taakfouten, tegen 81% en tot 71% fouten bij promptregels.