
Verifizierbar sichere Tool-Nutzung für LLM-Agenten: STPA trifft auf MCP
STPA plus fähigkeitserweitertes MCP liefert formale Sicherheitsspezifikationen für LLM-Tool-Nutzung, mit Alloy-Beweis für keine unsicheren Flüsse in einer Kalender-Fallstudie.
#security
Sicherheits-, Schutz- und Guardrail-Forschung für KI-Agenten im Finanzkontext

STPA plus fähigkeitserweitertes MCP liefert formale Sicherheitsspezifikationen für LLM-Tool-Nutzung, mit Alloy-Beweis für keine unsicheren Flüsse in einer Kalender-Fallstudie.

AGrails Zwei-LLM-Guardrail senkt den Erfolg von Prompt-Injection-Angriffen auf 0% und bewahrt 95,6% gutartiger Agentenaktionen auf Safe-OS.

ShieldAgent erreicht 90,4 % Genauigkeit bei Agenten-Angriffen mit 64,7 % weniger API-Aufrufen durch probabilistische Regelkreise statt LLM-Guardrails.

GuardAgent erzwingt LLM-Agenten-Richtlinien per Python-Code und erreicht 98,7 % Genauigkeit ohne Aufgabenfehler, gegenüber 81 % und bis zu 71 % Fehlern bei Prompt-Regeln.