
LLMエージェントのための検証可能な安全なツール利用:STPAとMCPの融合
STPAと能力強化されたMCPはLLMツール利用の形式的な安全性仕様を生み出し、カレンダーのケーススタディでAlloyが安全でないフローがないことを証明する。
#security

STPAと能力強化されたMCPはLLMツール利用の形式的な安全性仕様を生み出し、カレンダーのケーススタディでAlloyが安全でないフローがないことを証明する。

AGrailの2-LLMガードレールはSafe-OS上でプロンプトインジェクション攻撃成功率を0%に削減しつつ、良性のエージェント行動を95.6%維持する。

ShieldAgentはLLMガードレールの代わりに確率的ルール回路を用いて、エージェント攻撃で90.4%の精度を達成し、API呼び出しを64.7%削減する。

GuardAgentはPythonコードを実行してLLMエージェントのポリシーを施行し、タスク失敗なしで98.7%の精度を達成する。プロンプトルールでは81%で最大71%が失敗する。