
LLM 에이전트를 위한 검증 가능한 안전한 도구 사용: STPA와 MCP의 만남
STPA와 역량 강화 MCP는 LLM 도구 사용에 대한 형식적 안전 명세를 산출하며, Alloy는 캘린더 사례 연구에서 안전하지 않은 흐름이 없음을 증명한다.
#security
금융 맥락에서 AI 에이전트의 안전성, 보안 및 가드레일 연구

STPA와 역량 강화 MCP는 LLM 도구 사용에 대한 형식적 안전 명세를 산출하며, Alloy는 캘린더 사례 연구에서 안전하지 않은 흐름이 없음을 증명한다.

AGrail의 두 LLM 가드레일은 Safe-OS에서 프롬프트 주입 공격 성공률을 0%로 낮추면서 정상 에이전트 행동의 95.6%를 보존한다.

ShieldAgent는 LLM 가드레일 대신 확률적 규칙 회로를 사용해 API 호출을 64.7% 줄이면서 에이전트 공격에서 90.4% 정확도를 기록한다.

GuardAgent는 Python 코드를 실행해 LLM 에이전트 정책을 시행하여 작업 실패 없이 98.7% 정확도를 기록한 반면, 프롬프트 규칙은 81%에 최대 71% 실패율을 보였다.