
Overiteľne bezpečné používanie nástrojov pre LLM agentov: STPA sa stretáva s MCP
STPA a MCP s rozšírenými schopnosťami prinášajú formálne bezpečnostné špecifikácie pre nástroje LLM; Alloy v štúdii kalendára dokazuje, že neexistujú nebezpečné toky.
#security
Výskum bezpečnosti, zabezpečenia a guardrails pre AI agentov vo finančných kontextoch

STPA a MCP s rozšírenými schopnosťami prinášajú formálne bezpečnostné špecifikácie pre nástroje LLM; Alloy v štúdii kalendára dokazuje, že neexistujú nebezpečné toky.

Dvoj-LLM ochranný mantinel AGrail znižuje úspešnosť útokov prompt injection na 0 % a zároveň zachováva 95,6 % neškodných akcií agenta na Safe-OS.

ShieldAgent dosahuje 90,4 % presnosť pri útokoch na agentov s o 64,7 % menším počtom volaní API vďaka pravdepodobnostným pravidlovým obvodom namiesto LLM ochranných mantinelov.

GuardAgent presadzuje pravidlá LLM agentov spúšťaním kódu v Pythone, dosahuje 98,7 % presnosť bez zlyhaní úloh, oproti 81 % a až 71 % zlyhaní pri pravidlách v prompte.