Salta al contenuto principale

#security

Security

Safety, security, and guardrail research for AI agents in financial contexts

Uso Sicuro e Verificabile degli Strumenti per Agenti LLM: STPA incontra MCP
·mike

Uso Sicuro e Verificabile degli Strumenti per Agenti LLM: STPA incontra MCP

Ricercatori di CMU e NC State propongono l'uso dell'Analisi Sistemico-Teoretica dei Processi (STPA) e un Model Context Protocol potenziato per derivare specifiche di sicurezza formali per l'uso di strumenti da parte di agenti LLM, con verifica basata su Alloy che dimostra l'assenza di flussi non sicuri in un caso di studio sulla pianificazione di calendari.

ai
llm
security
AGrail: Barriere di Sicurezza Adattive per Agenti LLM che Imparano tra Attività Diverse
·mike

AGrail: Barriere di Sicurezza Adattive per Agenti LLM che Imparano tra Attività Diverse

AGrail (ACL 2025) introduce una barriera di sicurezza cooperativa a due LLM che adatta i controlli di sicurezza al momento dell'inferenza tramite adattamento al test, raggiungendo uno 0% di successo negli attacchi di iniezione di prompt e il 95,6% di preservazione delle azioni benigne su Safe-OS — rispetto a GuardAgent e LLaMA-Guard che bloccano fino al 49,2% delle azioni legittime.

ai
llm
security
ShieldAgent: Ragionamento Verificabile sulla Sicurezza delle Policy per Agenti LLM
·mike

ShieldAgent: Ragionamento Verificabile sulla Sicurezza delle Policy per Agenti LLM

ShieldAgent (ICML 2025) sostituisce i guardrail basati su LLM con circuiti di regole probabilistiche costruiti su Reti Logiche Markov, raggiungendo il 90.4% di accuratezza sugli attacchi agli agenti con il 64.7% in meno di chiamate API — e cosa significa per la sicurezza verificabile nei sistemi AI finanziari.

ai
llm
machine-learning
GuardAgent: Applicazione Deterministica della Sicurezza per Agenti LLM tramite Esecuzione di Codice
·mike

GuardAgent: Applicazione Deterministica della Sicurezza per Agenti LLM tramite Esecuzione di Codice

GuardAgent (ICML 2025) posiziona un agente LLM separato tra un agente target e il suo ambiente, verificando ogni azione proposta generando ed eseguendo codice Python — raggiungendo il 98,7% di accuratezza nell'applicazione delle policy, preservando al contempo il 100% del completamento delle attività, contro l'81% di accuratezza e il 29-71% di fallimento nelle attività per le regole di sicurezza incorporate nel prompt.

ai
llm
automation