GuardAgent: Applicazione Deterministica della Sicurezza per Agenti LLM tramite Esecuzione di Codice
GuardAgent (ICML 2025) posiziona un agente LLM separato tra un agente target e il suo ambiente, verificando ogni azione proposta generando ed eseguendo codice Python — raggiungendo il 98,7% di accuratezza nell'applicazione delle policy, preservando al contempo il 100% del completamento delle attività, contro l'81% di accuratezza e il 29-71% di fallimento nelle attività per le regole di sicurezza incorporate nel prompt.