Salta al contenuto principale

#compliance

Compliance

Regulatory compliance, policy enforcement, and audit trail research for financial AI systems

FinToolBench: Valutare gli Agenti LLM sull'Uso Reale di Strumenti Finanziari

FinToolBench abbina 760 API finanziarie in tempo reale a 295 query eseguibili per valutare gli agenti LLM su compiti finanziari reali — rivelando che il tasso di invocazione conservativo del 22,7% di GPT-4o produce una qualità delle risposte superiore (CSS 0,670) rispetto al TIR aggressivo dell'87,1% di Qwen3-8B, mentre la mancata corrispondenza dell'intento supera il 50% in ogni modello testato.

FinAuditing: i LLM ottengono meno del 14% su compiti reali di revisione XBRL della SEC

FinAuditing testa 13 LLM in modalità zero-shot su 1.102 istanze reali di depositi XBRL della SEC; i punteggi migliori sono 13,86% sulla verifica matematica finanziaria e 12,42% sul recupero di concetti—risultati che delimitano direttamente ciò che gli strumenti di contabilità AI possono essere autorizzati ad automatizzare senza strumentazione esterna.

AGrail: Barriere di Sicurezza Adattive per Agenti LLM che Imparano tra Attività Diverse

AGrail (ACL 2025) introduce una barriera di sicurezza cooperativa a due LLM che adatta i controlli di sicurezza al momento dell'inferenza tramite adattamento al test, raggiungendo uno 0% di successo negli attacchi di iniezione di prompt e il 95,6% di preservazione delle azioni benigne su Safe-OS — rispetto a GuardAgent e LLaMA-Guard che bloccano fino al 49,2% delle azioni legittime.

AuditCopilot: LLM per il Rilevamento di Frodi nella Contabilità in Partita Doppia

AuditCopilot applica LLM open-source (Mistral-8B, Gemma, Llama-3.1) al rilevamento di frodi nelle registrazioni contabili aziendali, riducendo i falsi positivi da 942 a 12 — ma l'analisi di ablazione rivela che l'LLM funziona principalmente come livello di sintesi basato sui punteggi di Isolation Forest, non come rilevatore di anomalie indipendente.

Intelligenza Artificiale Costituzionale per Agenti Contabili: RLAIF, Regole Politiche e Rischi di Goodharting

Il paper sull'IA Costituzionale di Anthropic (Bai et al., 2022) addestra LLM a seguire regole utilizzando feedback generato da AI invece di etichette di danno umane. Questo report di ricerca esamina come il ciclo critica-revisione-preferenza di RLAIF si mappi sulla sicurezza in scrittura per agenti autonomi del registro Beancount — e come appaiano Goodharting, errori di calibrazione e rischi a duplice uso quando la 'costituzione' è un piano dei conti anziché un insieme di regole etiche.