Salta al contenuto principale

#compliance

Compliance

Regulatory compliance, policy enforcement, and audit trail research for financial AI systems

FinToolBench: Valutazione degli agenti LLM sull'uso di strumenti finanziari in scenari reali
·mike

FinToolBench: Valutazione degli agenti LLM sull'uso di strumenti finanziari in scenari reali

FinToolBench combina 760 strumenti finanziari API attivi con 295 query eseguibili per testare gli agenti LLM su compiti finanziari reali — rivelando che la frequenza di chiamata conservativa di GPT-4o del 22,7% garantisce una qualità delle risposte superiore (CSS 0,670) rispetto al TIR aggressivo di Qwen3-8B all'87,1%, mentre il disallineamento delle intenzioni supera il 50% in tutti i modelli testati.

ai
llm
automation
Uso Sicuro e Verificabile degli Strumenti per Agenti LLM: STPA incontra MCP
·mike

Uso Sicuro e Verificabile degli Strumenti per Agenti LLM: STPA incontra MCP

Ricercatori di CMU e NC State propongono l'uso dell'Analisi Sistemico-Teoretica dei Processi (STPA) e un Model Context Protocol potenziato per derivare specifiche di sicurezza formali per l'uso di strumenti da parte di agenti LLM, con verifica basata su Alloy che dimostra l'assenza di flussi non sicuri in un caso di studio sulla pianificazione di calendari.

ai
llm
security
FinAuditing: i LLM ottengono meno del 14% su compiti reali di revisione XBRL della SEC
·mike

FinAuditing: i LLM ottengono meno del 14% su compiti reali di revisione XBRL della SEC

FinAuditing testa 13 LLM in modalità zero-shot su 1.102 istanze reali di depositi XBRL della SEC; i punteggi migliori sono 13,86% sulla verifica matematica finanziaria e 12,42% sul recupero di concetti—risultati che delimitano direttamente ciò che gli strumenti di contabilità AI possono essere autorizzati ad automatizzare senza strumentazione esterna.

llm
ai
financial-reporting
AGrail: Barriere di Sicurezza Adattive per Agenti LLM che Imparano tra Attività Diverse
·mike

AGrail: Barriere di Sicurezza Adattive per Agenti LLM che Imparano tra Attività Diverse

AGrail (ACL 2025) introduce una barriera di sicurezza cooperativa a due LLM che adatta i controlli di sicurezza al momento dell'inferenza tramite adattamento al test, raggiungendo uno 0% di successo negli attacchi di iniezione di prompt e il 95,6% di preservazione delle azioni benigne su Safe-OS — rispetto a GuardAgent e LLaMA-Guard che bloccano fino al 49,2% delle azioni legittime.

ai
llm
security
ShieldAgent: Ragionamento Verificabile sulla Sicurezza delle Policy per Agenti LLM
·mike

ShieldAgent: Ragionamento Verificabile sulla Sicurezza delle Policy per Agenti LLM

ShieldAgent (ICML 2025) sostituisce i guardrail basati su LLM con circuiti di regole probabilistiche costruiti su Reti Logiche Markov, raggiungendo il 90.4% di accuratezza sugli attacchi agli agenti con il 64.7% in meno di chiamate API — e cosa significa per la sicurezza verificabile nei sistemi AI finanziari.

ai
llm
machine-learning
AuditCopilot: LLM per il Rilevamento di Frodi nella Contabilità in Partita Doppia
·mike

AuditCopilot: LLM per il Rilevamento di Frodi nella Contabilità in Partita Doppia

AuditCopilot applica LLM open-source (Mistral-8B, Gemma, Llama-3.1) al rilevamento di frodi nelle registrazioni contabili aziendali, riducendo i falsi positivi da 942 a 12 — ma l'analisi di ablazione rivela che l'LLM funziona principalmente come livello di sintesi basato sui punteggi di Isolation Forest, non come rilevatore di anomalie indipendente.

fraud-detection
llm
double-entry
Intelligenza Artificiale Costituzionale per Agenti Contabili: RLAIF, Regole Politiche e Rischi di Goodharting
·mike

Intelligenza Artificiale Costituzionale per Agenti Contabili: RLAIF, Regole Politiche e Rischi di Goodharting

Il paper sull'IA Costituzionale di Anthropic (Bai et al., 2022) addestra LLM a seguire regole utilizzando feedback generato da AI invece di etichette di danno umane. Questo report di ricerca esamina come il ciclo critica-revisione-preferenza di RLAIF si mappi sulla sicurezza in scrittura per agenti autonomi del registro Beancount — e come appaiano Goodharting, errori di calibrazione e rischi a duplice uso quando la 'costituzione' è un piano dei conti anziché un insieme di regole etiche.

ai
machine-learning
llm