#trust
Trust
Reliability, calibration, and hallucination in financial AI systems
Confidenza e Calibrazione degli LLM: Una Rassegna su Quanto Mostra Realmente la Ricerca
Una rassegna sistematica dei metodi di stima della confidenza e calibrazione degli LLM—approcci white-box basati su logit, SelfCheckGPT basato sulla consistenza ed entropia semantica—rivela che i punteggi di confidenza verbalizzata di GPT-4 raggiungono solo circa il 62,7% di AUROC, appena sopra il caso, con implicazioni dirette per l'implementazione di agenti sensibili all'incertezza nella finanza e nella contabilità.
Rinvio Consapevole dell'Incertezza per Agenti LLM: Quando Scalare da Modelli Piccoli a Grandi
ReDAct esegue un modello piccolo per impostazione predefinita e scala a un modello costoso solo quando la perplessità a livello di token segnala incertezza, ottenendo un risparmio del 64% rispetto al solo GPT-5.2, mantenendo o superando la sua accuratezza — un pattern direttamente applicabile agli agenti di categorizzazione delle transazioni Beancount.
Uso Sicuro e Verificabile degli Strumenti per Agenti LLM: STPA incontra MCP
Ricercatori di CMU e NC State propongono l'uso dell'Analisi Sistemico-Teoretica dei Processi (STPA) e un Model Context Protocol potenziato per derivare specifiche di sicurezza formali per l'uso di strumenti da parte di agenti LLM, con verifica basata su Alloy che dimostra l'assenza di flussi non sicuri in un caso di studio sulla pianificazione di calendari.
AGrail: Barriere di Sicurezza Adattive per Agenti LLM che Imparano tra Attività Diverse
AGrail (ACL 2025) introduce una barriera di sicurezza cooperativa a due LLM che adatta i controlli di sicurezza al momento dell'inferenza tramite adattamento al test, raggiungendo uno 0% di successo negli attacchi di iniezione di prompt e il 95,6% di preservazione delle azioni benigne su Safe-OS — rispetto a GuardAgent e LLaMA-Guard che bloccano fino al 49,2% delle azioni legittime.
ShieldAgent: Ragionamento Verificabile sulla Sicurezza delle Policy per Agenti LLM
ShieldAgent (ICML 2025) sostituisce i guardrail basati su LLM con circuiti di regole probabilistiche costruiti su Reti Logiche Markov, raggiungendo il 90.4% di accuratezza sugli attacchi agli agenti con il 64.7% in meno di chiamate API — e cosa significa per la sicurezza verificabile nei sistemi AI finanziari.
GuardAgent: Applicazione Deterministica della Sicurezza per Agenti LLM tramite Esecuzione di Codice
GuardAgent (ICML 2025) posiziona un agente LLM separato tra un agente target e il suo ambiente, verificando ogni azione proposta generando ed eseguendo codice Python — raggiungendo il 98,7% di accuratezza nell'applicazione delle policy, preservando al contempo il 100% del completamento delle attività, contro l'81% di accuratezza e il 29-71% di fallimento nelle attività per le regole di sicurezza incorporate nel prompt.
I LLM non possono ancora autocorreggere il ragionamento — Risultati ICLR 2024 e implicazioni per la finanza AI
Huang et al. (ICLR 2024) mostrano che i LLM a cui viene chiesto di rivedere il proprio ragionamento senza feedback esterno degradano costantemente l'accuratezza — GPT-4 scende dal 95,5% al 91,5% su GSM8K — e cosa questo significa per progettare agenti affidabili per le registrazioni contabili in Beancount.
PHANTOM (NeurIPS 2025): Misurazione del Rilevamento di Allucinazioni negli LLM in Documenti Finanziari
PHANTOM (NeurIPS 2025) è il primo benchmark a misurare il rilevamento di allucinazioni negli LLM su reali depositi SEC per contesti di lunghezza fino a 30.000 token. Qwen3-30B-A3B-Thinking è leader con F1=0,882; i modelli da 7B ottengono punteggi vicini a una scelta casuale — con implicazioni dirette per agenti contabili autonomi.