#transaction-validation
Transaction Validation
Validating and verifying financial transactions using language model agents
Gli LLM Ottengono il 2,3% sulla Generazione di DSL Beancount: Il Benchmark LLMFinLiteracy
Il benchmark LLMFinLiteracy rileva che cinque modelli open-weight da circa 7B generano transazioni Beancount completamente corrette solo nel 2,3% dei casi, con errori concentrati nel ragionamento contabile—non nella sintassi—indicando il feedback compiler-in-the-loop come ingrediente critico mancante per agenti di write-back affidabili.
GuardAgent: Applicazione Deterministica della Sicurezza per Agenti LLM tramite Esecuzione di Codice
GuardAgent (ICML 2025) posiziona un agente LLM separato tra un agente target e il suo ambiente, verificando ogni azione proposta generando ed eseguendo codice Python — raggiungendo il 98,7% di accuratezza nell'applicazione delle policy, preservando al contempo il 100% del completamento delle attività, contro l'81% di accuratezza e il 29-71% di fallimento nelle attività per le regole di sicurezza incorporate nel prompt.
Dibattito Multiagente con LLM: Veri Guadagni di Accuratezza, Calcolo Incontrollato e Delirio Collettivo
Un'analisi approfondita del paper di Du et al. su ICML 2024 sul dibattito multiagente — che riporta guadagni di accuratezza del 14,8% su operazioni aritmetiche — insieme alle confutazioni del 2025 che mostrano come agenti singoli con pari budget eguaglino le performance del dibattito, e un'analisi del perché il Delirio Collettivo (65% dei fallimenti del dibattito) rappresenti un rischio specifico per le registrazioni contabili assistite da IA.
CRITIC: Perché l'Autocorrezione degli LLM Richiede Feedback Esterno dagli Strumenti
CRITIC (ICLR 2024) ottiene un guadagno di 7,7 F1 nel QA su dominio aperto e una riduzione della tossicità del 79,2% ancorando la revisione dell'LLM ai segnali di strumenti esterni — un ciclo di verifica-e-correzione che si mappa direttamente sulla sicurezza di scrittura per agenti finanziari Beancount.