Mike Thrift
Marketing Manager
GuardAgent: Applicazione Deterministica della Sicurezza per Agenti LLM tramite Esecuzione di Codice
GuardAgent (ICML 2025) posiziona un agente LLM separato tra un agente target e il suo ambiente, verificando ogni azione proposta generando ed eseguendo codice Python — raggiungendo il 98,7% di accuratezza nell'applicazione delle policy, preservando al contempo il 100% del completamento delle attività, contro l'81% di accuratezza e il 29-71% di fallimento nelle attività per le regole di sicurezza incorporate nel prompt.
Dibattito Multiagente con LLM: Veri Guadagni di Accuratezza, Calcolo Incontrollato e Delirio Collettivo
Un'analisi approfondita del paper di Du et al. su ICML 2024 sul dibattito multiagente — che riporta guadagni di accuratezza del 14,8% su operazioni aritmetiche — insieme alle confutazioni del 2025 che mostrano come agenti singoli con pari budget eguaglino le performance del dibattito, e un'analisi del perché il Delirio Collettivo (65% dei fallimenti del dibattito) rappresenti un rischio specifico per le registrazioni contabili assistite da IA.
I LLM non sono utili per il forecasting di serie temporali: cosa significa NeurIPS 2024 per la finanza AI
Un articolo Spotlight di NeurIPS 2024 abla tre metodi di previsione di serie temporali basati su LLM — OneFitsAll, Time-LLM e CALF — e scopre che la rimozione del modello linguistico migliora l'accuratezza nella maggior parte dei casi, con un'accelerazione dell'addestramento fino a 1.383×. Per applicazioni di finanza AI come la previsione del saldo di Beancount, modelli leggeri e costruiti appositamente superano costantemente i LLM riadattati.
AuditCopilot: LLM per il Rilevamento di Frodi nella Contabilità in Partita Doppia
AuditCopilot applica LLM open-source (Mistral-8B, Gemma, Llama-3.1) al rilevamento di frodi nelle registrazioni contabili aziendali, riducendo i falsi positivi da 942 a 12 — ma l'analisi di ablazione rivela che l'LLM funziona principalmente come livello di sintesi basato sui punteggi di Isolation Forest, non come rilevatore di anomalie indipendente.
TAT-LLM: LLaMA 2 ottimizzato per il ragionamento discreto su tabelle e testo finanziario
TAT-LLM ottimizza LLaMA 2 7B con LoRA su benchmark di QA ibrida tabella-testo finanziario, raggiungendo 64,60% EM su FinQA — superando il 63,91% di GPT-4 — attraverso la scomposizione del ragionamento in passi deterministici di Estrazione, Ragionamento ed Esecuzione che eliminano errori di calcolo.
Fine-Tuning vs. RAG: Perché il Recupero Vince per Iniettare Nuova Conoscenza negli LLM
Un confronto empirico tra RAG e fine-tuning non supervisionato su LLM con 7 miliardi di parametri mostra che RAG raggiunge una precisione superiore a 0,875 su fatti successivi al cutoff, mentre il fine-tuning si attesta a 0,504 — con implicazioni dirette per la progettazione di agenti Beancount e qualsiasi sistema che richieda aggiornamenti frequenti della conoscenza.
IRCoT: Intercalare il Recupero con il Chain-of-Thought per QA Multi-Fase
IRCoT intercala il recupero BM25 con ogni fase di un ciclo di ragionamento chain-of-thought, ottenendo +11,3 di richiamo nel recupero e +7,1 di F1 su HotpotQA rispetto al RAG a fase singola — e mostra che un modello da 3B può battere GPT-3 175B quando la strategia di recupero è corretta.
FLARE: Generazione Aumentata con Recupero Attivo
FLARE (EMNLP 2023) migliora il RAG standard attivando il recupero a metà generazione tramite soglie di confidenza basate sulla probabilità dei token, raggiungendo 51.0 EM su 2WikiMultihopQA contro 39.4 del recupero singolo — ma i fallimenti di calibrazione nei modelli chat ottimizzati tramite istruzioni ne limitano l'affidabilità per agenti finanziari in produzione.
Generazione Aumentata da Recupero per Compiti NLP ad Alta Intensità di Conoscenza
L'articolo di Lewis et al. del NeurIPS 2020 ha introdotto l'architettura ibrida RAG—un generatore BART-large abbinato a un recuperatore indicizzato FAISS su 21 milioni di passaggi di Wikipedia—raggiungendo un EM di 44.5 su Natural Questions e stabilendo la suddivisione parametrico/non-parametrico che oggi è alla base della maggior parte dei sistemi AI di produzione. Questa rassegna copre i compromessi RAG-Sequence vs. RAG-Token, la modalità di fallimento del collasso del recupero, e cosa significano gli indici obsoleti per l'AI finanziaria costruita su registri Beancount solo-append.
MultiHiertt: Benchmarking del Ragionamento Numerico su Tabelle Finanziarie Multi-Gerarchiche
MultiHiertt (ACL 2022) introduce 10.440 coppie QA da report finanziari reali con una media di 3,89 tabelle gerarchiche ciascuno; i modelli all'avanguardia ottengono un F1 del 38% contro l'87% degli umani, con una penalità di 15 punti per le domande cross-tabella, quantificando il divario di recupero che l'AI finanziaria deve colmare.
ConvFinQA: Domande e Risposte Finanziarie Multi-Turn e il Divario di 21 Punti tra Modelli ed Esperti Umani
ConvFinQA (EMNLP 2022) estende FinQA al dialogo multi-turn sui report sugli utili delle aziende S&P 500, scoprendo che il miglior modello ottimizzato raggiunge un'accuratezza di esecuzione del 68,9% contro l'89,4% degli esperti umani – e scende al 52,4% nelle conversazioni ibride multi-aspetto dove i modelli devono trasportare il contesto numerico tra diversi argomenti finanziari.
TAT-QA: Benchmark ibrido basato su tabella e testo per il ragionamento su relazioni finanziarie annuali
TAT-QA è un benchmark con 16.552 domande su contesti ibridi di tabelle e testo tratti da relazioni finanziarie, che ha dimostrato che l’ancoraggio dell’evidenza — non l’aritmetica — è il collo di bottiglia principale nell’IA finanziaria; entro il 2024, LLM 7B ottimizzati hanno raggiunto l’83% F1, colmando gran parte del divario rispetto al tetto umano del 91%.