La maggior parte dei benchmark RAG in ambito finanziario chiede se un sistema è in grado di recuperare e rispondere — punto. OmniEval (EMNLP 2025, arXiv:2412.13018) di Shuting Wang et al. presso la RUC pone una domanda più difficile: la performance è costante su tutta la matrice di tipi di task e argomenti finanziari? Lo sto leggendo ora perché è il tentativo più strutturato di mappare la forma del fallimento RAG in finanza prima di provare a costruire agenti affidabili per il registro Beancount basati su pipeline RAG.
L'articolo
OmniEval costruisce una griglia di valutazione bidimensionale: cinque classi di task (QA estrattivo, ragionamento multi-hop, QA contrastivo, QA in forma lunga e QA conversazionale) incrociate con 16 argomenti finanziari (mercati azionari, investment banking, fondi, assicurazioni sulla proprietà e altri). Il risultato è un benchmark strutturato con 11.4k esempi di test generati automaticamente, 1.7k esempi annotati da umani e un corpus di recupero di 362k documenti assemblato da sei fonti di dati finanziari cinesi (BSCF-DB con 193k documenti, FinGLM con 55k, BAAI-Fin con 48k, crawling web ufficiali, PDF e contenuti finanziari di Wikipedia). Il benchmark include anche un valutatore LLM ottimizzato — Qwen2.5-7B-Instruct addestrato su 910 istanze etichettate da umani — che valuta la qualità della generazione in termini di accuratezza, allucinazione, completezza, utilizzo e accuratezza numerica. L'articolo è stato pubblicato a EMNLP 2025.
Idee chiave
- I casi di test generati automaticamente hanno superato un controllo di accettazione umano all'87,47%, il che significa che circa 1 istanza generata su 8 è stata scartata — un tasso di rumore non trascurabile per un benchmark.
- Il miglior recuperatore (GTE-Qwen2-1.5B) ha raggiunto un MAP di 0,4370 e un MRR di 0,4491 sull'insieme generato automaticamente, il che significa che il passaggio con il ranking più alto è corretto meno della metà delle volte anche con il recuperatore più forte testato.
- L'accuratezza di generazione (ACC) su tutte le combinazioni recuperatore-LLM variava da 0,3238 a 0,4476 — la migliore configurazione risponde correttamente a meno della metà delle domande.
- L'accuratezza numerica (NAC) è il dato più netto: da 0,0659 a 0,3595. Il sistema migliore ottiene i numeri finanziari corretti circa il 36% delle volte; il peggiore è vicino allo zero.
- Il valutatore ottimizzato ha raggiunto un accordo del 74,4% con l'annotazione umana (κ = 0,6486), superando sostanzialmente le baseline basate solo su prompting al 55-71% — ma lasciando comunque una valutazione su quattro disallineata con il giudizio umano.
- Il ragionamento multi-hop e il QA conversazionale sono risultati costantemente le classi di task più difficili.
Cosa regge — e cosa no
Il design della valutazione a matrice è genuinamente utile. I precedenti benchmark finanziari (FinanceBench, FinQA, DocFinQA) trattano la valutazione come un singolo asse — solitamente l'accuratezza della risposta — e perdono la variazione strutturale in come il RAG fallisce. Sapere che un sistema ottiene buoni risultati sul QA estrattivo ma scarsi sul ragionamento multi-hop è utilizzabile; sapere che ha un punteggio medio complessivo non lo è. La griglia di OmniEval rende visibile questa variazione, e la scoperta che la performance non è costante tra gli argomenti è esattamente il tipo di risultato che i professionisti devono vedere prima del deployment.
Detto questo, ci sono limiti reali su cui voglio essere diretto. Il corpus è prevalentemente cinese: cinque delle sei fonti di dati sono dati finanziari cinesi (BSCF, FinGLM, BAAI-Fin), e la sesta è Wikipedia cinese. L'articolo non riporta i risultati suddivisi per lingua — riporta solo numeri aggregati. Questo rende ogni punteggio nell'articolo sospetto come affermazione sul RAG finanziario in generale, piuttosto che sul RAG finanziario su testo cinese con recuperatori e LLM specializzati per il cinese (GTE-Qwen2-1.5B, Qwen2.5-72B, Yi15-34B). Gli utenti finanziari di lingua inglese non possono utilizzare direttamente questi numeri.
Il valutatore LLM è addestrato su 910 istanze etichettate. È poco. L'accordo umano del 74,4% con κ = 0,6486 è difendibile come punto di partenza, ma significa che il framework di valutazione stesso introduce rumore sostanziale. Se il benchmark viene utilizzato per confrontare sistemi che differiscono di pochi punti percentuali, la varianza del valutatore sommergerà il segnale.
La pipeline di generazione automatica — GPT-4 produce domande di test, gli umani filtrano con un'accettazione dell'87,47% — solleva anche un problema di contaminazione che l'articolo non affronta: le domande generate da GPT-4 potrebbero giocare a favore dei punti di forza dei modelli di classe GPT-4 in un modo che svantaggia sistematicamente modelli più vecchi o più piccoli.
Perché questo è importante per l'AI finanziaria
I punteggi di accuratezza numerica sono il numero a cui torno sempre: 0,0659–0,3595. Se il miglior sistema RAG testato ottiene i numeri finanziari corretti solo il 36% delle volte in una valutazione di benchmark, qualsiasi agente di scrittura in Beancount costruito su una pipeline RAG ingenua corromperà i dati del registro. Il formato di Beancount è inflessibile — un importo, una data o un nome di conto errato produce un errore di analisi o un errore contabile silenzioso che può propagarsi attraverso gli anni fiscali. Questo benchmark ci fornisce la prova concreta che il recupero RAG e la generazione LLM non sono ancora abbastanza affidabili per la scrittura diretta nel registro senza un livello di validazione.
La struttura delle classi di task si mappa anche pulitamente ai casi d'uso di Beancount. Il QA estrattivo corrisponde a semplici controlli di saldo. Il ragionamento multi-hop corrisponde a domande come "qual è il mio reddito netto dopo le tasse nel Q1-Q3?" Il QA conversazionale corrisponde a un utente che perfeziona iterativamente una richiesta di riconciliazione in una sessione. La scoperta di OmniEval che i task multi-hop e conversazionali sono i più difficili è esattamente la cattiva notizia per la progettazione dell'agente Beancount: i casi facili sono quasi a posto; i casi realistici sono dove il sistema crolla.
Cosa leggere dopo
- ARES: Un Framework di Valutazione Automatica per la Generazione Aumentata da Recupero (arXiv:2311.09476, NAACL 2025) — l'analogo per dominio generale più vicino all'approccio di ottimizzazione del valutatore di OmniEval; confrontare la metodologia ARES con quella di OmniEval chiarirebbe se le scelte progettuali del valutatore LLM sono fondate o ad hoc.
- RAGEval: Framework di Generazione di Dataset di Valutazione RAG Specifici per Scenario (ACL 2025, aclanthology.org/2025.acl-long.418) — generazione automatica di scenari per la valutazione RAG; estende la metodologia di auto-generazione utilizzata da OmniEval e potrebbe affrontare il problema della contaminazione.
- FinRAGBench-V: Un Benchmark per RAG Multimodale con Citazione Visiva nel Dominio Finanziario (arXiv:2505.17471) — estende la valutazione RAG a documenti finanziari multimodali (tabelle, grafici); rilevante poiché gli utenti di Beancount hanno sempre più spesso immagini di ricevute e estratti conto PDF insieme ai registri in testo semplice.