L'AI finanziaria è stata dominata dal RAG solo testuale, ma i documenti finanziari reali sono pieni di grafici, tabelle e figure che l'OCR non può catturare completamente. FinRAGBench-V (EMNLP 2025) è il primo benchmark su larga scala per valutare il RAG multimodale con citazioni visive nel dominio finanziario, e i suoi risultati sono un sobrio promemoria di quanto i sistemi di produzione debbano ancora progredire.
Il paper
Zhao, Jin, Li e Gao dell'Università di Pechino presentano FinRAGBench-V, un benchmark bilingue costruito da documenti finanziari reali: rapporti di ricerca, bilanci, prospetti, articoli accademici, riviste e notizie. Il corpus di recupero è sostanziale: 60.780 pagine in cinese e 51.219 pagine in inglese, distribuite su circa 1.100 documenti per lingua, abbinate a 1.394 coppie QA annotate da umani che coprono sette categorie di domande: inferenza testuale, estrazione da grafici e tabelle, calcolo numerico, query sensibili al tempo e ragionamento su più pagine. Oltre al dataset, il contributo centrale del paper è RGenCite, un sistema di base che genera risposte insieme a citazioni visive a livello di pixel sotto forma di coordinate di bounding box che contrassegnano le regioni specifiche del documento a supporto di ogni affermazione.
Idee chiave
- Il recupero multimodale domina quello solo testuale con un margine schiacciante: ColQwen2, un recuperatore visione-linguaggio basato su embedding di immagini di pagina, raggiunge Recall@10 del 90,13% (cinese) e 85,86% (inglese). I migliori recuperatori testuali, BM25 e BGE-M3, si fermano a circa il 42,71%. Questo divario non è un errore di arrotondamento.
- L'accuratezza della generazione è bassa anche per i modelli all'avanguardia: GPT-4o in inglese raggiunge il 43,41% di accuratezza (ROUGE 24,66); o4-mini in cinese raggiunge il 58,13% (ROUGE 38,55). Questi sono i migliori modelli proprietari con un solido recupero in atto.
- La citazione a livello di pagina funziona; quella a livello di blocco no: Il richiamo a livello di pagina si attesta tra il 75 e il 93% per i migliori modelli. Il richiamo a livello di blocco—sapere quale specifica cella di tabella o regione di grafico supporta un'affermazione—scende al 20–61%. Questo è il divario chiave per la verificabilità.
- Il ragionamento numerico e l'inferenza su più pagine sono i primi a rompere i modelli: Le domande che richiedono calcoli tra pagine o intervalli temporali sono quelle in cui l'accuratezza cala più bruscamente in tutti i sistemi testati.
- I modelli proprietari superano sostanzialmente le alternative open-source: Il divario tra API chiusa e open-source è più ampio qui che nella maggior parte dei benchmark NLP, suggerendo che il ragionamento visivo finanziario rimane irrisolto per i modelli aperti.
- La valutazione automatica per le citazioni è imperfetta: Il valutatore di citazioni basato sul ritaglio delle immagini raggiunge un coefficiente di correlazione di Pearson r = 0,68 con i giudizi umani—ragionevole ma non abbastanza affidabile da fidarsi completamente senza campionamento.
Cosa regge — e cosa no
Il risultato sul recupero è il più credibile del paper. Un divario di quasi 50 punti percentuali tra recuperatori multimodali e solo testuali su oltre 60.000 pagine è troppo grande per essere liquidato. Quando si applica l'OCR a un documento finanziario prima dell'indicizzazione, si distruggono i segnali di layout strutturale—in quale colonna appare un numero, se una didascalia modifica l'interpretazione di una tabella—che si rivelano enormemente importanti per il recupero.
I numeri sulla generazione sono onesti ma difficili da interpretare isolatamente. Gli autori non separano quanto del divario di accuratezza sia attribuibile a errori di recupero rispetto a fallimenti di generazione. Dato che Recall@10 è già all'85,86% per l'inglese, una frazione significativa dei fallimenti deve essere lato generazione piuttosto che lato recupero. Conoscere questa suddivisione chiarirebbe se il collo di bottiglia è il ragionamento multimodale o qualcosa di più fondamentale su come gli MLLM gestiscono il linguaggio finanziario.
L'insieme di valutazione di 1.394 coppie QA è piccolo per l'ambito del benchmark. Diviso in sette categorie e due lingue, alcune sezioni hanno ben meno di 200 esempi. La significatività statistica dei risultati a livello di categoria è lasciata implicita. Questo non è insolito per un paper di benchmark, ma significa che sarebbero facili da costruire confronti selettivi.
Il protocollo di valutazione delle citazioni è un contributo interessante, ma Pearson r = 0,68 con le valutazioni umane non è abbastanza forte per trattare la valutazione automatica come verità di base per la verifica a livello di blocco. Gli autori lo riconoscono; il lavoro futuro su metriche di citazione migliori è esplicitamente segnalato.
Perché questo è importante per l'AI finanziaria
Beancount opera su file di contabilità in testo semplice, il che rende il RAG solo testuale difendibile per interrogare transazioni passate. Ma il compito contabile più ampio coinvolge documenti che non sono affatto testo semplice: PDF di estratti conto bancari, fatture scansionate, immagini di ricevute, relazioni annuali con tabelle e grafici incorporati. Nel momento in cui un agente Beancount deve riconciliare una voce di contabilità con un documento sorgente—verificare che un addebito specifico corrisponda alla fattura in archivio—sta esattamente svolgendo il compito che FinRAGBench-V valuta.
Il risultato sulla citazione a livello di blocco è il più importante per questo caso d'uso. Se un agente deve giustificare una voce di contabilità puntando a una specifica riga in un PDF, e il miglior sistema disponibile raggiunge solo il 20–61% di richiamo a livello di blocco, questo non è pronto per la revisione contabile. Qualsiasi pipeline Beancount che tocchi documenti sorgente scansionati necessita di revisione umana nel ciclo finché questo numero non migliora sostanzialmente.
Il divario di modalità di recupero depone anche fortemente contro le pipeline puramente testuali per l'ingestione di documenti. Un'immagine di ricevuta porta informazioni di layout—campi di importo, nomi di fornitori, posizioni delle voci—che l'OCR distrugge. Quelle informazioni di layout sono proprio ciò che distingue un totale di riga da un importo fiscale, e FinRAGBench-V mostra che i recuperatori multimodali le sfruttano in modi che i recuperatori testuali non possono.
Cosa leggere dopo
- ColPali: Recupero Efficiente di Documenti con Modelli Linguistico-Visivi — il predecessore di ColQwen2 che ha stabilito l'approccio degli embedding visivi di pagina su cui si basa il miglior recuperatore di FinRAGBench-V [arXiv:2407.01449, ECCV 2024]
- M3DocRAG: Il Recupero Multimodale è Ciò di Cui Hai Bisogno per la Comprensione di Documenti Multi-pagina e Multi-documento — affronta il QA visivo multi-documento con un framework flessibile che gestisce il ragionamento visivo single-hop e multi-hop tra pagine [arXiv:2411.04952]
- Benchmarking del RAG Multimodale Sensibile al Tempo in Finanza — un benchmark complementare del 2025 che valuta la sensibilità al tempo nel RAG multimodale finanziario, direttamente complementare alla categoria di domande sensibili al tempo di FinRAGBench-V [arXiv:2503.05185]