Ogni benchmark di QA finanziario che ho letto questo mese — FinQA, TAT-QA, ConvFinQA — si basa sulla stessa presupposto silenzioso: una singola tabella piatta per documento. I report finanziari reali non sono affatto così. I bilanci consolidati annidano le controllate all'interno dei segmenti, all'interno delle entità capogruppo; i conti economici hanno voci di bilancio gerarchiche con subtotali che a loro volta alimentano aggregati di livello superiore. MultiHiertt (Zhao et al., ACL 2022) è il primo dataset di benchmark costruito per esporre proprio questo divario, e i numeri che ne emergono sono allarmanti.
Il paper
Yilun Zhao, Yunxiang Li, Chenying Li e Rui Zhang della Penn State introducono MultiHiertt, un benchmark di QA composto da 10.440 coppie domanda-risposta estratte da 2.513 report finanziari reali. Ogni documento ha una media di 3,89 tabelle gerarchiche insieme a 68 frasi (~1.645 parole) di testo narrativo. La suddivisione train/dev/test è 7.830 / 1.044 / 1.566. L'argomento centrale è semplice ma incisivo: i dataset precedenti (FinQA, TAT-QA) valutano i modelli su documenti con una singola tabella piatta, il che sottostima sistematicamente la complessità del ragionamento su documenti finanziari reali, dove una domanda può richiedere la sintesi di numeri da tre diverse sotto-tabelle prima di applicare un programma aritmetico.
Insieme al dataset, gli autori propongono MT2Net, un modello a due stadi: un modulo di recupero dei fatti che valuta le celle di supporto e gli span di testo candidati da tutte le tabelle e i paragrafi, seguito da un modulo di ragionamento simbolico (un esecutore di programmi aritmetici preso in prestito dal design NeRd di FinQA) che opera sui fatti recuperati. MT2Net utilizza RoBERTa-large come codificatore in tutto il processo.
Idee chiave
- La media di 3,89 tabelle per documento di MultiHiertt rispecchia direttamente la struttura reale dei report annuali, dove una singola domanda può richiedere valori dal conto economico, da una tabella di ripartizione per segmento e da una nota a piè di pagina — nessuna delle quali è piatta
- MT2Net (RoBERTa-large) raggiunge un F1 del 38,43% sul set di test; gli esperti umani ottengono un F1 dell'87,03% — un divario di quasi 49 punti
- Le domande di ragionamento cross-tabella (che richiedono evidenze da ≥ 2 tabelle) ottengono un F1 del 21,04% con il miglior modello, contro il 36,77% per le domande a tabella singola — un calo di oltre 15 punti rispetto a una linea di base già bassa
- Il modulo di ragionamento simbolico aiuta ma non può compensare i fallimenti nel recupero: lo studio di annotazione mostra che il 31,5% degli errori su esempi gerarchici deriva dalla selezione di celle di evidenza sbagliate prima di qualsiasi tentativo di calcolo aritmetico
- Entro il 2024, GPT-4 con prompting Program-of-Thoughts raggiunge un F1 del 67,23% su MultiHiertt, e un metodo EEDP (evidence-enhanced document prompting) dedicato spinge GPT-4 al 70,32% — ancora 17 punti sotto il tetto umano
- La qualità dell'annotazione è solida: Kappa inter-annotatore di 0,72–0,90, con il 76,8%–94,0% dei campioni valutati ≥ 4/5 per correttezza dai lavoratori della folla
Cosa regge — e cosa no
La costruzione del dataset è accurata e le metriche di qualità dell'annotazione sono rassicuranti. L'affermazione centrale — che i benchmark a tabella singola sottostimano la complessità reale — è ovviamente vera e il divario di 15 punti F1 tra i sottoinsiemi a tabella singola e multi-tabella lo rende concreto. La tabella comparativa (Tabella 1 nel paper) mostra chiaramente che FinQA e TAT-QA hanno una tabella per documento; MultiHiertt sta colmando una lacuna reale.
Detto questo, MT2Net non è una soluzione proposta forte — è più vicino a una solida linea di base. Il modulo di recupero è uno scorer a livello di span addestrato con supervisione sui fatti di supporto, il che significa che dipende fortemente dall'avere un segnale di supervisione corretto al momento dell'addestramento. Il paper non valuta cosa succede quando la struttura gerarchica è implicita (nessun annidamento HTML esplicito genitore-figlio), cosa comune in documenti scansionati e PDF più vecchi. Il set di test è tenuto nascosto dietro una classifica CodaLab, il che rende difficile replicare indipendentemente i risultati o sondare le modalità di fallimento.
Voglio anche segnalare qualcosa che gli autori sottovalutano: i risultati di GPT-4 del 2024 mostrano che la pura potenza di ragionamento può colmare gran parte del divario senza alcuna architettura specificamente progettata per la gerarchia. GPT-4 arriva al 70% senza mai essere informato che il documento ha tabelle gerarchiche — legge semplicemente l'HTML renderizzato. Questa è in realtà una scoperta interessante: la consapevolezza della gerarchia potrebbe essere meno importante della pura capacità di contesto e dell'affidabilità aritmetica. Il vincolo principale potrebbe essere ancora la precisione del recupero su documenti lunghi, non l'architettura di ragionamento.
Perché questo è importante per l'AI finanziaria
Gli agenti Beancount affrontano esattamente questo problema. Una domanda come "qual era la nostra aliquota fiscale effettiva nel 2023?" richiede di trovare la riga del reddito ante imposte dal conto economico, l'imposta sul reddito da una nota separata e possibilmente una ripartizione a livello di segmento per riconciliare la cifra consolidata. Nessuna di queste vive in una singola tabella piatta. La penalità di 15 punti F1 per il ragionamento cross-tabella in MultiHiertt quantifica ciò che mi aspetterei di vedere in un contesto Beancount: gli agenti che sembrano bravi su query a singolo conto si deterioreranno significativamente quando una domanda richiede l'unione di sezioni di contabilità.
L'analisi degli errori è direttamente attuabile. Se il 31,5% degli errori sono recuperi di evidenze sbagliate prima che avvenga qualsiasi calcolo, allora la priorità per un agente di scrittura Beancount non è un motore aritmetico migliore — è un selettore di evidenze migliore. Un agente che recupera le righe contabili sbagliate prima di fare i calcoli produrrà voci dall'aspetto plausibile ma errate, esattamente la modalità di fallimento più difficile da individuare in una revisione contabile.
La traiettoria di GPT-4 è anche incoraggiante per il breve termine: passare dal 38% al 70% in due anni suggerisce che il ragionamento finanziario multi-tabella è trattabile man mano che le finestre di contesto e il ragionamento migliorano, anche senza un addestramento specifico per dominio. Ma il restante divario di 17 punti rispetto alla performance umana non è rumore — probabilmente riflette casi in cui la struttura gerarchica porta un carico semantico che la resa in testo piatto perde.
Cosa leggere dopo
- Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (Lewis et al., NeurIPS 2020) — arXiv:2005.11401 — il fondamento su cui si basa quasi ogni sistema di QA finanziario; comprendere la sua suddivisione di memoria parametrica vs. non parametrica è importante per decidere come strutturare il recupero contabile
- FLARE: Active Retrieval Augmented Generation (Jiang et al., EMNLP 2023) — arXiv:2305.06983 — recupera a metà generazione quando il modello prevede di aver bisogno di nuovi fatti, il che è un adattamento naturale per il ragionamento multi-tabella dove si scopre a metà ragionamento di aver bisogno di una tabella sussidiaria
- TAT-LLM: A Specialized Language Model for Discrete Reasoning over Financial Tabular and Textual Data (Zhao et al., ICAIF 2024) — mette a punto un LLM specificamente su FinQA/TAT-QA/MultiHiertt e mostra cosa l'adattamento al dominio acquista effettivamente rispetto al prompting di GPT-4