Salta al contenuto principale

TAT-QA: Benchmark ibrido basato su tabella e testo per il ragionamento su relazioni finanziarie annuali

6 minuti di letturaMike ThriftMike Thrift
TAT-QA: Benchmark ibrido basato su tabella e testo per il ragionamento su relazioni finanziarie annuali

Leggo TAT-QA oggi perché si trova a un’intersezione che riguarda direttamente ciò che stiamo costruendo: domande a cui si può rispondere solo ragionando contemporaneamente su una tabella e sul testo circostante. In Beancount, ogni voce di contabilità esiste in un contesto — una riga di tabella che non ha senso senza il memo, la narrazione della controparte o la politica contabile che spiega perché quella voce è lì. TAT-QA, pubblicato ad ACL 2021 da Zhu et al. del laboratorio NExT++ presso NUS, è il benchmark che ha costretto la comunità NLP ad affrontare questo problema direttamente.

Il paper

Fengbin Zhu, Wenqiang Lei, Youcheng Huang, Chao Wang, Shuo Zhang, Jiancheng Lv, Fuli Feng e Tat-Seng Chua introducono TAT-QA (Tabular And Textual QA), un dataset di 16.552 domande su 2.757 contesti ibridi tratti da relazioni finanziarie annuali reali. Ogni contesto abbina una tabella semi-strutturata ad almeno due paragrafi di accompagnamento — esattamente la struttura che si trova nei documenti 10-K, dove una tabella dei ricavi è affiancata dalla discussione del management su cosa ha guidato i numeri. Quasi tutte le domande richiedono aritmetica: addizione, sottrazione, moltiplicazione, divisione, conteggio, confronto, ordinamento e composizioni multi-operazione.

Il contributo principale è duplice: il benchmark stesso e TAGOP, un nuovo modello che tratta il problema come tagging delle evidenze seguito da ragionamento simbolico. TAGOP utilizza un sequencer sulle celle della tabella e sugli span di testo concatenati per identificare quali pezzi di evidenza raccogliere, quindi applica un insieme fisso di operatori di aggregazione (somma, differenza, prodotto, rapporto, conteggio, ecc.) per calcolare la risposta finale. Nessuna aritmetica neurale — il calcolo stesso è sempre delegato a un esecutore simbolico.

Idee chiave

  • L’identificazione dell’evidenza è la parte difficile, non l’aritmetica. L’analisi degli errori di TAGOP attribuisce circa il 55% dei fallimenti a tagging errato e il 29% a evidenza mancante. Una volta ottenute le celle e gli span giusti, l’esecutore simbolico commette raramente errori di calcolo. Questo è un segnale diretto: per gli agenti finanziari, il passo di recupero e ancoraggio domina.
  • I modelli solo testo falliscono immediatamente. BERT-RC ottiene solo il 18,7% F1 sul test set. NumNet+ V2, il miglior lettore numerico pre-TAT-QA, raggiunge il 46,9% F1. Il baseline solo tabella TaPas ottiene il 22,8% F1. Un modello che legge tabelle senza testo — o testo senza tabelle — è squalificato da questo dominio.
  • TAGOP ottiene il 58,0% F1 (50,1% corrispondenza esatta), gli esperti umani ottengono il 90,8% F1 (84,1% EM). Il divario di 32,8 punti F1 al momento della pubblicazione era allarmante. Significava che anche il miglior sistema del 2021 risponde a meno di due terzi delle domande che un analista formato può gestire.
  • Entro la fine del 2024, la classifica racconta una storia diversa. Il sistema migliore, TAT-LLM (70B), raggiunge l’88,4% F1 — solo 2,4 punti sotto l’umano. TAT-LLM (7B) raggiunge l’82,88% F1 e GPT-4 in zero-shot raggiunge il 79,71% F1. Il divario si è ridotto drasticamente, principalmente attraverso l’ottimizzazione fine su scala LLM.
  • L’ottimizzazione fine specializzata batte ancora GPT-4 grezzo. TAT-LLM 7B (74,56% EM) supera GPT-4 zero-shot (71,92% EM) su TAT-QA, anche con una frazione del numero di parametri. Il pipeline step-wise Extractor→Reasoner→Executor che TAT-LLM utilizza rispecchia l’intuizione di TAGOP ma sostituisce il tagger simbolico con un LLM sollecitato.

Cosa regge — e cosa no

Il benchmark sono dati reali, domande reali, relazioni finanziarie reali. Questa credibilità è il suo più grande vantaggio. Il divario di 32 punti uomo-modello al momento della pubblicazione era genuino e il dataset è abbastanza difficile che anche cinque anni dopo i sistemi migliori non lo hanno colmato del tutto.

Ciò che mi preoccupa è l’assunzione di una singola tabella. Ogni contesto TAT-QA contiene esattamente una tabella. Le relazioni annuali reali ne contengono decine, spesso con relazioni gerarchiche tra segmenti, filiali e periodi di tempo. Un modello che risponde perfettamente alle domande TAT-QA è ancora impreparato per il consolidamento cross-tabella che domina il lavoro contabile reale. Il paper MMQA (ICLR 2025) fa esattamente questo punto — che i benchmark a singola tabella come TAT-QA sottostimano la complessità multi-tabella che i professionisti affrontano.

Anche la distribuzione dei tipi di risposta non è così difficile come sembra in pratica. Circa il 42% delle risposte TAT-QA sono span singoli — estrazioni dirette che non richiedono calcolo. Le composizioni multi-operazione impegnative sono una minoranza. Un modello che ottiene tutte le estrazioni giuste e tutta l’aritmetica sbagliata otterrebbe comunque un punteggio tra il 30 e il 40%. Il benchmark non pesa per difficoltà, il che appiattisce il segnale dei casi di ragionamento veramente difficili.

Infine, il baseline umano (90,8% F1) è stato calcolato utilizzando annotatori che avevano accesso al documento ma potrebbero non essere stati esperti a livello CPA. Per il ragionamento contabile su scala Beancount — dove un agente deve comprendere la politica contabile, non solo l’aritmetica — il 90,8% potrebbe essere una sovrastima del tetto "corretto".

Perché questo è importante per l’IA finanziaria

TAT-QA è il benchmark pubblico più vicino a ciò che un agente Beancount affronta quotidianamente: dati di voci strutturati (tabella) accanto a una narrazione non strutturata (memo, descrizione, nota politica). Il risultato TAGOP conferma ciò che mi aspetterei dalla costruzione di strumenti di contabilità — l’ancoraggio è più difficile del calcolo. Taggare le celle giuste è il problema; sommarle è banale.

La traiettoria della classifica è incoraggiante per il prodotto: un modello da 7 miliardi di parametri ottimizzato su questo dominio supera GPT-4 in zero-shot, il che suggerisce che un modello ottimizzato specifico per Beancount potrebbe gestire il carico di lavoro di recupero+aritmetica senza bisogno di chiamate API di modelli di frontiera per ogni query di contabilità. Latenza, costo e privacy dei dati migliorano tutti se possiamo eseguire uno specialista compatto localmente.

La limitazione della singola tabella è il divario diretto da colmare per Bean Labs. I registri Beancount sono effettivamente documenti multi-tabella — registrazioni contabili, linee di budget, note di riconciliazione — e il benchmark che cattura questa struttura multi-hop attraverso tabelle correlate non esiste ancora completamente. MultiHiertt (ACL 2022) è la cosa più vicina; è il prossimo paper nella mia lista.

Cosa leggere dopo

  • MultiHiertt: Numerical Reasoning over Multi Hierarchical Tabular and Textual Data (arXiv:2206.01347, ACL 2022) — affronta direttamente la limitazione della singola tabella di TAT-QA; le domande richiedono ragionamento attraverso più tabelle gerarchiche all’interno dello stesso documento finanziario, più vicino a come appaiono le dichiarazioni contabili consolidate
  • ConvFinQA: Exploring the Chain of Numerical Reasoning in Conversational Finance Question Answering (arXiv:2210.03849, EMNLP 2022) — estende FinQA a dialoghi multi-turno; i modelli devono tracciare il contesto numerico corrente attraverso turni di domanda, il che si mappa a come un agente Beancount gestisce domande di follow-up su una sessione contabile
  • TAT-LLM: A Specialized Language Model for Discrete Reasoning over Tabular and Textual Data (arXiv:2401.13223, ICAIF 2024) — il follow-up diretto dello stesso gruppo NExT++; mostra come LLaMA-2 ottimizzato con un pipeline Extractor→Reasoner→Executor batte GPT-4 in zero-shot su TAT-QA e FinQA

Condividi questo articolo