DocFinQA è un articolo ACL del 2024 che prende il dataset esistente FinQA e ripropone ogni domanda insieme al documento SEC completo da cui proviene, espandendo il contesto medio da meno di 700 parole a 123.000 parole. Lo leggo perché testa direttamente lo scenario che ogni agente Beancount in produzione deve affrontare: non un estratto pulito, ma l'intero documento complesso. I risultati sono sobrianti per chiunque pianifichi di distribuire modelli a contesto lungo su registri contabili pluriennali.
L'articolo
DocFinQA: A Long-Context Financial Reasoning Dataset — Varshini Reddy, Rik Koncel-Kedziorski, Viet Dac Lai, Michael Krumdick, Charles Lovering e Chris Tanner (ACL 2024, Short Papers) — prende le 8.281 coppie QA da FinQA e arricchisce 7.621 di esse con il rapporto annuale SEC completo da cui ogni domanda proviene. Il risultato è 1.236 documenti unici suddivisi in 5.798 esempi di training, 791 di sviluppo e 1.032 di test, con un contesto medio che aumenta di 175 volte, da circa 700 parole a 123.453 parole.
Il set di domande rimane invariato: sono le stesse domande di ragionamento numerico multi-step che richiedono programmi Python per essere risposte. Ciò che cambia è che il modello riceve ora il documento completo anziché un passaggio sapientemente curato di 700 parole. La ricerca confronta due famiglie di approcci: i classici pipeline di recupero (frammentazione, classificazione, risposta) e i modelli emergenti a contesto lungo che tentano di elaborare l'intero documento end-to-end.
Idee chiave
- Accuratezza massima del pipeline di recupero sul set di test: GPT-3.5 con il 42,64%. I modelli open-source sono molto indietro: Mistral/7B con il 24,97%, CodeLlama/13B con il 21,01%, MPT/30B con il 18,07%.
- Il miglior encoder di recupero, un ColBERT ottimizzato, raggiunge HR@1 = 0,35 e HR@3 = 0,55, il che significa che il frammento corretto è assente dal contesto del modello quasi la metà delle volte anche quando si recuperano tre passaggi.
- GPT-4 a contesto lungo (valutato su un sottocampione di 400 domande): 46,5% sui documenti più brevi (≤100K token) contro il 23,0% con una strategia di riassunto poi risposta sui documenti più lunghi (>100K token). GPT-4 commette quasi il doppio degli errori sui documenti lunghi rispetto a quelli brevi.
- L'analisi PDF specifica per la finanza (Kensho Extract) ha superato sostanzialmente l'analisi HTML generica (BeautifulSoup), in particolare per la conservazione delle tabelle — un risultato pratico per qualsiasi pipeline basato su documenti SEC.
- Una frazione sostanziale di frammenti rilevanti si trova oltre la posizione 250 del documento, il che significa che le strategie basate sul troncamento scartano silenziosamente le prove corrette prima ancora che il modello le veda.
Cosa regge e cosa no
Il contributo empirico centrale è solido: il dataset è un'estensione fedele di FinQA con una metodologia ben definita (punteggio di similarità a quattro grammi per identificare i frammenti d'oro, frammenti da 2.750 caratteri con sovrapposizione del 20%), e il risultato che le prestazioni degradano gravemente con la lunghezza del documento è coerente sia con gli approcci di recupero che con quelli a contesto lungo. Il quasi raddoppio degli errori di GPT-4 sui documenti lunghi rispetto a quelli brevi è sorprendente e difficile da spiegare.
Ciò che l'articolo non affronta completamente è la frontiera dei modelli a contesto lungo della generazione 2024. La valutazione a contesto lungo copre solo 400 campioni, limitata dai costi, e non testa Gemini 1.5 Pro (finestra da 1 milione di token) o Claude 3 (200K). Gli iperparametri di frammentazione sono ragionevoli ma non sistematicamente eliminati, e la strategia multi-chiamata di riassunto poi risposta probabilmente non è la migliore disponibile — il recupero intervallato di IRCoT e la sintesi strutturata di StructRAG suggeriscono entrambi che esistono approcci migliori per l'aggregazione di prove multi-hop in documenti lunghi.
Il ColBERT ottimizzato che raggiunge HR@3 = 0,55 rivela il problema più profondo: il recupero su documenti finanziari lunghi è di per sé irrisolto. Anche con un modello generativo perfetto, quasi la metà delle domande riceverebbe una risposta costruita dai frammenti sbagliati. L'articolo evidenzia questo come il vincolo principale ma si ferma prima di quantificare quanto migliori l'accuratezza quando il recupero diventa oracolare.
Perché è importante per l'AI finanziaria
I registri contabili Beancount pluriennali non raggiungono di default le 123K parole, ma un decennio di transazioni con descrizioni dettagliate vi si avvicina facilmente, e un agente finanziario che opera su rapporti annuali completi si trova esattamente in questo regime. La compressione da "abbiamo scelto le giuste 700 parole" (FinQA) a "ecco il 10-Q completo" (DocFinQA) rappresenta il divario tra un benchmark giocattolo e la realtà produttiva. DocFinQA rende misurabile questo divario.
Il calo di quasi il 50% nell'accuratezza di GPT-4 dai documenti brevi a quelli lunghi sostiene l'idea che non sia sufficiente una semplice risposta "usa una finestra di contesto più grande". Il recupero rimane necessario ma è affidabile solo al 55% a HR@3. Per un agente di scrittura Beancount che deve localizzare un piano di ammortamento sepolto in una vecchia nota ai conti, nessuna delle due architetture offre l'affidabilità desiderata prima di registrare una scrittura contabile. La lettura onesta di questo articolo: miglior recupero, migliore aggregazione delle prove e valutazione esplicita dei fallimenti silenziosi, non una finestra di contesto più grande, sono ciò di cui il settore ha realmente bisogno.
Cosa leggere dopo
- "Lost in the Middle: How Language Models Use Long Contexts" — Liu et al., 2023, arXiv:2307.03172. Fornisce la spiegazione meccanicistica del crollo dell'accuratezza posizionale misurato da DocFinQA, con la ormai canonica curva di performance a forma di U.
- FinDER: Financial Dataset for Question Answering and Evaluating Retrieval-Augmented Generation — arXiv:2504.15800, ICLR 2025 Workshop. Un benchmark successivo del 2025 con 5.703 triplette domanda-prova-risposta progettate attorno a query di ricerca finanziaria professionale realistica, incluse abbreviazioni e acronimi che i recuperatori standard perdono.
- Fin-RATE: A Real-world Financial Analytics and Tracking Evaluation Benchmark for LLMs on SEC Filings — arXiv:2602.07294. Un benchmark più recente su documenti SEC che aggiunge compiti di tracciamento temporale oltre alla singola domanda-risposta su documento, più vicino a ciò di cui un agente di revisione Beancount avrebbe realmente bisogno.