FinAuditing valuta i LLM rispetto alla complessità strutturata dei depositi XBRL reali della SEC—non le coppie Q&A rifinite che dominano le classifiche di NLP finanziario. Lo sto leggendo ora perché l'agenda di revisione di Bean Labs continua a tornare su una domanda che i benchmark esistenti non possono rispondere: può un modello tenere in memoria un intero deposito strutturato e verificarne la coerenza interna?
Il documento
Wang et al. introducono FinAuditing, un benchmark di 1.102 istanze tratte da 218 depositi XBRL su SEC EDGAR, che copre i tipi di errore catalogati dal Data Quality Committee (DQC) di XBRL US. XBRL è il formato leggibile da macchina richiesto dalla SEC per tutti i depositi delle società pubbliche; ogni deposito include un documento di istanza (numeri riportati), uno schema di tassonomia (concetti contabili validi) e quattro linkbase—calcolo, presentazione, definizione ed etichetta—che specificano come i concetti si relazionano tra loro. Il benchmark operazionalizza tre sotto-compiti di revisione: Financial Semantic Matching (FinSM, recuperare il concetto di tassonomia corretto per un fatto riportato), Financial Relationship Extraction (FinRE, classificare la relazione tra due nodi di tassonomia) e Financial Mathematical Reasoning (FinMR, verificare che le cifre riportate soddisfino le regole di calcolo definite dalla tassonomia). Le istanze hanno una media di 33.848 token—al limite o oltre il contesto effettivo di molti modelli open-source—e tutti i 13 modelli sono testati in modalità zero-shot.
Idee chiave
- FinSM è essenzialmente recupero di tassonomia: dato un fatto nel deposito, trovare il concetto US-GAAP corretto. DeepSeek-V3 è in testa con 12,42% Hit Rate@20—meno di una risposta corretta su otto quando si sceglie tra 20 candidati. GPT-4o arriva al 9,09%.
- FinRE (classificare le relazioni nei linkbase) è il compito più facile: GPT-4o raggiunge 91,82% di accuratezza e 90,09 Macro F1. Ma Qwen3-32B e Fino1-14B—entrambi commercializzati come capaci in ambito finanziario—ottengono 0,00%, apparentemente collassando sul tipo di relazione CombinationErr.
- FinMR è brutale: Fino1-14B è in testa con 13,86% di accuratezza; la maggior parte dei modelli si assesta su cifre a una sola percentuale. L'analisi degli errori attribuisce il 70–83% dei fallimenti a errori aritmetici nelle regole di calcolo multi-passaggio, con errori di formattazione strutturale che rappresentano il 9–71% a seconda del modello.
- I dati di origine sono 4.545 messaggi di errore DQC da depositi reali (2020–2024)—non esempi avversari sintetici. Il benchmark seleziona i 9 tipi di errore più frequenti, coprendo il 60,33% delle violazioni DQC reali.
- I modelli specializzati in dominio (Fino1-14B, FinR1) non battono sistematicamente i modelli generalisti di grandi dimensioni; Fino1-14B è in testa solo su FinMR, e anche lì il suo 13,86% è appena sopra il rumore.
Cosa regge—e cosa no
Il benchmark è prezioso proprio perché sfugge al formato delle coppie Q&A: il successo richiede di comprendere le relazioni nei linkbase, non solo di associare una domanda a un intervallo di testo. Ancorare la costruzione delle istanze alle violazioni DQC lo rende riproducibile e direttamente legato al processo di revisione reale.
Detto questo, ho delle riserve. I risultati FinRE sono sconcertanti: GPT-4o al 91,82% mentre i modelli capaci in dominio collassano allo 0,00% è una varianza che quasi certamente riflette sensibilità al prompt e disallineamento del formato di output piuttosto che capacità di ragionamento reale. Il documento testa tutti i modelli in modalità zero-shot senza ablare il formato del prompt o fornire baseline few-shot, rendendo impossibile attribuire i punteggi dello 0,00% all'intelligenza piuttosto che a fallimenti di parsing. Il framework LLM-as-judge usato per FinMR introduce un altro livello di rumore nella valutazione.
L'affermazione principale—"cali di accuratezza del 60–90% su strutture gerarchiche multi-documento"—ha anche bisogno di un ancoraggio più chiaro. Non è ovvio se questo confronto sia rispetto alla performance umana, a versioni a documento singolo degli stessi compiti, o a varianti appiattite (non gerarchiche). La direzione è giusta, ma senza quella baseline la magnitudine è difficile da interpretare.
Perché questo conta per l'AI finanziaria
I file Beancount non sono XBRL, ma condividono le proprietà strutturali chiave: uno spazio dei nomi di conti gerarchico analogo allo schema di tassonomia, vincoli di partita doppia che devono bilanciarsi analoghi ai linkbase di calcolo, e voci tipizzate che fanno riferimento a categorie canoniche analoghe all'associazione concetto-istanza. La modalità di fallimento di FinMR—modelli che commettono errori aritmetici nelle regole di calcolo multi-passaggio—è esattamente ciò che conta per la verifica del bilanciamento in Beancount. Se GPT-4o non può verificare in modo affidabile che gli alberi di addizione US-GAAP sommino correttamente in un deposito XBRL, quasi certamente non ci si può fidare che verifichi gerarchie contabili complesse in un registro senza scaricare l'aritmetica su uno strumento esterno (stile PAL).
I numeri di FinSM sono un avvertimento diretto per qualsiasi agente Beancount che mappi nomi di conti digitati dall'utente o descrizioni di transazioni a un piano dei conti canonico. Anche il modello migliore recupera il concetto corretto meno del 13% delle volte al rango 20. Il recupero basato su ranking è lontano dall'essere pronto per la produzione senza un retriever specializzato o un fine-tuning sulla tassonomia di destinazione.
Il non-risultato per i modelli specializzati in dominio è istruttivo: la scala grezza e il prompting strutturato determinano ancora i risultati più del pre-addestramento finanziario per questa classe di compiti di ragionamento strutturato.
Cosa leggere dopo
- From Local to Global: A Graph RAG Approach to Query-Focused Summarization (arXiv:2404.16130) — la struttura gerarchica dei linkbase XBRL è esattamente il tipo di grafo-su-documenti che GraphRAG di Microsoft mira a gestire; vale la pena leggerlo come risposta architetturale ai fallimenti di recupero di FinAuditing
- FinTagging: An LLM-ready Benchmark for Extracting and Structuring Financial Information (arXiv:2505.20650) — con autori sovrapposti, si concentra sulla mappatura dei fatti finanziari ai concetti di tassonomia (il compito a monte prima della revisione); completa l'ambito di FinAuditing
- Towards Verifiably Safe Tool Use for LLM Agents (arXiv:2601.08012) — se i modelli non possono verificare i calcoli in modo affidabile in modalità zero-shot, la risposta potrebbe essere una strumentazione di verifica formale stratificata sulle azioni dell'agente piuttosto che un prompting migliore