FinBen è stato presentato a NeurIPS 2024 come la valutazione pubblica più completa dei LLM su compiti finanziari mai realizzata fino ad oggi. Desideravo leggerlo attentamente perché, prima di progettare un agente autonomo per registri Beancount, ho bisogno di un quadro realistico di dove si trovino realmente i modelli all'avanguardia nei compiti di ragionamento finanziario che un tale agente dovrebbe eseguire.
Il paper
Qianqian Xie e 33 co-autori presentano FinBen, un benchmark open-source che copre 36 dataset attraverso 24 compiti finanziari, organizzati in sette dimensioni: estrazione di informazioni, analisi testuale, risposta a domande, generazione di testo, gestione del rischio, previsione e processo decisionale. Valutano 15 LLM rappresentativi — tra cui GPT-4, ChatGPT, Gemini e diversi modelli open-source ottimizzati tramite istruzioni — e introducono tre nuovi dataset per riepilogo, QA e valutazione del trading azionario.
La motivazione centrale è che i precedenti benchmark finanziari come FLUE e FLARE catturavano ciascuno solo una fetta del NLP finanziario, ma nulla di vicino all'intero processo. FinBen è il primo tentativo di coprire l'intero spettro in un unico posto, ed è stato accettato nel NeurIPS 2024 Datasets and Benchmarks Track, il che gli conferisce un ragionevole timbro di rigore metodologico.
Idee chiave
- Nel riconoscimento di entità nominate, GPT-4 ottiene 0,83 di F1 Entity sul dataset FINER-ORD — buono, ma questa è la categoria più semplice del benchmark.
- In FinQA (ragionamento numerico su report finanziari), GPT-4 raggiunge 0,63 di Exact Match; nella variante conversazionale ConvFinQA, ottiene 0,76. Sono risultati rispettabili, ma lungi dall'essere risolti.
- Il modello FinMA 7B ottimizzato sul dominio raggiunge 0,88 di F1 nella sentiment analysis su FPB — superando GPT-4 in questo compito ristretto, confermando che l'ottimizzazione fine paga ancora in classificazioni ben definite.
- La previsione dei movimenti azionari è il punto di fallimento più chiaro: anche GPT-4 ottiene circa 0,54 di accuratezza — poco sopra il caso. Gli autori definiscono questo "una notevole carenza nella capacità dei LLM di affrontare le previsioni."
- GPT-4 raggiunge uno Sharpe Ratio di 1,51 nel compito di trading, contro 1,03 per Gemini e un rendimento cumulativo del 28,19% contro un rendimento buy-and-hold del −4,00% durante il periodo di valutazione — ma si tratta di un backtest breve con tutte le solite avvertenze.
- Tutti i modelli hanno ottenuto zero nel riepilogo estrattivo, e GPT-4 ha ottenuto 0,01 di F1 nell'estrazione di relazioni. Le capacità crollano bruscamente al di fuori della zona di comfort della classificazione testuale e della generazione a risposta aperta.
Cosa funziona e cosa no
Il benchmark è genuinamente utile come strumento di indagine. La gamma di compiti è più ampia di qualsiasi cosa sia stata realizzata prima, e il rilascio open-source permette ad altri di costruire sull'infrastruttura di valutazione invece di ricominciare da capo.
Detto questo, ho reali preoccupazioni su cosa FinBen possa effettivamente dirci. Il periodo di valutazione del trading è breve e specifico per un mercato; uno Sharpe Ratio calcolato su pochi mesi su azioni statunitensi non è un segnale stabile. I punteggi zero nel riepilogo estrattivo ci dicono che qualcosa è rotto, ma il paper non diagnostica perché — è un problema di formato del prompt, un artefatto di tokenizzazione, o un vero fallimento di ragionamento? La distinzione è importante per chiunque cerchi di risolvere il problema.
Il benchmark è anche quasi esclusivamente in inglese e incentrato sul mercato statunitense. Questa non è solo un'avvertenza di generalizzazione; significa che i risultati dicono molto poco sulle prestazioni su, ad esempio, documenti finanziari tedeschi o cinesi, o su giurisdizioni con standard contabili diversi. Per un progetto come Beancount.io che serve una base di utenti globale, questa è una lacuna significativa.
Anche la storia dei modelli ottimizzati tramite istruzioni è più torbida di quanto appaia inizialmente. L'ottimizzazione fine aiuta nella sentiment analysis (FinMA 7B a 0,88) ma "fornisce solo miglioramenti marginali per compiti complessi come il QA". Il paper riporta questo come risultato ma non offre una spiegazione meccanicistica. È un oblio catastrofico sulla capacità di ragionamento del modello base? La distribuzione dei dati di ottimizzazione è troppo ristretta? L'area di superficie del benchmark da sola non può rispondere a questo.
Perché questo è importante per l'IA finanziaria
I risultati di FinBen forniscono a Bean Labs una baseline più pulita di quella che avevamo prima. I compiti più rilevanti per un agente contabile su registro Beancount — QA numerico su report finanziari strutturati (FinQA: 0,63 Exact Match), estrazione di informazioni da descrizioni di transazioni (NER: 0,83 F1) e rilevamento di anomalie o classificazione di frodi (compiti di gestione del rischio che mostrano ampia varianza) — sono tutti rappresentati qui, e nessuno di essi è risolto.
Il crollo delle previsioni (0,54 sui movimenti azionari) è in realtà rassicurante per il nostro caso d'uso più ristretto: non stiamo chiedendo ai modelli di prevedere i mercati, stiamo chiedendo loro di classificare, estrarre e riscrivere voci strutturate. Quei compiti si collocano nell'intervallo 0,63–0,83 a seconda della complessità, che è una base di lavoro accettabile — sebbene "di lavoro" non sia "sicuro per la produzione senza revisione umana."
Il divario tra estrazione strutturata e ragionamento a risposta aperta si mappa anche direttamente sul problema di sicurezza della riscrittura. Se un modello può estrarre in modo affidabile un'entità (F1 0,83) ma fatica a ragionare sulle sue implicazioni numeriche (FinQA 0,63) o a generare output strutturati corretti (estrazione di relazioni: 0,01), allora l'architettura più sicura mantiene questi passaggi separati, con validazione esplicita tra di essi.
Cosa leggere dopo
- FinMaster (arXiv:2505.13533) — effettua un benchmark esplicito di flussi di lavoro contabili end-to-end, inclusa la registrazione di scritture contabili e la riconciliazione; più vicino al compito Beancount di qualsiasi altra cosa in FinBen.
- "Table Meets LLM: Can Large Language Models Understand Structured Table Data?" (arXiv:2305.13062, WSDM 2024) — i registri Beancount sono essenzialmente tabelle strutturate; questo paper fa un benchmark esatto delle capacità di comprensione strutturale che sono alla base di qualsiasi agente di lettura di registri.
- ReAct: Synergizing Reasoning and Acting in Language Models (arXiv:2210.03629) — il framework di ragionamento e azione interleaved è ciò che la maggior parte degli agenti di riscrittura utilizzerebbe; comprendere le sue modalità di fallimento è più importante ora che FinBen ha mostrato dove si trova effettivamente il livello di base del ragionamento.