BloombergGPT è stato pubblicato nel marzo 2023 ed è diventato immediatamente il punto di riferimento per ogni discussione sui LLM specifici di dominio nella finanza. Lo sto leggendo ora non perché sia attuale — non lo è — ma perché la storia di ciò che è successo dopo il suo rilascio è istruttiva almeno quanto ciò che è contenuto nell'articolo stesso.
L'articolo
Wu et al. di Bloomberg hanno addestrato un modello linguistico da 50 miliardi di parametri su un corpus di 569 miliardi di token suddiviso approssimativamente a metà: 363 miliardi di token da FinPile, un dataset finanziario proprietario assemblato dagli archivi di Bloomberg risalenti al 2007, e 345 miliardi di token da dataset pubblici per uso generale. FinPile copre articoli di notizie, documenti, comunicati stampa, trascrizioni di chiamate sugli utili e pagine finanziarie estratte dal web. Il modello stesso segue un'architettura LM causale decoder-only (stile BLOOM, che utilizza codifiche posizionali ALiBi), addestrato su 64 × 8 GPU A100 da 40 GB per 139.200 step.
L'affermazione centrale è che il pre-addestramento su domini misti — non solo il fine-tuning — produce un modello che "supera i modelli esistenti nei compiti finanziari con margini significativi senza sacrificare le prestazioni sui benchmark LLM generali." Questa è l'ipotesi fondante della strategia del LLM specifico di dominio: puoi avere la botte piena e la moglie ubriaca.
Idee chiave
- Accuratezza ConvFinQA: 43,41% contro 30,06% di GPT-NeoX. I maggiori guadagni rispetto alle baseline di dimensioni comparabili sono emersi in compiti che richiedono ragionamento multi-step su tabelle finanziarie incorporate in conversazioni — esattamente il tipo di ragionamento strutturato con cui i modelli generici addestrati su meno dati finanziari faticano.
- Sentiment FiQA: F1 75,07% contro 50,59% di GPT-NeoX. Quasi 25 punti percentuali in più sull'analisi del sentiment finanziario. I guadagni nei compiti di classificazione con un vocabolario finanziario chiaro sono stati i più drammatici.
- I benchmark interni hanno raccontato una storia ancora più netta. Sul compito proprietario di Equity News Sentiment di Bloomberg, BloombergGPT ha raggiunto un F1 del 79,63%; GPT-NeoX ha raggiunto il 14,17%. Quei numeri interni non sono verificabili, ma sono anche il punto centrale — Bloomberg ha costruito il modello per compiti che solo loro possono definire.
- Il NER è stato il punto debole notevole. Sul compito di NER finanziario, BloombergGPT ha ottenuto un F1 del 60,82%, leggermente dietro al 60,98% di GPT-NeoX — un promemoria che non tutti i compiti di NLP beneficiano allo stesso modo dal pre-addestramento finanziario e che i modelli generativi faticano con l'estrazione strutturata di span indipendentemente dal dominio.
- Il tokenizer di GPT-2 non trattava i numeri in modo speciale. Un numero come 5.234 poteva essere suddiviso tra i token in modi imprevedibili. Gli autori hanno segnalato questo come una preoccupazione per il ragionamento numerico, ma non vi hanno posto rimedio a livello architetturale — il che conta enormemente per qualsiasi cosa riguardi l'aritmetica contabile.
- L'instabilità dell'addestramento era reale. Agli step 115.500, 129.900 e 137.100, la norma del gradiente è aumentata e il team ha dovuto ripristinare i checkpoint e ridurre il tasso di apprendimento. L'appendice del Training Chronicles dell'articolo è insolitamente schietta su questo. Costruire LLM di dominio su larga scala è operativamente più difficile di quanto suggerisca l'astrazione.
Cosa regge — e cosa no
Il risultato fondamentale — che l'aggiunta di dati specifici di dominio migliora le prestazioni nei compiti finanziari rispetto a modelli generici di pari dimensione — è ben supportato e non sorprendente. La domanda interessante è se il margine giustifichi il costo.
Quando è stato rilasciato GPT-4, diversi ricercatori (incluso Ethan Mollick in un thread ampiamente citato) hanno sottolineato che GPT-4 supera BloombergGPT in quasi tutti i benchmark finanziari pubblici con cui è stato confrontato — nonostante GPT-4 non abbia accesso ai dati proprietari di Bloomberg e non abbia ricevuto alcun pre-addestramento specifico per la finanza oltre a ciò che è apparso nel suo corpus di addestramento generale. Uno studio di Yang et al. (arXiv:2305.05862) ha valutato ChatGPT e GPT-4 su otto benchmark NLP finanziari e ha scoperto che GPT-4 era costantemente competitivo o superiore ai modelli finanziari specifici messi a punto. Bloomberg avrebbe speso circa 10 milioni di dollari per la sessione di addestramento. La lezione che il settore ha tratto da questo: la scala batte la specializzazione quando la frontiera si muove abbastanza velocemente.
Tuttavia, questa interpretazione è troppo pulita. I benchmark interni di BloombergGPT — quelli che coinvolgono terminologia e formati di documenti specifici di Bloomberg che GPT-4 non ha mai visto — rimangono plausibilmente l'argomento più forte del modello. Non puoi valutare le prestazioni proprietarie dall'esterno. Il confronto sui benchmark pubblici è un test parziale della tesi reale.
Ciò che trovo genuinamente poco esaminato nell'articolo è il problema della tokenizzazione. La finanza è un dominio in cui i numeri esatti contano: 5.234,78 non è approssimativamente 5.235. Un tokenizer che smembra le stringhe numeriche in modo imprevedibile è una responsabilità strutturale per qualsiasi compito quantitativo, e gli autori lo riconoscono senza risolverlo. Questa non è una nota a piè di pagina minore — è una causa principale dei fallimenti aritmetici che affliggono i modelli linguistici nei calcoli finanziari.
Perché questo è importante per l'AI finanziaria
Per l'agenda di Bean Labs, la storia di BloombergGPT punta in due direzioni contemporaneamente. In primo luogo, il pre-addestramento specifico di dominio può aiutare significativamente in compiti di classificazione ristretti — sentiment, etichettatura di titoli, NER — ma questi non sono i problemi difficili per gli agenti contabili autonomi. I problemi difficili sono il ragionamento multi-step sulle voci contabili, la scrittura sicura (write-back) e la rilevazione di errori nelle catene aritmetiche. I modelli di classe GPT-4 gestiscono già bene i compiti di classificazione facili.
In secondo luogo, il problema della tokenizzazione è direttamente rilevante per gli agenti Beancount. Ogni voce contabile coinvolge importi monetari, numeri di conto e date. Se il tokenizer del modello sottostante frammenta "1.234,56 USD" in modo imprevedibile, qualsiasi agente che esegue una riconciliazione multi-step sta lavorando contro il proprio substrato. Ciò suggerisce che gli approcci basati sull'uso di strumenti — in cui l'aritmetica è delegata a un interprete Python piuttosto che elaborata tramite linguaggio naturale (come in PAL, di cui ho parlato in LOG-009) — sono più robusti dell'affidarsi agli interni del modello, indipendentemente da quanto testo finanziario sia stato addestrato il modello.
La lezione più profonda: il pre-addestramento specifico di dominio è più prezioso quando i compiti a valle richiedono il riconoscimento di vocabolario specializzato e struttura documentale — non quando richiedono precisione numerica. Per Beancount, ciò significa che l'investimento nel fine-tuning dovrebbe probabilmente mirare all'istruzione seguente e all'uso di strumenti piuttosto che alla modellazione grezza del linguaggio finanziario.
Cosa leggere dopo
- FinGPT: Open-Source Financial Large Language Models (Yang et al., 2023, arXiv:2306.06031) — la risposta open-source a BloombergGPT; utilizza il fine-tuning LoRA di LLM pubblici su dati finanziari per circa 300 dollari invece di 10 milioni; un test diretto dell'economia del fine-tuning rispetto al pre-addestramento
- Are ChatGPT and GPT-4 General-Purpose Solvers for Financial Text Analytics? (Yang et al., 2023, arXiv:2305.05862) — il confronto sistematico che ha mostrato GPT-4 eguagliare o superare i modelli finanziari specifici sui benchmark pubblici; essenziale per calibrare quanto il pre-addestramento di dominio stia effettivamente comprando
- Scaling Laws for Neural Language Models (Kaplan et al., 2020, arXiv:2001.08361) — l'articolo sullo scaling ottimale in termini computazionali che inquadra perché GPT-4 probabilmente supera BloombergGPT; il follow-up con Chinchilla (Hoffmann et al., arXiv:2203.15556) è altrettanto rilevante