Salta al contenuto principale

Mike Thrift

Responsabile marketing

TAT-QA: Benchmark ibrido basato su tabella e testo per il ragionamento su relazioni finanziarie annuali

TAT-QA è un benchmark con 16.552 domande su contesti ibridi di tabelle e testo tratti da relazioni finanziarie, che ha dimostrato che l’ancoraggio dell’evidenza — non l’aritmetica — è il collo di bottiglia principale nell’IA finanziaria; entro il 2024, LLM 7B ottimizzati hanno raggiunto l’83% F1, colmando gran parte del divario rispetto al tetto umano del 91%.

FinQA: Il Benchmark che Misura il Ragionamento Numerico dell'IA sui Report Finanziari

FinQA (EMNLP 2021) ha costruito 8.281 coppie QA dai report sugli utili delle aziende S&P 500, richiedendo programmi aritmetici multi-step. I modelli neurali hanno ottenuto un punteggio del 61% al rilascio, contro il 91% degli esperti umani; l'accuratezza crolla al 22% su programmi con tre o più passaggi. Le modalità di fallimento — costanti di dominio, grounding cross-modale, lunghezza della catena — corrispondono direttamente alle sfide che gli agenti Beancount affrontano oggi.

FinanceBench: Perché il RAG basato su Vector-Store Fallisce sui Documenti Finanziari Reali

FinanceBench valuta 16 configurazioni AI su 10.231 domande tratte da documenti SEC reali; il RAG basato su un archivio vettoriale condiviso risponde correttamente solo nel 19% dei casi, e persino GPT-4-Turbo con il passaggio oracle raggiunge solo l'85% di precisione, dimostrando che il ragionamento numerico, e non il recupero, è il vincolo principale per l'AI finanziaria aziendale.

Self-RAG: Recupero Adattivo e Autocritica per LLM

Self-RAG (ICLR 2024 Oral) addestra un modello linguistico a decidere quando recuperare informazioni e poi a valutare i propri risultati utilizzando quattro token di riflessione — raggiungendo il 55,8% su PopQA e 80,2 FactScore sulle biografie, superando ChatGPT su cinque benchmark. L'analisi copre il meccanismo, i risultati delle ablazioni, i limiti di riproducibilità e le implicazioni per agenti di intelligenza artificiale finanziaria su registri Beancount.

AgentBench: valutare gli LLM come agenti — lezioni per l'affidabilità dell'AI finanziaria

AgentBench (Liu et al., ICLR 2024) confronta 27 LLM in 8 ambienti interattivi — GPT-4 ha ottenuto 4,01 complessivo contro 0,96 per il miglior modello open-source. Le tre modalità di errore dominanti (limite di attività superato nel 67,9% degli errori del grafo di conoscenza, errori di formato nel 53,3% degli errori del database e azioni non valide) si traducono direttamente nei rischi di implementare un agente di scrittura-beancount su un registro reale.

BloombergGPT e i Limiti dei LLM Specifici di Dominio nella Finanza

Bloomberg ha addestrato un LLM da 50 miliardi di parametri su 569 miliardi di token di dati finanziari, superando i modelli generici nei benchmark di sentiment analysis e ragionamento su tabelle, finché GPT-4 non lo ha eguagliato senza alcun pre-addestramento specifico per la finanza. Cosa rivela l'esperimento da 10 milioni di dollari sui compromessi del pre-addestramento di dominio, la tokenizzazione dei numeri e perché l'uso di strumenti è più affidabile degli interni del modello per gli agenti contabili.

AutoGen: Framework di Conversazione Multi-Agente per l'AI Finanziaria

AutoGen (Wu et al., 2023) introduce un framework di conversazione multi-agente in cui agenti basati su LLM si scambiano messaggi per completare attività; una configurazione a due agenti porta l'accuratezza sul benchmark MATH dal 55% al 69%, e un agente SafeGuard dedicato migliora il rilevamento di codice non sicuro fino a 35 punti F1 — risultati direttamente applicabili alla creazione di pipeline di automazione Beancount sicure e modulari.

Gorilla: Come l'Addestramento Retrieval-Aware Riduce le Allucinazioni delle API LLM dal 78% all'11%

Gorilla (Patil et al., NeurIPS 2024) mette a punto un modello LLaMA da 7B con Addestramento Retriever-Aware sulla documentazione API recuperata, riducendo i tassi di allucinazione dal 78% all'11% rispetto a GPT-4 zero-shot — con implicazioni dirette per gli agenti di scrittura AI in finanza, dove nomi di conto errati o segni invertiti sono fallimenti di correttezza, non fastidi.