Bean Labs Research Log
Open experiments and findings from Bean Labs — the Finance AI Agent research initiative by Beancount.io. Sfoglia per tag.
PHANTOM (NeurIPS 2025): Misurazione del Rilevamento di Allucinazioni negli LLM in Documenti Finanziari
PHANTOM (NeurIPS 2025) è il primo benchmark a misurare il rilevamento di allucinazioni negli LLM su reali depositi SEC per contesti di lunghezza fino a 30.000 token. Qwen3-30B-A3B-Thinking è leader con F1=0,882; i modelli da 7B ottengono punteggi vicini a una scelta casuale — con implicazioni dirette per agenti contabili autonomi.
Benchmark FinMaster: perché i modelli linguistici di grandi dimensioni ottengono il 96% in alfabetizzazione finanziaria ma il 3% nella generazione di rendiconti
FinMaster (arXiv:2505.13533) valuta o3-mini, Claude 3.7 Sonnet e DeepSeek-V3 in 183 attività finanziarie, rivelando che i modelli ottengono il 96% in alfabetizzazione finanziaria, ma crollano al 3% nella generazione di rendiconti, con attività di consulenza multi-step che perdono 21 punti di accuratezza a causa della propagazione degli errori.
ReAct: Sinergizzare Ragionamento e Azione nei Modelli Linguistici
ReAct (Yao et al., ICLR 2023) alterna ragionamento a catena di pensiero e azioni tramite strumenti in un'unica traiettoria, superando il puro CoT nella verifica dei fatti e l'apprendimento per imitazione in compiti incarnati di 34 punti percentuali. Questa analisi esamina le modalità di fallimento dell'articolo — distrazione indotta dalla ricerca ed errori cumulativi — e cosa significano per agenti autonomi che scrivono su libri mastri Beancount.
Toolformer: Utilizzo di strumenti in auto-supervisione e i suoi limiti per l'AI finanziaria
Un'analisi approfondita di Toolformer (Meta AI, NeurIPS 2023): come l'addestramento auto-supervisionato filtrato per perplessità insegna a un modello da 6,7 miliardi di parametri a chiamare API esterne, dove supera GPT-3 175B nei benchmark aritmetici, e perché la sua architettura a passo singolo non può supportare le chiamate a strumenti concatenate richieste per operazioni contabili strutturate.
FinBen: Benchmarking di 36 Compiti Finanziari con LLM — Implicazioni per l'IA Contabile
FinBen valuta 15 LLM su 36 dataset finanziari a NeurIPS 2024, scoprendo che GPT-4 raggiunge 0,63 di Exact Match nel QA numerico e 0,54 nella previsione dei movimenti azionari — vicino al caso. Ecco cosa significano questi numeri per costruire un agente contabile affidabile su un registro Beancount.