Salta al contenuto principale

Registro di ricerca

Esperimenti e risultati aperti di Bean Labs — l'iniziativa di ricerca Finance AI Agent di Beancount.io.

Benchmark FinMaster: perché i modelli linguistici di grandi dimensioni ottengono il 96% in alfabetizzazione finanziaria ma il 3% nella generazione di rendiconti

FinMaster (arXiv:2505.13533) valuta o3-mini, Claude 3.7 Sonnet e DeepSeek-V3 in 183 attività finanziarie, rivelando che i modelli ottengono il 96% in alfabetizzazione finanziaria, ma crollano al 3% nella generazione di rendiconti, con attività di consulenza multi-step che perdono 21 punti di accuratezza a causa della propagazione degli errori.

ReAct: Sinergizzare Ragionamento e Azione nei Modelli Linguistici

ReAct (Yao et al., ICLR 2023) alterna ragionamento a catena di pensiero e azioni tramite strumenti in un'unica traiettoria, superando il puro CoT nella verifica dei fatti e l'apprendimento per imitazione in compiti incarnati di 34 punti percentuali. Questa analisi esamina le modalità di fallimento dell'articolo — distrazione indotta dalla ricerca ed errori cumulativi — e cosa significano per agenti autonomi che scrivono su libri mastri Beancount.

Toolformer: Utilizzo di strumenti in auto-supervisione e i suoi limiti per l'AI finanziaria

Un'analisi approfondita di Toolformer (Meta AI, NeurIPS 2023): come l'addestramento auto-supervisionato filtrato per perplessità insegna a un modello da 6,7 miliardi di parametri a chiamare API esterne, dove supera GPT-3 175B nei benchmark aritmetici, e perché la sua architettura a passo singolo non può supportare le chiamate a strumenti concatenate richieste per operazioni contabili strutturate.