Salta al contenuto principale

Mike Thrift

Marketing Manager

Benchmark FinMaster: perché i modelli linguistici di grandi dimensioni ottengono il 96% in alfabetizzazione finanziaria ma il 3% nella generazione di rendiconti

FinMaster (arXiv:2505.13533) valuta o3-mini, Claude 3.7 Sonnet e DeepSeek-V3 in 183 attività finanziarie, rivelando che i modelli ottengono il 96% in alfabetizzazione finanziaria, ma crollano al 3% nella generazione di rendiconti, con attività di consulenza multi-step che perdono 21 punti di accuratezza a causa della propagazione degli errori.

ReAct: Sinergizzare Ragionamento e Azione nei Modelli Linguistici

ReAct (Yao et al., ICLR 2023) alterna ragionamento a catena di pensiero e azioni tramite strumenti in un'unica traiettoria, superando il puro CoT nella verifica dei fatti e l'apprendimento per imitazione in compiti incarnati di 34 punti percentuali. Questa analisi esamina le modalità di fallimento dell'articolo — distrazione indotta dalla ricerca ed errori cumulativi — e cosa significano per agenti autonomi che scrivono su libri mastri Beancount.