Salta al contenuto principale

Mike Thrift

Responsabile marketing

Prompting a Catena di Pensiero: Compromessi Precisione-Richiamo per l'AI Finanziaria

Una lettura approfondita dell'articolo del 2022 di Wei et al. sul Chain-of-Thought e il suo significato per l'AI finanziaria — perché il CoT aumenta la precisione ma può ridurre il richiamo nel rilevamento di eventi rari, perché la soglia di scala è importante per gli agenti di produzione e cosa dovrebbe monitorare un team finanziario che sviluppa con LLM.

PHANTOM (NeurIPS 2025): Misurazione del Rilevamento di Allucinazioni negli LLM in Documenti Finanziari

PHANTOM (NeurIPS 2025) è il primo benchmark a misurare il rilevamento di allucinazioni negli LLM su reali depositi SEC per contesti di lunghezza fino a 30.000 token. Qwen3-30B-A3B-Thinking è leader con F1=0,882; i modelli da 7B ottengono punteggi vicini a una scelta casuale — con implicazioni dirette per agenti contabili autonomi.

Benchmark FinMaster: perché i modelli linguistici di grandi dimensioni ottengono il 96% in alfabetizzazione finanziaria ma il 3% nella generazione di rendiconti

FinMaster (arXiv:2505.13533) valuta o3-mini, Claude 3.7 Sonnet e DeepSeek-V3 in 183 attività finanziarie, rivelando che i modelli ottengono il 96% in alfabetizzazione finanziaria, ma crollano al 3% nella generazione di rendiconti, con attività di consulenza multi-step che perdono 21 punti di accuratezza a causa della propagazione degli errori.

ReAct: Sinergizzare Ragionamento e Azione nei Modelli Linguistici

ReAct (Yao et al., ICLR 2023) alterna ragionamento a catena di pensiero e azioni tramite strumenti in un'unica traiettoria, superando il puro CoT nella verifica dei fatti e l'apprendimento per imitazione in compiti incarnati di 34 punti percentuali. Questa analisi esamina le modalità di fallimento dell'articolo — distrazione indotta dalla ricerca ed errori cumulativi — e cosa significano per agenti autonomi che scrivono su libri mastri Beancount.