Sto rileggendo l'articolo del 2022 di Wei et al. sul Chain-of-Thought (arXiv:2201.11903) con una domanda specifica in mente: esperimenti precedenti hanno mostrato che il prompting CoT migliorava la precisione ma danneggiava il richiamo nel rilevamento di anomalie finanziarie. L'articolo dovrebbe spiegare il perché — o almeno darmi abbastanza intuizione meccanicistica per formulare un'ipotesi.
L'articolo
"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models" di Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma e colleghi (Google Brain) è l'articolo che ha messo il CoT sulla mappa. L'idea è semplice: invece di chiedere a un modello di saltare direttamente a una risposta, gli mostri alcuni esempi in cui la risposta è preceduta da una traccia di ragionamento scritta. Il modello produce quindi la propria traccia di ragionamento prima di rispondere.
L'articolo testa questo su compiti aritmetici (GSM8K, SVAMP, AQuA), di buon senso (CommonsenseQA, StrategyQA) e di ragionamento simbolico (concatenazione di lettere, lancio di monete) su tre modelli linguistici di grandi dimensioni — PaLM 540B, GPT-3 175B e LaMDA 137B — e li confronta con il prompting standard a pochi esempi.
Idee chiave
- GSM8K (problemi matematici testuali): il prompting standard con PaLM 540B ottiene il 17,9%; il CoT ottiene il 56,9%, un balzo di 39 punti. Questo è un guadagno sbalorditivo su un benchmark difficile, ed è il risultato principale per cui l'articolo è giustamente famoso.
- Concatenazione di lettere: standard 7,6%, CoT 99,4%. Per la pura manipolazione simbolica, il CoT risolve essenzialmente il compito su larga scala.
- CommonsenseQA: standard 78,1%, CoT 79,9%. Guadagno minimo. I compiti che non richiedono inferenze a più passaggi non ne traggono grande beneficio.
- Barriera di scala: il CoT aiuta in modo affidabile solo a circa 100 miliardi+ di parametri. Al di sotto di ~10 miliardi, l'aggiunta di una traccia di ragionamento spesso danneggia — il modello produce "catene di pensiero fluenti ma illogiche", che lo fuorviano attivamente.
- I compiti facili non mostrano benefici: su MAWPS SingleOp (aritmetica a un solo passaggio), PaLM 540B ha ottenuto il 94,1% sia con prompting standard che con CoT. Il sovraccarico di ragionamento non aggiunge valore quando il compito non richiede effettivamente un'inferenza a più passaggi.
- Nessuna garanzia di correttezza: gli autori sono espliciti sul fatto che un LLM può produrre una traccia di ragionamento dall'aspetto coerente che porta a una risposta sbagliata. La traccia e la risposta sono generate congiuntamente e nessuna delle due è verificata in modo indipendente.
Cosa regge — e cosa no
I risultati empirici reggono. I guadagni su GSM8K sono replicati in lavori successivi, la soglia di scala corrisponde a quanto osservato altrove, e i numeri di ragionamento simbolico sono coerenti con quanto ci si aspetterebbe dai meccanismi di apprendimento nel contesto. Questo articolo ha fatto vera scienza.
Quello che trovo poco esplorato è l'asimmetria precisione/richiamo. Wei et al. mostrano numeri di accuratezza aggregati — non scompongono i tassi di falsi positivi rispetto ai falsi negativi. Ma se si pensa a come il CoT cambi la distribuzione delle risposte, il meccanismo è suggestivo: il CoT spinge il modello a generare e impegnarsi in un percorso di ragionamento. Questo restringimento dello spazio di generazione probabilmente aumenta la specificità (precisione) a scapito della copertura (richiamo). Il modello produce meno risposte in generale, e quelle che produce tendono ad essere meglio giustificate — ma potrebbe tralasciare risposte corrette che non si adattano a una narrazione ordinata passo dopo passo. Per il rilevamento di anomalie nei dati finanziari, dove la classe "anomalia" è rara e atipica per definizione, questa è esattamente la modalità di fallimento che ci si aspetterebbe.
L'articolo lascia anche aperta la questione meccanicistica. Gli autori sono attenti a non affermare che il modello stia "effettivamente ragionando" in senso forte. Se il CoT eliciti una genuina inferenza a più passaggi o una scorciatoia sofisticata di pattern-matching che la imita, rimane irrisolto. Un rapporto del 2025 di Wharton che testa modelli di ragionamento moderni (o3-mini, o4-mini) ha scoperto che le istruzioni esplicite di CoT producevano solo guadagni marginali del 2-3%, e talvolta riducevano la "precisione perfetta" innescando errori su domande a cui il modello avrebbe altrimenti risposto correttamente. La soglia di scala dell'articolo potrebbe essersi spostata man mano che i modelli sono migliorati nel ragionamento implicito — ma il problema della variabilità, dove il CoT introduce una probabilità non nulla di far deragliare una risposta altrimenti corretta, persiste.
Perché questo è importante per l'AI finanziaria
Tre connessioni con l'agenda di Bean Labs:
Primo, il problema di sicurezza del write-back. Un agente con prompting CoT che spiega il suo ragionamento prima di eseguire un'azione di registrazione fornisce una traccia di audit — ma la traccia di ragionamento non è una garanzia di correttezza. L'agente può produrre una spiegazione dall'aspetto plausibile per un'azione sbagliata. Questo significa che mostrare agli utenti una traccia di ragionamento può creare falsa fiducia piuttosto che una reale verificabilità.
Secondo, l'asimmetria nel rilevamento di anomalie. Se il CoT aumenta la precisione ma riduce il richiamo nei compiti di rilevamento di eventi rari, allora per i casi d'uso di Beancount — trovare transazioni classificate erroneamente, segnalare voci duplicate, cogliere violazioni delle policy — usare il CoT ingenuamente può produrre meno falsi allarmi al costo di perdere veri problemi. Questo è potenzialmente il compromesso sbagliato. Un agente finanziario che spiega con sicurezza perché non ha segnalato qualcosa di sospetto è più pericoloso di uno che segnala troppo.
Terzo, la dipendenza dalla scala. Se gli agenti finanziari di produzione girano su modelli più piccoli per ragioni di costo o latenza, i guadagni del CoT svaniscono — e possono invertirsi. Qualsiasi valutazione di un agente finanziario basato su CoT deve essere eseguita alla stessa scala di modello utilizzata in produzione.
Cosa leggere dopo
- "Self-Consistency Improves Chain of Thought Reasoning in Language Models" (Wang et al., 2022, arXiv:2203.11171) — campiona più percorsi CoT e prende la maggioranza; affronta direttamente il problema della varianza segnalato da Wei et al.
- "Large Language Models are Zero-Shot Reasoners" (Kojima et al., 2022, arXiv:2205.11916) — mostra che "Pensiamo passo dopo passo" senza esempi elicita comunque ragionamento; testa il confine di ciò di cui il CoT ha effettivamente bisogno
- "Is Chain-of-Thought Reasoning of LLMs a 'Reasoning' or 'Searching' Process?" (arXiv:2508.01191) — attacca direttamente la questione meccanicistica che l'articolo originale lascia aperta