LOG-009 ha trattato PAL, che scarica l'aritmetica su un interprete Python così che il modello non debba mai calcolare da solo. La self-consistency affronta un problema ortogonale: cosa succede se il modello ragiona correttamente la maggior parte delle volte, ma non sempre? La risposta risulta essere statistica piuttosto che architetturale — e sorprendentemente efficace.
Il paper
"Self-Consistency Improves Chain of Thought Reasoning in Language Models" di Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery e Denny Zhou (ICLR 2023, arXiv:2203.11171) introduce una strategia di decodifica che sostituisce un singolo percorso greedy di chain-of-thought con un voto di maggioranza su molti percorsi campionati. L'intuizione è compatta: un problema di ragionamento difficile ha tipicamente una risposta corretta ma molte vie valide per arrivarci; una risposta sbagliata è più probabile che derivi da errori idiosincratici che non convergono tutti sullo stesso errore.
Il metodo è plug-and-play. Prendi qualunque prompt di chain-of-thought (CoT) che già possiedi, campiona N completamenti a temperatura non nulla, estrai la risposta finale da ciascuno e restituisci la risposta di maggioranza. Nessun fine-tuning, nessun modello aggiuntivo, nessuna etichetta umana supplementare.
Idee chiave
- Dimensione del campione e temperatura: il paper usa 40 percorsi di ragionamento per problema a temperatura 0,7. Non è un numero magico derivato da una ricerca di iperparametri — le ablazioni mostrano che i guadagni raggiungono un plateau intorno a 20–30 campioni, quindi 40 è una scelta prudente.
- Guadagni principali rispetto al CoT standard: GSM8K +17,9%, SVAMP +11,0%, AQuA +12,2%, StrategyQA +6,4%, ARC-challenge +3,9% — tutti miglioramenti assoluti di accuratezza con lo stesso modello e prompt.
- Risultati su GSM8K per modello: su text-davinci-002 (GPT-3), la self-consistency porta l'accuratezza dal 78,7% all'86,5%. Su Codex, dal 74,5% all'82,3%. I guadagni sono coerenti tra le famiglie di modelli.
- Nessun costo di addestramento: tutto avviene al momento dell'inferenza. L'approccio funziona con qualsiasi API black-box in cui si possa campionare a temperatura > 0.
- Voto di maggioranza per risposte estraibili: l'aggregazione è pulita quando le risposte sono discrete (un numero, una scelta tra lettere). Per la generazione a risposta aperta il paper è meno specifico sul definire "la più coerente" — una limitazione che gli autori riconoscono.
C cosa regge — e cosa no
I guadagni empirici sono reali, ampiamente replicati, e il metodo è genuinamente utile. Ma diverse debolezze strutturali meritano attenzione.
Primo, il costo scala linearmente con il numero di campioni. Campionare 40 percorsi all'inferenza costa 40 volte il budget di token di un singolo percorso. Per i compiti in cui latenza e costo API contano — un agente che elabora centinaia di transazioni a notte — non è gratis. Lavori successivi (Early-Stopping Self-Consistency, ICLR 2024) affrontano questo problema: fermandosi appena un voto raggiunge una soglia di confidenza, si possono ridurre i campioni dell'80% su GSM8K senza alcuna perdita misurabile di accuratezza. Il paper originale non discute affatto il costo, un'omissione singolare.
Secondo, l'assunzione del voto di maggioranza crolla quando il modello è sistematicamente in errore. Se il modello fraintende costantemente una conversione di valuta o applica male una regola fiscale in tutti i 40 percorsi, la risposta sbagliata vince il voto. La self-consistency amplifica l'errore più comune, non quello corretto. Questo è il divario epistemologico centrale: il metodo aumenta la precisione all'interno della distribuzione di credenze del modello, ma non fa nulla per la calibrazione quando quella distribuzione è centrata sulla risposta sbagliata.
Terzo, Wang & Wang (2025, arXiv:2503.16974) studiano la coerenza degli LLM direttamente su compiti finanziari e contabili attraverso 50 esecuzioni indipendenti. Scoprono che la classificazione binaria e l'analisi del sentiment sono già quasi perfettamente riproducibili con un singolo campione, mentre i compiti complessi (previsioni, generazione) mostrano una variabilità reale. La loro conclusione pratica: aggregare solo 3–5 esecuzioni migliora drasticamente la coerenza nei compiti complessi — una versione molto più economica della stessa idea di self-consistency.
Perché conta per l'IA finanziaria
Le operazioni sui registri Beancount che coinvolgono aritmetica multi-step — calcoli fiscali, base di costo rettificata per valuta, piani di ammortamento, corrispondenza delle fatture — sono esattamente i compiti in cui una singola decodifica greedy è inaffidabile, ma la risposta corretta è unica e verificabile. La self-consistency è un intervento economico che dovrebbe essere standard per qualsiasi compito di un agente finanziario in cui l'output può essere controllato (il saldo è ancora a zero?).
L'implicazione più interessante è architetturale. La self-consistency trasforma l'inferenza in un insieme di voto. Per la sicurezza delle scritture — un agente che inserisce voci di giornale in un registro — io limiterei l'accesso in base alla confidenza di maggioranza: scrivi solo se 35 dei 40 percorsi concordano. Il disaccordo è un segnale che l'agente dovrebbe inoltrare il caso a un umano invece di scrivere. Questo è un filtro di sicurezza concreto e implementabile che costa budget di inferenza, non complessità ingegneristica.
La modalità di fallimento per bias sistematico conta particolarmente per le regole fiscali e normative, dove è noto che i modelli allucinano dettagli specifici della giurisdizione. In quei casi PAL (LOG-009) è la soluzione giusta: scaricare del tutto il calcolo. Self-consistency e PAL si completano a vicenda — PAL gestisce la correttezza aritmetica; la self-consistency gestisce l'ambiguità e l'affidabilità del ragionamento.
Cosa leggere dopo
- Tree of Thoughts: Deliberate Problem Solving with Large Language Models (Yao et al., 2023, arXiv:2305.10601) — estende la self-consistency dal votare sui percorsi alla ricerca tra i percorsi, il che conta quando lo spazio di ragionamento si dirama invece di procedere in parallelo.
- Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning (Lei et al., ICLR 2024) — la soluzione al problema dei costi; riduce il campionamento di oltre l'80% su GSM8K preservando l'accuratezza.
- Universal Self-Consistency for Large Language Models (Chen et al., arXiv:2311.17311) — estende il voto di maggioranza alla generazione a risposta aperta con un giudice LLM, colmando il divario di aggregazione che il paper originale lascia aperto.





