Salta al contenuto principale

Auto-coerenza: il voto di maggioranza aumenta l'accuratezza della catena di pensiero

5 minuti di letturaMike ThriftMike Thrift
Auto-coerenza: il voto di maggioranza aumenta l'accuratezza della catena di pensiero

LOG-009 ha esaminato PAL, che delega l'aritmetica a un interprete Python in modo che il modello non debba mai calcolare da solo. L'auto-coerenza (Self-consistency) affronta un problema ortogonale: cosa succede se il modello ragiona correttamente per la maggior parte del tempo, ma non sempre? La risposta si rivela statistica, non architetturale, e sorprendentemente efficace.

L'articolo scientifico

"Self-Consistency Improves Chain of Thought Reasoning in Language Models" di Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery e Denny Zhou (ICLR 2023, arXiv:2203.11171) introduce una strategia di decodifica che sostituisce il singolo percorso "goloso" della catena di pensiero con un voto di maggioranza su più percorsi campionati. L'intuizione è chiara: un problema di ragionamento difficile ha di solito una risposta corretta, ma molti percorsi validi per raggiungerla; una risposta errata è più probabile che venga raggiunta tramite errori specifici che non convergeranno sullo stesso errore.

Il metodo è direttamente applicabile. Prendete qualsiasi prompt per catena di pensiero (CoT) che già possedete, campionate N completamenti a temperatura non nulla, estraete la risposta finale da ciascuno e restituite la risposta che ha ottenuto più voti. Nessun addestramento aggiuntivo, nessun modello extra, nessuna etichettatura umana aggiuntiva.

Idee chiave

  • Dimensione del campione e temperatura: L'articolo utilizza 40 percorsi di ragionamento per ogni problema a temperatura 0,7. Questo non è un numero magico ottenuto tramite ottimizzazione degli iperparametri: la ricerca mostra che i benefici raggiungono un plateau approssimativamente dopo 20-30 campioni, quindi 40 è un valore conservativo.
  • Miglioramenti principali rispetto al CoT standard: GSM8K +17,9%, SVAMP +11,0%, AQuA +12,2%, StrategyQA +6,4%, ARC-challenge +3,9% — tutti miglioramenti in accuratezza assoluta ottenuti con lo stesso modello e prompt.
  • Risultati per modello su GSM8K: Con text-davinci-002 (GPT-3) l'auto-coerenza migliora l'accuratezza dal 78,7% all'86,5%. Con Codex — dal 74,5% all'82,3%. I miglioramenti sono consistenti tra diverse famiglie di modelli.
  • Nessun costo di addestramento: Tutto avviene durante l'inferenza. L'approccio funziona con qualsiasi API a "scatola nera" dove potete campionare con temperatura > 0.
  • Voto di maggioranza per risposte estraibili: La fase di aggregazione funziona pulitamente quando le risposte sono discrete (numero, scelta di lettera). Per la generazione a testo libero, l'articolo è meno specifico su come definire "più coerente" — una limitazione che gli autori riconoscono.

Cosa regge alla prova del tempo e cosa no

I benefici empirici sono reali, riprodotti molteplici volte, e il metodo è genuinamente utile. Ma alcune debolezze strutturali meritano attenzione.

Primo, il costo è lineare rispetto al numero di campioni. Campionare 40 percorsi all'inferenza costa 40 volte il budget di token di un singolo percorso. Per compiti dove la latenza e il costo API sono rilevanti — come un agente che elabora centinaia di transazioni per sessione — questo non è trascurabile. Lavori successivi (Early-Stopping Self-Consistency, ICLR 2024) affrontano questo problema: fermandosi non appena il voto raggiunge una soglia di confidenza, potete ridurre i campioni dell'80% su GSM8K senza perdita misurabile di accuratezza. L'articolo originale non discute affatto il costo, un'omissione strana.

Secondo, l'assunzione del voto di maggioranza cade quando il modello sbaglia sistematicamente. Se il modello interpreta costantemente in modo errato una specifica conversione di valuta o applica erroneamente una regola fiscale in tutti i 40 percorsi, la risposta sbagliata vincerà il voto. L'auto-coerenza amplifica l'errore più comune, non la risposta corretta. Questa è la principale lacuna epistemologica: il metodo aumenta la precisione all'interno della distribuzione delle convinzioni del modello, ma non fa nulla per la calibrazione quando quella distribuzione è centrata su una risposta errata.

Terzo, Wang & Wang (2025, arXiv:2503.16974) studiano direttamente la coerenza degli LLM in compiti finanziari e contabili in 50 esecuzioni indipendenti. Scoprono che la classificazione binaria e l'analisi del sentiment sono già quasi perfettamente riproducibili con un singolo campione, mentre i compiti complessi (previsione, generazione) mostrano una vera variabilità. La loro scoperta pratica: aggregare solo 3-5 esecuzioni migliora drammaticamente la coerenza per compiti complessi — una versione molto più economica della stessa idea di auto-coerenza.

Perché questo è importante per l'IA nella finanza

Le operazioni nel registro Beancount che coinvolgono aritmetica multi-step — calcoli fiscali, base di costo aggiustata per tassi di cambio, piani di ammortamento, riconciliazione fatture — sono esattamente il tipo di compiti dove la singola decodifica "golosa" è inaffidabile, ma la risposta corretta è unica e verificabile. L'auto-coerenza è un intervento a basso costo che dovrebbe essere standard per qualsiasi compito di agente finanziario dove l'output può essere verificato (il bilancio è ancora in pareggio?).

La conseguenza più interessante è architetturale. L'auto-coerenza trasforma l'inferenza in un ensemble tramite voto. Per la sicurezza in scrittura (write-back safety) — un agente che registra scritture contabili in un registro — vorrei imporre una condizione di maggioranza: scrivere solo se 35 percorsi su 40 concordano. Il dissenso è un segnale che l'agente deve escalare la questione a un umano, invece di effettuare la registrazione. Questo è un filtro di sicurezza concreto e applicabile che richiede un budget di inferenza, ma non complessità ingegneristica.

La modalità di fallimento dovuta a bias sistematico è di particolare importanza per le regole fiscali e normative, dove è noto che i modelli allucinano dettagli specifici della giurisdizione. In questi casi, PAL (LOG-009) è la soluzione corretta: delega completa dei calcoli. L'auto-coerenza e PAL si completano a vicenda — PAL si occupa della correttezza aritmetica, mentre l'auto-coerenza gestisce l'ambiguità e l'affidabilità del ragionamento.

Cosa leggere dopo

  • Tree of Thoughts: Deliberate Problem Solving with Large Language Models (Yao et al., 2023, arXiv:2305.10601) — estende l'auto-coerenza dal voto sui percorsi alla ricerca nei percorsi, importante quando lo spazio di ragionamento è ramificato, non parallelo.
  • Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning (Lei et al., ICLR 2024) — la soluzione al problema dei costi; riduce il campionamento di oltre l'80% per GSM8K mantenendo l'accuratezza.
  • Universal Self-Consistency for Large Language Models (Chen et al., arXiv:2311.17311) — estende il voto di maggioranza alla generazione a testo libero utilizzando un giudice LLM, affrontando la lacuna nell'aggregazione che l'articolo originale elude.

Condividi questo articolo