Salta al contingut principal

Registre de recerca de Bean Labs

Auto-consistència: el mostreig per vot majoritari millora la precisió de la cadena de pensament

Publicat Última actualització 5 minuts de lecturaMike ThriftMike Thrift
Auto-consistència: el mostreig per vot majoritari millora la precisió de la cadena de pensament

Article: https://arxiv.org/abs/2203.11171

En aquesta pàgina

El LOG-009 va tractar PAL, que delega l'aritmètica en un intèrpret de Python perquè el model no hagi de calcular mai. L'auto-consistència (self-consistency) aborda un problema ortogonal: què passa si el model raona correctament la majoria de les vegades, però no sempre? La resposta resulta ser estadística més que arquitectònica — i sorprenentment efectiva.

L'article

"Self-Consistency Improves Chain of Thought Reasoning in Language Models", de Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery i Denny Zhou (ICLR 2023, arXiv:2203.11171), introdueix una estratègia de decodificació que substitueix un únic camí greedy de cadena de pensament per un vot majoritari sobre molts camins mostrejats. La intuïció és compacta: un problema de raonament difícil normalment té una resposta correcta, però moltes rutes vàlides per arribar-hi; una resposta incorrecta prové més probablement d'errors idiosincràtics que no convergeixen tots en el mateix error.

El mètode és endollar i utilitzar (plug-and-play). Agafeu el prompt de cadena de pensament (CoT) que ja tingueu, mostregeu N complecions a temperatura diferent de zero, extraieu la resposta final de cadascuna i retorneu la resposta majoritària. Sense fine-tuning, sense models addicionals, sense etiquetes humanes addicionals.

Idees clau

  • Mida de la mostra i temperatura: l'article utilitza 40 camins de raonament per problema a temperatura 0,7. No és un número màgic provinent de la cerca d'hiperparàmetres — les ablacions mostren que els guanys s'estabilitzen al voltant de 20–30 mostres, així que 40 és una elecció conservadora.
  • Principals guanys sobre la CoT estàndard: GSM8K +17,9%, SVAMP +11,0%, AQuA +12,2%, StrategyQA +6,4%, ARC-challenge +3,9% — totes millores absolutes de precisió amb el mateix model i el mateix prompt.
  • Resultats de GSM8K per model: amb text-davinci-002 (GPT-3), l'auto-consistència eleva la precisió del 78,7% al 86,5%. Amb Codex, del 74,5% al 82,3%. Els guanys són consistents entre famílies de models.
  • Sense cost d'entrenament: tot passa en temps d'inferència. L'enfocament funciona amb qualsevol API de caixa negra on es pugui mostrejar a temperatura > 0.
  • Vot majoritari per a respostes extraïbles: l'agregació és neta quan les respostes són discretes (un número, una opció de lletra). Per a la generació oberta, l'article és menys específic sobre com definir "la més consistent" — una limitació que els autors reconeixen.

Què se sosté — i què no

Els guanys empírics són reals, àmpliament replicats, i el mètode és genuïnament útil. Però diverses debilitats estructurals mereixen atenció.

Primer, el cost escala linealment amb el nombre de mostres. Mostrejar 40 camins en inferència costa 40× el pressupost de tokens d'un sol camí. Per a tasques on la latència i el cost d'API importen — un agent que processa centenars de transaccions cada nit — això no és gratuït. Treballs posteriors (Early-Stopping Self-Consistency, ICLR 2024) ho aborden: aturant-se quan un vot arriba a un llindar de confiança, es poden reduir les mostres un 80% a GSM8K sense pèrdua mesurable de precisió. L'article base no discuteix el cost en absolut, cosa que és una omissió estranya.

Segon, la suposició del vot majoritari s'esfondra quan el model està sistemàticament equivocat. Si el model llegeix malament una conversió de divisa o aplica malament una regla fiscal en tots els 40 camins, la resposta incorrecta guanya el vot. L'auto-consistència amplifica l'error més comú, no el correcte. Aquest és el buit epistemològic central: el mètode augmenta la precisió dins la distribució de creences del model, però no fa res per a la calibració quan aquesta distribució està centrada en la resposta incorrecta.

Tercer, Wang i Wang (2025, arXiv:2503.16974) estudien la consistència dels LLM directament en tasques financeres i comptables en 50 execucions independents. Troben que la classificació binària i l'anàlisi de sentiments ja són gairebé perfectament reproduïbles amb una sola mostra, mentre que les tasques complexes (predicció, generació) mostren una variabilitat real. La seva troballa pràctica: agregar només 3–5 execucions millora dramàticament la consistència en tasques complexes — una versió molt més barata de la mateixa idea d'auto-consistència.

Per què això importa per a la IA financera

Les operacions de llibre major de Beancount que impliquen aritmètica de diversos passos — càlculs fiscals, base de cost ajustada per tipus de canvi (FX), calendaris d'amortització, conciliació de factures — són exactament les tasques on una única decodificació greedy no és fiable, però la resposta correcta és única i verificable. L'auto-consistència és una intervenció barata que hauria de ser estàndard per a qualsevol tasca d'agent financer on la sortida es pugui comprovar (el saldo continua sent zero?).

La implicació més interessant és arquitectònica. L'auto-consistència converteix la inferència en un ensemble de votació. Per a la seguretat en l'escriptura (write-back) — un agent que enregistra assentaments en un llibre major — condicionaria l'escriptura a la confiança majoritària: enregistrar només si 35 de 40 camins coincideixen. El desacord és un senyal que l'agent hauria d'escalar el cas a un humà en lloc d'escriure. Aquest és un filtre de seguretat concret i implementable que costa pressupost d'inferència, no complexitat d'enginyeria.

El mode de fallada de biaix sistemàtic importa especialment per a les regles fiscals i regulatòries, on se sap que els models al·lucinen detalls específics de la jurisdicció. En aquests casos, PAL (LOG-009) és la solució correcta: traslladar el càlcul completament. L'auto-consistència i PAL es complementen — PAL gestiona la correcció aritmètica; l'auto-consistència gestiona l'ambigüitat i la fiabilitat del raonament.

Què llegir a continuació

  • Tree of Thoughts: Deliberate Problem Solving with Large Language Models (Yao et al., 2023, arXiv:2305.10601) — estén l'auto-consistència de votar sobre camins a cercar sobre camins, cosa que importa quan l'espai de raonament es ramifica en lloc de funcionar en paral·lel.
  • Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning (Lei et al., ICLR 2024) — la solució al problema del cost; redueix el mostreig en més d'un 80% a GSM8K tot preservant la precisió.
  • Universal Self-Consistency for Large Language Models (Chen et al., arXiv:2311.17311) — estén el vot majoritari a la generació oberta amb un jutge LLM, tancant el buit d'agregació que l'article original deixa obert.

Comparteix aquest article

Font: https://beancount.io/ca/bean-labs/research-logs/2026/04/24/self-consistency-chain-of-thought

Publicat: 24 d’abril del 2026

Última actualització: 14 de setembre del 2026