LOG-009 behandelde PAL, dat rekenwerk overdraagt aan een Python-interpreter zodat het model zelf nooit hoeft te rekenen. Zelfconsistentie pakt een orthogonaal probleem aan: wat als het model meestal correct redeneert, maar niet altijd? Het antwoord blijkt statistisch te zijn in plaats van architectonisch — en verrassend effectief.
Het artikel
"Self-Consistency Improves Chain of Thought Reasoning in Language Models" door Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery en Denny Zhou (ICLR 2023, arXiv:2203.11171) introduceert een decoderingstrategie die een enkel hebberig keten-van-gedachte-pad vervangt door een meerderheidsstem over veel gesamplede paden. De intuïtie is compact: een moeilijk redeneerprobleem heeft doorgaans één correct antwoord maar veel geldige routes ernaartoe; een fout antwoord komt vaker voort uit idiosyncratische fouten die niet allemaal op dezelfde vergissing uitkomen.
De methode is plug-and-play. Neem welk keten-van-gedachte (CoT)-prompt je al hebt, sample N voltooiingen bij een temperatuur boven nul, extraheer uit elk het eindantwoord en geef het meerderheidsantwoord terug. Geen fine-tuning, geen extra modellen, geen extra menselijke labels.
Kernideeën
- Samplinggrootte en temperatuur: Het artikel gebruikt 40 redeneerpaden per probleem bij temperatuur 0,7. Dit is geen magisch getal uit hyperparameteronderzoek — ablatiestudies tonen dat winsten plateauën rond 20–30 samples, dus 40 is een conservatieve keuze.
- Belangrijkste winsten ten opzichte van standaard CoT: GSM8K +17,9%, SVAMP +11,0%, AQuA +12,2%, StrategyQA +6,4%, ARC-challenge +3,9% — allemaal absolute nauwkeurigheidsverbeteringen met hetzelfde model en prompt.
- GSM8K-resultaten per model: Op text-davinci-002 (GPT-3) verhoogt zelfconsistentie de nauwkeurigheid van 78,7% naar 86,5%. Op Codex van 74,5% naar 82,3%. De winsten zijn consistent over modelfamilies heen.
- Geen trainingskosten: Alles gebeurt tijdens inferentie. De aanpak werkt met elke black-box-API waar je kunt samplen bij temperatuur > 0.
- Meerderheidsstem voor extraheerbare antwoorden: Aggregatie is eenvoudig wanneer antwoorden discreet zijn (een getal, een letterkeuze). Voor open-einde-generatie is het artikel minder specifiek over het definiëren van "meest consistent" — een beperking die de auteurs erkennen.
Wat standhoudt — en wat niet
De empirische winsten zijn echt, breed gerepliceerd, en de methode is werkelijk nuttig. Maar verschillende structurele zwaktes verdienen aandacht.
Ten eerste, kosten schalen lineair met het aantal samples. Het samplen van 40 paden tijdens inferentie kost 40× het tokenbudget van een enkel pad. Voor taken waar latentie en API-kosten ertoe doen — een agent die honderden transacties per nacht verwerkt — is dat niet gratis. Vervolgwerk (Early-Stopping Self-Consistency, ICLR 2024) pakt dit aan: door te stoppen zodra een stem een vertrouwensdrempel bereikt, kun je samples met 80% verminderen op GSM8K zonder meetbaar nauwkeurigheidsverlies. Het basisartikel bespreekt kosten helemaal niet, wat een vreemde omissie is.
Ten tweede, de meerderheidsstem-aanname stort in wanneer het model systematisch fout is. Als het model consequent een valutaconversie verkeerd leest of een belastingregel verkeerd toepast over alle 40 paden, wint het foute antwoord de stem. Zelfconsistentie versterkt de meest voorkomende fout, niet de correcte. Dat is de centrale epistemologische leemte: de methode verhoogt precisie binnen de overtuigingsdistributie van het model, maar doet niets voor kalibratie wanneer die distributie gecentreerd is op het foute antwoord.
Ten derde bestuderen Wang & Wang (2025, arXiv:2503.16974) LLM-consistentie direct op financiële en boekhoudkundige taken over 50 onafhankelijke runs. Ze vinden dat binaire classificatie en sentimentanalyse al bijna perfect reproduceerbaar zijn met een enkel sample, terwijl complexe taken (prognoses, generatie) echte variabiliteit tonen. Hun praktische bevinding: het aggregeren van slechts 3–5 runs verbetert de consistentie op complexe taken dramatisch — een veel goedkopere versie van hetzelfde zelfconsistentie-idee.
Waarom dit ertoe doet voor financiële AI
Beancount-grootboekbewerkingen die meerstaps rekenkunde omvatten — belastingberekeningen, FX-gecorrigeerde kostprijs, afschrijvingsschema's, factuurmatchen — zijn precies de taken waar een enkele hebberige decode onbetrouwbaar is, terwijl het correcte antwoord uniek en verifieerbaar is. Zelfconsistentie is een goedkope interventie die standaard zou moeten zijn voor elke financiële-agenttaak waar de output gecontroleerd kan worden (klopt de balans nog nul?).
De interessantere implicatie is architectonisch. Zelfconsistentie verandert inferentie in een stemmend ensemble. Voor write-back-veiligheid — een agent die journaalposten in een grootboek plaatst — zou ik afstemmen op meerderheidsvertrouwen: post alleen als 35 van de 40 paden het eens zijn. Onenigheid is een signaal dat de agent moet escaleren naar een mens in plaats van te schrijven. Dat is een concreet, implementeerbaar veiligheidsfilter dat inferentiebudget kost, geen technische complexiteit.
De systematische-bias-foutmodus is vooral belangrijk voor belasting- en regelgevingsregels, waarvan bekend is dat modellen hallucineren over jurisdictiespecifieke details. In die gevallen is PAL (LOG-009) de juiste oplossing: draag de berekening volledig over. Zelfconsistentie en PAL vullen elkaar aan — PAL regelt rekenkundige correctheid; zelfconsistentie regelt ambiguïtiteit en redeneerbetrouwbaarheid.
Wat nu te lezen
- Tree of Thoughts: Deliberate Problem Solving with Large Language Models (Yao et al., 2023, arXiv:2305.10601) — breidt zelfconsistentie uit van stemmen over paden naar zoeken over paden, wat ertoe doet wanneer de redeneerruimte vertakt in plaats van parallel loopt.
- Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning (Lei et al., ICLR 2024) — de oplossing voor het kostenprobleem; vermindert sampling met meer dan 80% op GSM8K terwijl de nauwkeurigheid behouden blijft.
- Universal Self-Consistency for Large Language Models (Chen et al., arXiv:2311.17311) — breidt meerderheidsstem uit naar open-einde-generatie met een LLM-rechter, waarmee de aggregatiekloof die het originele artikel openlaat wordt gedicht.





