LOG-009 pokryl PAL, ktorý presúva aritmetiku na Python interpreter, takže model nemusí počítať sám. Sekvenčná konzistentnosť útočí na ortogonálny problém: čo ak model uvažuje správne väčšinu času, ale nie vždy? Odpoveď sa ukazuje byť skôr štatistická než architektonická — a prekvapivo účinná.
Práca
„Self-Consistency Improves Chain of Thought Reasoning in Language Models" od Xuezhiho Wanga, Jasona Weiho, Dalea Schuurmansa, Quoca Lea, Eda Chiho, Sharana Naranga, Aakankshy Chowdhery a Dennyho Zhoua (ICLR 2023, arXiv:2203.11171) predstavuje dekódovaciu stratégiu, ktorá nahrádza jednu greedy cestu reťazca myšlienok väčšinovým hlasovaním cez mnoho vzorkovaných ciest. Intuícia je kompaktná: náročný problém uvažovania má zvyčajne jednu správnu odpoveď, ale mnoho platných ciest k nej; nesprávna odpoveď je skôr výsledkom idiosynkratických chýb, ktoré sa nezhodnú na rovnakom omyle.
Metóda je plug-and-play. Vezmite akýkoľvek prompt reťazca myšlienok (CoT), ktorý už máte, vzorkujte N dokončení pri nenulovej teplote, extrahujte konečnú odpoveď z každého a vráťte väčšinovú odpoveď. Žiadne doladenie, žiadne ďalšie modely, žiadne ďalšie ľudské označenia.
Kľúčové myšlienky
- Veľkosť vzorky a teplota: Práca používa 40 ciest uvažovania na problém pri teplote 0,7. Toto nie je magické číslo z hyperparameter vyhľadávania — ablácie ukazujú, že zisky sa ustália okolo 20–30 vzoriek, takže 40 je konzervatívna voľba.
- Hlavné zisky oproti štandardnému CoT: GSM8K +17,9 %, SVAMP +11,0 %, AQuA +12,2 %, StrategyQA +6,4 %, ARC-challenge +3,9 % — všetko absolútne zlepšenia presnosti s rovnakým modelom a promptom.
- GSM8K výsledky podľa modelu: Na text-davinci-002 (GPT-3) sekvenčná konzistentnosť zdvíha presnosť zo 78,7 % na 86,5 %. Na Codex zo 74,5 % na 82,3 %. Zisky sú konzistentné naprieč rodinami modelov.
- Žiadne náklady na trénovanie: Všetko sa deje v čase inferencie. Prístup funguje s akýmkoľvek black-box API, kde môžete vzorkovať pri teplote > 0.
- Väčšinové hlasovanie pre extrahovateľné odpovede: Agregácia je čistá, keď sú odpovede diskrétne (číslo, výber písmena). Pre otvorenú generáciu je práca menej konkrétna pri definovaní „najkonzistentnejšieho" — obmedzenie, ktoré autori uznávajú.
Čo sa drží — a čo nie
Empirické zisky sú reálne, široko replikované a metóda je skutočne užitočná. Niekoľko štrukturálnych slabín si však zaslúži pozornosť.
Po prvé, náklady rastú lineárne s počtom vzoriek. Vzorkovanie 40 ciest pri inferencii stojí 40× tokenový rozpočet jednej cesty. Pre úlohy, kde záleží na latencii a nákladoch API — agent spracúvajúci stovky transakcií za noc — to nie je zadarmo. Nadväzujúca práca (Early-Stopping Self-Consistency, ICLR 2024) to rieši: zastavením, keď hlasovanie dosiahne prah spoľahlivosti, môžete znížiť vzorky o 80 % na GSM8K bez merateľnej straty presnosti. Základná práca o nákladoch vôbec nehovorí, čo je zvláštne opomenutie.
Po druhé, predpoklad väčšinového hlasovania zlyháva, keď je model systematicky nesprávny. Ak model konzistentne nesprávne číta menovú konverziu alebo nesprávne aplikuje daňové pravidlo vo všetkých 40 cestách, nesprávna odpoveď vyhrá hlasovanie. Sekvenčná konzistentnosť zosilňuje najčastejšiu chybu, nie správnu odpoveď. To je ústredná epistemologická medzera: metóda zvyšuje presnosť v rámci distribučného presvedčenia modelu, ale nič nerobí pre kalibráciu, keď je táto distribúcia centrovaná na nesprávnu odpoveď.
Po tretie, Wang & Wang (2025, arXiv:2503.16974) študujú konzistentnosť LLM priamo na finančných a účtovných úlohách cez 50 nezávislých behov. Zisťujú, že binárna klasifikácia a analýza sentimentu sú už takmer dokonale reprodukovateľné s jednou vzorkou, zatiaľ čo komplexné úlohy (prognózovanie, generácia) vykazujú skutočnú variabilitu. Ich praktické zistenie: agregácia len 3–5 behov dramaticky zlepšuje konzistentnosť pri komplexných úlohách — oveľa lacnejšia verzia tej istej myšlienky sekvenčnej konzistentnosti.
Prečo to záleží pre finančnú AI
Operácie v účtovnej knihe Beancount, ktoré zahŕňajú viackrokovú aritmetiku — daňové výpočty, nákladová základňa upravená o FX, amortizačné plány, párovanie faktúr — sú presne tie úlohy, kde je jediné greedy dekódovanie nespoľahlivé, ale správna odpoveď je jedinečná a overiteľná. Sekvenčná konzistentnosť je lacný zásah, ktorý by mal byť štandardom pre akúkoľvek úlohu finančného agenta, kde sa dá výstup skontrolovať (je zostatok stále nula?).
Zaujímavejšia implikácia je architektonická. Sekvenčná konzistentnosť mení inferenciu na hlasovací ensemble. Pre bezpečnosť zápisu — agent účtujúci zápisy do knihy — by som bránil podľa väčšinovej spoľahlivosti: účtovať len ak 35 zo 40 ciest súhlasí. Nesúhlas je signál, že agent by mal eskalovať na človeka namiesto zápisu. To je konkrétny, implementovateľný bezpečnostný filter, ktorý stojí inferenčný rozpočet, nie inžiniersku zložitosť.
Režim zlyhania systematického skreslenia záleží najmä pri daňových a regulačných pravidlách, kde je známe, že modely halucinujú jurisdikčne špecifické detaily. V týchto prípadoch je PAL (LOG-009) správna oprava: preneste výpočet úplne. Sekvenčná konzistentnosť a PAL sa dopĺňajú — PAL sa stará o aritmetickú správnosť; sekvenčná konzistentnosť o nejednoznačnosť a spoľahlivosť uvažovania.
Čo čítať ďalej
- Strom myšlienok: Zámerné riešenie problémov s veľkými jazykovými modelmi (Yao et al., 2023, arXiv:2305.10601) — rozširuje sekvenčnú konzistentnosť z hlasovania cez cesty na vyhľadávanie cez cesty, čo záleží, keď sa priestor uvažovania vetví namiesto paralelného behu.
- Únik pred nebeskými nákladmi: Early-stopping Self-Consistency pre viackrokové uvažovanie (Lei et al., ICLR 2024) — oprava problému nákladov; znižuje vzorkovanie o viac ako 80 % na GSM8K pri zachovaní presnosti.
- Univerzálna sekvenčná konzistentnosť pre veľké jazykové modely (Chen et al., arXiv:2311.17311) — rozširuje väčšinové hlasovanie na otvorenú generáciu s LLM sudcom, čím uzatvára agregačnú medzeru, ktorú pôvodná práca necháva otvorenú.





