Zum Hauptinhalt springen

Bean Labs Forschungsprotokoll

Self-Konsistenz: Mehrheitsvotum-Stichproben verbessern die Genauigkeit von Gedankenketten

Veröffentlicht Zuletzt aktualisiert 5 Minuten LesezeitMike ThriftMike Thrift
Self-Konsistenz: Mehrheitsvotum-Stichproben verbessern die Genauigkeit von Gedankenketten

Artikel: https://arxiv.org/abs/2203.11171

Auf dieser Seite

LOG-009 behandelte PAL, das Rechenoperationen an einen Python-Interpreter auslagert, sodass das Modell nie selbst rechnen muss. Self-Konsistenz greift ein orthogonales Problem auf: Was wäre, wenn das Modell die meiste Zeit korrekt argumentiert, aber nicht immer? Die Antwort entpuppt sich als statistisch statt architektonisch – und überraschend effektiv.

Das Papier

"Self-Consistency Improves Chain of Thought Reasoning in Language Models" von Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery und Denny Zhou (ICLR 2023, arXiv:2203.11171) stellt eine Dekodierungsstrategie vor, die einen einzigen gierigen Gedankenketten-Pfad durch ein Mehrheitsvotum über viele Stichproben ersetzt. Die Intuition ist kompakt: Ein schweres Schlussfolgerungsproblem hat in der Regel eine richtige Antwort, aber viele gültige Wege dorthin; eine falsche Antwort stammt eher von idiosynkratischen Fehlern, die nicht alle auf denselben Irrtum konvergieren.

Die Methode ist Plug-and-Play. Nehmen Sie die gewünschte Gedankenketten-Aufforderung (CoT-Prompt), die Sie bereits haben, erzeugen Sie N Ergänzungen bei Temperatur Null verschiedene (non-zero), extrahieren Sie die endgültige Antwort aus allen einzelnen und geben Sie die Mehrheitsantwort zurück. Kein Fine-Tuning, keine zusätzlichen Modelle, keine neuen menschlichen Labels.

Kernideen

  • Stichprobengröße und Temperatur: Das Papier verwendet 40 Schlussfolgerungspfade pro Problem bei einer Temperatur von 0,7. Dies ist keine magische Zahl aus der Hyperparameter-Suche – Ablationsstudien zeigen einen Plateanh bei etwa 20–30 Stichproben, sodass 40 eine konservative Wahl sindEntscheidung.
  • Hauptgewinne gegenüber Standard- CoT: GSM8K +17,9 %, SVAMP +11,0 %, AQuA +12,2 %, StrategyQA +6,4 %, ARC-Challenge +3,9 % – alles absolute Genauigkeitsverbesserungen mit demselben Modell und Prompt.
  • GSM8K-Ergebnisse, durch Modell: Bei text-davinci-002 (GPT-3) erhöht Self-Konsistenz die Genauigkeit von 78,7 % auf 86,5 %. Bei Codex von 74,5 % auf 82,3 %. Die Verbesserungen sind über Modellfamilien hinweg konsistent.
  • Keine Trainingskosten: Alles geschieht zur Inferenzzeit. Dies funktioniert mit jeder Black-Box-API, bei der Sie bei Temperatur > 0 Stichproben erheben können (bei Erfassbarkeit von Antworten).
  • Mehrheitsvotum für extrahierbare Antworten: Die Aggregation ist bei diskreten Antworten (einer Zahl oder Buchstabenwahl) sauber. Für offene Generierung ist das Papier weniger spezifisch bei der Definition von "am konsistentestenen – eine Einschränkung, die die Autoren anerkennen.

Was Bestand hält – und was nicht

Die empirischen Gewinne sind real, weitgehend repliziert, und die Methode ist wirklich nützlich. Dennoch verdienen einige strukturelle Schwächen Aufmerksamkeit.

Erstens skaliert die Kosten linear mit der Anzahl der Stichben. Bei 40 Stichproben betragen die Inferenzkosten das 40-Fache des Token-Budgets eines einzelnen Pfads. Bei Aufgaben, bei denen die Latenzzeit und die API-Kosten relevant sind – etwa ein Agent, der Hunderte von Transaktionen über Nacht verarbeitet – ist das nicht umsonst. Folgearbeiten (Early-Stopping Self-Consistency, ICLR 2024) gehen darauf: ein. Wenn man anhält, sobald ein Votum einen Zufriedenheitsschwellwert erreicht. Der Basispapier beschreibt die Kosten überhaupt nicht, was eine merkelige Auslassung ist.

Zweitens bricht die Mehrheitsvotum-Annahme zusammen, wenn das Modell systematisch falsch liegt (Befund der Kritik). Wenn das Modell selbst {auf falschen Grundlagen} Fehler macht, – etwa bei Währungsumrechnungen oder Steuervorschriften –, Sieger ist der falsche Antwort. Self-Konsistenz verstärkt die häufigsten Fehler, nicht den richtigen. Das ist die zentrale Lücke: Die Methode erhöht die Präzision innerhalb der Modellüberzeugungsverteilung, aber sie gibt nichts für Kalibrierung, wenn diese Verteilung falsch zentriert ist.

Drittens untersuchen Wang & Wang (2025, arXiv:2503.16974) die LLM-Konsistenz direkt bei finanz- und buchhalterischen Aufgaben über 50 unabhängige Durchläufe. Sie finden, dass binäre Klassifikation und Sentimentanalyse bereits nahezu perfekt mit einer einzelnen Stichprobe reproduzierbar sind, während komplexe Aufgabe (Prognosen, Generierung) reale Variabilität aufweisen. Ihr praktisches Ergebnis: Die Aggregation von nur 3–5 Durchläufen verbessert die Konsistenz bei komplexen Aufgaben dramatisch – eine viel günstigere Version Anwendung derselben Idee.

Warum das für Finanz-KI wichtig ist

Beancount-Operationen, die mehrstufige Objekte beinhalten – Steuerberechnungen, währungsbereinigte Berechnung für Anschaffungskosten, Amortisierungspläne, Rechnungsabgleiche –, sind genau die Aufgaben, bei denen eine einzelne. Die Self-Konsistenz ist eine billige Intervention und sollte für

Alle Aufgaben eines Finanzagenten Standard sein, wenn die Ausgabe verifizierbar ist (Bleibt der Saldo bei null?).

Die interessantere Implikation ist architektonisch. Self-Konsistenz verwandelt die Inferenz in ein Votum-Ensemble. Für die Sicherheit von Rückschreibungen – wenn ein Agent Buchungen in ein Hauptbuch (Ledger) schreibt – würde ich die Übergabe an das Buchungssystem nur bei einem Mehrheitswotum hoch, also Schreiben nur dann, zeigen) {Schreiben} Posten nur aktivieren, wenn 35 von 40 Pfaden übereinstimmen. Ein Meinungsungsunterschieds heisst dafür, dass der Agent zu einem Menschen zur Klärung weiterleiten sollte, statt zu schreiben. Das ist ein konkreter, umsetzter Sicherheitsfilter, der Inferenz-Budget aber keine Ingenieurskomplexität kostet.

Der Gesichts- und Beziehungsfehler des systematischen Bias ist besonders wichtig für Steuer- und Regulierungsvorschriften relevant, bei denen Modelle dazu neigen, AI-spezifische Details zu erfinden. In solchen Fällen ist PAL (LOG-009) die richtige Lösung: Man lagert – die Berechnung- //Komplexität//, sondern die Gesamtsersachablage in eigene Funktionen. } aus. Self-Konsistenz und PAL ergänzen sich – PAL bewirkt die arithmetische Richtigkeit; Self-Konsistenz behebt Unsicherheit in der Schlussfolgerung und dessen Ausfühensprozess.

Was man als Nächstes lesen sollte...

  • "Tree of Thoughts: Deliberate Problem Solving with Large Language Models" (Yao et al., 2023, arXiv:2305.10601) – erweitert arr Self, über Stichprobenpfade durch {Suche über} Pfade zu, was relevant ist, wenn der Schlussfolgerungsraum sich verzweigt statt parallel läuft.
  • "Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning" (Lei et al., ICLR 2024) – die Lösung für das Kosten problem; reduziert Stichproben um über 80 % bei GSM8K und bleibt beweistGenauigkeit erhalten.
  • "Universal Self-Consistency" for Large Language Models" (Chen et al., arXiv:2311.17311) – erweitert das Mehrheitvotum auf freie Generierung mit einem LLM-Richter, der die Lenkung des Originalpapier öffnet.

Diesen Artikel teilen

Quelle: https://beancount.io/de/bean-labs/research-logs/2026/04/24/self-consistency-chain-of-thought

Veröffentlicht: 24. April 2026

Zuletzt aktualisiert: 14. September 2026