LOG-009 охватил PAL, который перекладывает арифметику на интерпретатор Python, чтобы модель никогда не вычисляла сама. Самоузгодженість атакует ортогогожную проблему: а что если модель міркує правильно в більшості выпадков, но не всегда? Ответ виявляється статистическим, а не архитектурным – и удивительно эффективным.
Документ
"Self-Consistency Improves Chain of Thought Reasoning in Language Models" by Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou (ICLR 2023, arXiv:2203.11171) вводит стратегию декодування, которая заменяет один жадный ланцет продумок голосованием більшості за многие семплованные шляхи. Интуиция компактна: трудная задача міркування обычно имеет один правильный ответ, но много валидных шляхів к нему; неправильный ответ чаще возникает из-за индивидуальных ошибок, которые не сходятся на одной и той же помилці.
Метод – plug-and-play. Взять любой ланцет продумок (CoT) промпт, который уже есть, семплювати N завершений при ненулевой температурі, извлечь финальный ответ из каждого и вернуть ответ большинства. Без донастройки, без дополнительных моделей, без дополнительных человеческих меток.
Ключевые идеи
- Размер выборки и температура: В документе используется 40 шляхів міркування на задачу при температурі 0.7. Это не магическое число из поиска гиперпараметров – абляции показывают, что улучшения плато вокруг 20–30 семплов, так что 40 – консервативный выбор.
- Основные улучшения относительно стандартного CoT: GSM8K +17.9%, SVAMP +11.0%, AQuA +12.2%, StrategyQA +6.4%, ARC-challenge +3.9% – все абсолютные улучшения точности с той же моделью и промптом.
- Результаты GSM8K по моделям: На text-davinci-002 (GPT-3), самоузгодженість підвішує точність з 78.7% до 86.5%. На Codex – з 74.5% до 82.3%. Улучшения стабильны в рамках семейств моделей.
- Отсутствие затрат на обучение: Всё происходит на этапе инференции. Метод работает с любым black-box API, где можно семплювати при температурі > 0.
- Голосування більшості для извлекаемых ответов: Агрегирование чистое, когда ответы дискретные (число, буквенный выбор). Для открытой генерации документ менее конкретен по определению "найбільш узгодженого" – ограничение, которое авторы признают.
Что устояло – а что нет
Эмпирические улучшения реальные, широко воспроизведены, и метод действительно полезен. Но несколько структурных слабостей заслуживают внимания.
Во-первых, стоимость масштабируется линейно с числом семплов. Семплювання 40 шляхів при інференції стоит в 40 раз більше токенового бюджету одного шляху. Для задач, где латентность и стоимость API важны – агент, обрабатывающий сотни транзакций за ночь – это не бесплатно. Последующая работа (Early-Stopping Self-Consistency, ICLR 2024) решает это: останавливаясь, когда голос достигает порога доверия, можно сократить семплы на 80% на GSM8K без измеримой потери точности. Базовый документ вообще не обсуждает стоимость – что странное упущение.
Во-вторых, предположение о голосуванні більшості разрушается, когда модель систематически неправа. Если модель стабильно неверно читает конверсию валют или неправильно применяет налоговое правило во всех 40 шляхах, неправильный ответ выигрывает голосование. Самоузгодженість усиливает наиболее распространённую ошибку, а не правильную. Это центральный эпистемологический пробел: метод повышает точность внутри распределения убеждений модели, но ничего не делает для калибровки, когда это распределение центрировано на неправильном ответе.
Третье, Wang & Wang (2025, arXiv:2503.16974) изучают узгодженість LLM непосредственно на финансовых и бухгалтерских задачах через 50 независимых запусков. Они находят, что бинарная классификация и анализ настроений уже почти идеально воспроизводимы с одним семплом, тогда как сложные задачи (прогнозирование, генерация) показывают реальную вариативность. Их практический вывод: агрегирование всего 3–5 запусков резко улучшает узгодженість на сложных задачах – гораздо более дешёвая версия той же идеи самоузгодженності.
Почему это важно для фінансового ШІ
Операции в бухгалтерской книге Beancount, которые включают многошаговую арифметику – налоговые расчёты, скорректированная по курсу валют цена, графики амортизации, сопоставление счетов – это именно те задачи, где один жадный декод ненадёжен, но правильный ответ уникален и проверяем. Самоузгодженість – дешёвое вмешательство, которое должно быть стандартом для любой задачи фінансового агента, где результат можно проверить (баланс все ещё ноль?).
Более интересное следствие – архитектурное. Самоузгодженість превращает инференцию в голосующий ансамбль. Для безопасности записи обратно – агент, размещающий записи журнала в бухгалтерскую книгу – я бы затворил на доверии большинства: размещать только если 35 из 40 шляхів согласны. Несогласие – сигнал, что агент должен эскалировать до человека вместо записи. Это конкретный, реализуемый фильтр безопасности, который стоит бюджет инференции, а не инженерную сложность.
Режим отказа систематического смещения особенно важен для налоговых и регуляторных правил, где известно, что модели галлюцинируют детали, специфичные для юрисдикции. В этих случаях PAL (LOG-009) – правильное исправление: переложить вычисления полностью. Самоузгодженість и PAL дополняют друг друга – PAL обеспечивает арифметическую правильность; самоузгодженість – неоднозначность и надёжность міркування.
Что читать дальше
- Tree of Thoughts: Deliberate Problem Solving with Large Language Models (Yao et al., 2023, arXiv:2305.10601) – расширяет самоузгодженість от голосования по шляхам к поиску по шляхам, что важно, когда пространство міркування ветвится, а не работает параллельно.
- Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning (Lei et al., ICLR 2024) – решение проблемы стоимости; сокращает семплювання более чем на 80% на GSM8K, сохраняя точность.
- Universal Self-Consistency for Large Language Models (Chen et al., arXiv:2311.17311) – расширяет голосування більшості на открытую генерацию с LLM-судьёй, закрывая пробел агрегирования, который оставляет открытым оригинальный документ.





