Перейти к основному содержимому

Журнал исследований Bean Labs

Самосогласованность: голосование большинством при сэмплировании повышает точность цепочки рассуждений

Опубликовано Обновлено 5 мин чтенияMike ThriftMike Thrift
Самосогласованность: голосование большинством при сэмплировании повышает точность цепочки рассуждений

Статья: https://arxiv.org/abs/2203.11171

Содержание страницы

LOG-009 рассматривал PAL, который переносит арифметику на интерпретатор Python, чтобы модели не приходилось вычислять самостоятельно. Самосогласованность решает ортогональную проблему: что, если модель рассуждает правильно большую часть времени, но не всегда? Ответ оказывается статистическим, а не архитектурным — и на удивление эффективным.

Статья

«Самосогласованность улучшает рассуждения по цепочке мыслей в языковых моделях» Сюэчжи Вана, Джейсона Вэя, Дейла Шуурманса, Квока Ле, Эда Чи, Шарана Наранга, Аканкши Чаудхери и Денни Чжоу (ICLR 2023, arXiv:2203.11171) представляет стратегию декодирования, которая заменяет один жадный путь цепочки рассуждений голосованием большинством по множеству сэмплированных путей. Интуиция проста: сложная задача рассуждения обычно имеет один правильный ответ, но множество допустимых путей к нему; неправильный ответ с большей вероятностью возникает из-за идиосинкразических ошибок, которые не сходятся к одной и той же ошибке.

Метод работает по принципу «подключи и работай». Возьмите любой существующий промпт для цепочки рассуждений (CoT), сэмплируйте N завершений при ненулевой температуре, извлеките окончательный ответ из каждого и верните ответ большинства. Никакого дообучения, дополнительных моделей или дополнительных человеческих меток.

Ключевые идеи

  • Размер выборки и температура: В статье используется 40 путей рассуждений на задачу при температуре 0,7. Это не магическое число из поиска гиперпараметров — абляции показывают, что прирост достигает плато примерно на 20–30 сэмплах, поэтому 40 — консервативный выбор.
  • Основные улучшения по сравнению со стандартной CoT: GSM8K +17,9%, SVAMP +11,0%, AQuA +12,2%, StrategyQA +6,4%, ARC-challenge +3,9% — всё это абсолютные улучшения точности при той же модели и промпте.
  • Результаты GSM8K по моделям: На text-davinci-002 (GPT-3) самосогласованность повышает точность с 78,7% до 86,5%. На Codex — с 74,5% до 82,3%. Улучшения стабильны для разных семейств моделей.
  • Нулевая стоимость обучения: Всё происходит на этапе инференса. Метод работает с любым черным ящиком API, где можно сэмплировать при температуре > 0.
  • Голосование большинством для извлекаемых ответов: Агрегация проста, когда ответы дискретны (число, выбор буквы). Для генерации с открытым концом статья менее конкретна в определении «наиболее согласованного» — ограничение, которое авторы признают.

Что подтверждается — а что нет

Эмпирические улучшения реальны, широко воспроизведены, и метод действительно полезен. Но несколько структурных слабостей заслуживают внимания.

Во-первых, стоимость растет линейно с числом сэмплов. Сэмплирование 40 путей на инференсе стоит 40× токен-бюджета одного пути. Для задач, где важны задержка и стоимость API — агент, обрабатывающий сотни транзакций за ночь, — это не бесплатно. Последующая работа (Early-Stopping Self-Consistency, ICLR 2024) решает эту проблему: останавливаясь, как только голосование достигает порога уверенности, можно сократить сэмплы на 80% на GSM8K без измеримой потери точности. Базовая статья вообще не обсуждает стоимость — странное упущение.

Во-вторых, допущение голосования большинством рушится, когда модель систематически ошибается. Если модель последовательно неверно читает конвертацию валют или неправильно применяет налоговое правило во всех 40 путях, неправильный ответ выигрывает голосование. Самосогласованность усиливает наиболее распространенную ошибку, а не правильный ответ. Это центральный эпистемологический пробел: метод повышает точность внутри распределения убеждений модели, но ничего не делает для калибровки, когда это распределение сосредоточено на неправильном ответе.

В-третьих, Ван и Ван (2025, arXiv:2503.16974) изучают согласованность LLM напрямую на финансовых и бухгалтерских задачах в 50 независимых прогонах. Они обнаруживают, что бинарная классификация и анализ тональности уже почти идеально воспроизводимы с одним сэмплом, тогда как сложные задачи (прогнозирование, генерация) показывают реальную вариативность. Их практический вывод: агрегация всего 3–5 прогонов резко улучшает согласованность на сложных задачах — гораздо более дешевая версия той же идеи самосогласованности.

Почему это важно для ИИ в финансах

Операции в бухгалтерских книгах Beancount, включающие многошаговую арифметику — налоговые расчеты, скорректированная на валютный курс себестоимость, графики амортизации, сверка счетов, — это именно те задачи, где одиночное жадное декодирование ненадежно, но правильный ответ уникален и проверяем. Самосогласованность — дешевое вмешательство, которое должно быть стандартом для любой задачи финансового агента, где выход можно проверить (баланс всё еще равен нулю?).

Более интересное следствие — архитектурное. Самосогласованность превращает инференс в голосующий ансамбль. Для безопасности записи — агент, публикующий записи журнала в бухгалтерскую книгу, — я бы ограничивал по уверенности большинства: публиковать только если 35 из 40 путей согласны. Разногласие — сигнал, что агент должен эскалировать человеку вместо записи. Это конкретный, реализуемый фильтр безопасности, который стоит бюджета инференса, а не инженерной сложности.

Режим отказа систематического смещения особенно важен для налоговых и регуляторных правил, где известно, что модели галлюцинируют детали, специфичные для юрисдикции. В таких случаях PAL (LOG-009) — правильное решение: полностью перенести вычисления. Самосогласованность и PAL дополняют друг друга — PAL обеспечивает арифметическую правильность; самосогласованность — неоднозначность и надежность рассуждений.

Что читать дальше

  • Tree of Thoughts: Deliberate Problem Solving with Large Language Models (Яо и др., 2023, arXiv:2305.10601) — расширяет самосогласованность от голосования по путям до поиска по путям, что важно, когда пространство рассуждений ветвится, а не работает параллельно.
  • Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning (Лэй и др., ICLR 2024) — решение проблемы стоимости; сокращает сэмплирование более чем на 80% на GSM8K, сохраняя точность.
  • Universal Self-Consistency for Large Language Models (Чэнь и др., arXiv:2311.17311) — расширяет голосование большинством до генерации с открытым концом с помощью LLM-судьи, закрывая пробел агрегации, оставленный оригинальной статьей.

Поделиться этой статьёй

Источник: https://beancount.io/ru/bean-labs/research-logs/2026/04/24/self-consistency-chain-of-thought

Опубликовано: 24 апреля 2026 г.

Обновлено: 14 сентября 2026 г.

5 мин чтения

Цепочка рассуждений (Chain-of-Thought): компромисс между точностью и полнотой для ИИ в финансах

Подробный разбор статьи Вея и др. (2022) о цепочке рассуждений…

ai
llm
5 мин чтения

OmniEval: Всенаправленный бенчмарк для оценки RAG в финансовой сфере

OmniEval (EMNLP 2025) оценивает системы RAG по 5 типам задач и 16 финансовым…

ai
machine-learning
6 мин чтения

Затерянные посередине: позиционное смещение в LLM и его влияние на финансовый ИИ

В статье TACL 2024 года Лю и др. показывают, что LLM работают на 20 пунктов…

llm
ai
5 мин чтения

M3MAD-Bench: Действительно ли многоагентные дебаты эффективны в различных областях и модальностях?

M3MAD-Bench проводит стресс-тестирование многоагентных дебатов на 9 моделях в 5…

ai
llm
5 мин чтения

Atlas: совместное преобучение ретривера и ридера превосходит LLM с 540 млрд параметров, используя лишь 11 млрд

Atlas (JMLR 2023) достигает точности 42,4% на Natural Questions всего с 64…

ai
machine-learning