Към основното съдържание

Дневник на изследванията на Bean Labs

Самосъгласуваност: Извадково гласуване с мнозинство подобрява точността на веригата на мисълта

Публикувано Последно обновено 5 минути четенеMike ThriftMike Thrift
Самосъгласуваност: Извадково гласуване с мнозинство подобрява точността на веригата на мисълта

Документ: https://arxiv.org/abs/2203.11171

На тази страница

LOG-009 разгледа PAL, който прехвърля аритметиката към Python интерпретатор, така че моделът никога не трябва да смята сам. Самосъгласуваността атакува ортогонален проблем: какво става, ако моделът разсъждава правилно през повечето време, но не винаги? Отговорът се оказва статистически, а не архитектурен — и изненадващо ефективен.

Документът

„Самосъгласуваността подобрява разсъжденията по верига на мисълта в езиковите модели" от Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery и Denny Zhou (ICLR 2023, arXiv:2203.11171) въвежда стратегия за декодиране, която заменя единичен алчен път по верига на мисълта с гласуване с мнозинство по много извадкови пътища. Интуицията е кратка: трудна задача за разсъждение обикновено има един верен отговор, но много валидни маршрути до него; грешен отговор е по-вероятно да произтича от идиосинкратични грешки, които не се събират към една и съща грешка.

Методът е готов за употреба. Вземете какъвто и да е промпт за верига на мисълта (CoT), който вече имате, извадете N завършвания при ненулева температура, извлечете крайния отговор от всяко и върнете отговора с мнозинство. Без фина настройка, без допълнителни модели, без допълнителни човешки етикети.

Ключови идеи

  • Размер на извадката и температура: Документът използва 40 пътища на разсъждение за задача при температура 0.7. Това не е магическо число от търсене на хиперпараметри — аблациите показват, че ползите достигат плато около 20–30 извадки, така че 40 е консервативен избор.
  • Основни ползи спрямо стандартния CoT: GSM8K +17,9%, SVAMP +11,0%, AQuA +12,2%, StrategyQA +6,4%, ARC-challenge +3,9% — всички абсолютни подобрения на точността със същия модел и промпт.
  • Резултати по GSM8K по модели: На text-davinci-002 (GPT-3), самосъгласуваността повишава точността от 78,7% на 86,5%. На Codex, от 74,5% на 82,3%. Ползите са последователни в различни семейства модели.
  • Без разходи за обучение: Всичко се случва по време на извличане. Подходът работи с всеки API тип черна кутия, където можете да изваждате при температура > 0.
  • Гласуване с мнозинство за извличаеми отговори: Агрегацията е чиста, когато отговорите са дискретни (число, буквен избор). За генерация с отворен край документът е по-малко конкретен за дефиниране на „най-съгласуван" — ограничение, което авторите признават.

Какво издържа — и какво не

Емпиричните ползи са реални, широко възпроизведени и методът е наистина полезен. Но няколко структурни слабости заслужават внимание.

Първо, разходите нарастват линейно с броя на извадките. Изваждането на 40 пътища при извличане струва 40× токеновия бюджет на единичен път. За задачи, където латентността и цената на API имат значение — агент, обработващ стотици транзакции за една нощ — това не е безплатно. Последваща работа (Ранно спиране на самосъгласуваността, ICLR 2024) адресира това: чрез спиране, след като глас достигне праг на увереност, можете да намалите извадките с 80% по GSM8K без измерима загуба на точност. Основният документ изобщо не обсъжда разходите, което е странен пропуск.

Второ, предположението за гласуване с мнозинство се срива, когато моделът е систематично грешен. Ако моделът последователно чете погрешно валутна конверсия или прилага погрешно данъчно правило във всичките 40 пътища, грешният отговор печели гласуването. Самосъгласуваността усилва най-честата грешка, а не верния отговор. Това е централната епистемологична празнина: методът повишава точността вътре в разпределението на убежденията на модела, но не прави нищо за калибрирането, когато това разпределение е центрирано върху грешния отговор.

Трето, Wang и Wang (2025, arXiv:2503.16974) изучават LLM съгласуваността директно върху финансови и счетоводни задачи в 50 независими изпълнения. Те откриват, че бинарната класификация и анализът на настроенията вече са почти перфектно възпроизводими с единична извадка, докато сложните задачи (прогнозиране, генерация) показват реална променливост. Тяхното практическо заключение: агрегирането само на 3–5 изпълнения драматично подобрява съгласуваността при сложни задачи — много по-евтина версия на същата идея за самосъгласуваност.

Защо това има значение за AI във финансите

Операции с Beancount счетоводни книги, които включват многостъпкова аритметика — данъчни изчисления, база на разходите с FX корекция, графици за амортизация, съпоставяне на фактури — са точно задачите, където единично алчно декодиране е ненадеждно, но верният отговор е уникален и проверим. Самосъгласуваността е евтина интервенция, която трябва да бъде стандартна за всяка задача на финансов агент, където изходът може да бъде проверен (балансът все още ли е нула?).

По-интересното внушение е архитектурно. Самосъгласуваността превръща извличането в гласуващ ансамбъл. За безопасност при запис — агент, публикуващ счетоводни записи в книга — бих ограничил с мнозинствена увереност: публикувай само ако 35 от 40 пътища са съгласни. Несъгласието е сигнал, че агентът трябва да ескалира към човек вместо да записва. Това е конкретен, приложим филтър за безопасност, който струва изчислителен бюджет, а не инженерна сложност.

Режимът на систематична грешка има особено значение за данъчни и регулаторни правила, където е известно, че моделите халюцинират юрисдикционно-специфични детайли. В тези случаи PAL (LOG-009) е правилното решение: прехвърлете изцяло изчислението. Самосъгласуваността и PAL се допълват взаимно — PAL се грижи за аритметичната коректност; самосъгласуваността се грижи за двусмислието и надеждността на разсъждението.

Какво да четете по-нататък

  • Дърво на мислите: Обмислено решаване на проблеми с големи езикови модели (Yao и др., 2023, arXiv:2305.10601) — разширява самосъгласуваността от гласуване по пътища до търсене по пътища, което има значение, когато пространството на разсъждение се разклонява, вместо да върви паралелно.
  • Избягване на астрономически разходи: Ранно спиране на самосъгласуваността за многостъпково разсъждение (Lei и др., ICLR 2024) — решението на проблема с разходите; намалява изваждането с над 80% по GSM8K, запазвайки точността.
  • Универсална самосъгласуваност за големи езикови модели (Chen и др., arXiv:2311.17311) — разширява гласуването с мнозинство към генерация с отворен край чрез LLM съдия, затваряйки празнината в агрегацията, която оригиналният документ оставя отворена.

Споделете тази статия

Източник: https://beancount.io/bg/bean-labs/research-logs/2026/04/24/self-consistency-chain-of-thought

Публикувано: 24 април 2026 г.

Последно обновено: 14 септември 2026 г.