Към основното съдържание

Дневник на изследванията на Bean Labs

Конституционен ИИ за счетоводни агенти: RLAIF, правила за политиките и рискове от Гудхартинг

Публикувано Последно обновено 6 минути четенеMike ThriftMike Thrift
Конституционен ИИ за счетоводни агенти: RLAIF, правила за политиките и рискове от Гудхартинг

Документ: https://arxiv.org/abs/2212.08073

На тази страница

Документът на Anthropic за конституционен ИИ (Bai et al., 2022, arXiv:2212.08073) продължава да изплува, когато мисля за безопасността при запис за автономни счетоводни агенти. Основният въпрос, който той разглежда — може ли ИИ да бъде накаран да следва последователно набор от правила, без да се етикира всяко нарушение ръчно? — се пренася почти точно върху въпроса, който продължавам да си задавам относно Beancount ledger агентите: как да спреш агента да публикува малформирани или нарушаващи политиката записи, без да наемаш проверяващ по съответствие, който да проверява всяка транзакция?

Документът

Bai et al. представят Конституционен ИИ (CAI), тръбопровод за обучение, целящ да направи LLM безвредни, без да събира човешки етикети за вредни изходи. Единственият човешки вход е кратък списък от принципи на естествен език — „конституцията“ — който управлява какво моделът трябва и не трябва да прави. Всичко останало е автоматизирано: моделът критикува собствените си отговори спрямо тези принципи, преразглежда ги, а след това отделен ИИ оценител избира по-добрия отговор от двойки, генерирайки данни за предпочитания за RL обучение. Техниката се нарича RLAIF (Учене с подсилване от ИИ обратна връзка), за разлика от стандартното RLHF.

Тръбопроводът има две фази. Във фазата на контролирано обучение (SL-CAI) моделът чете вредна подкана, генерира отговор, критикува този отговор, като избира от шестнадесет конституционни принципа, след което пренаписва отговора, за да адресира критиката. Този цикъл критика-преразглеждане се повтаря до четири пъти на пример. Получените преразгледани отговори, плюс стандартни примери за полезност, се използват за фина настройка на базовия модел. Във фазата на учене с подсилване (RL-CAI) SL-CAI моделът генерира двойки отговори на вредни подкани, а модел за обратна връзка — също обусловен от конституцията — избира кой от двата е по-добър. Тези ИИ-генерирани етикети за предпочитания обучават модел за награди, който след това води RL фината настройка на политиката. Подсказване за верига на мисълта се добавя на RL етапа, за да се подобри качеството на разсъжденията преди окончателното двоично решение за предпочитание.

Ключови идеи

  • Шестнадесетте конституционни принципа се избират на случаен принцип при всяка стъпка на критика, така че нито един принцип не доминира и моделът се насочва към разнообразно покритие на потенциални вреди.
  • Сравненията от тълпата (чрез Surge AI) оценяват безвредност и полезност в 10 274 сравнения за полезност и 8 135 сравнения за безвредност в 24 обучителни снапшота. RL-CAI подобрява Elo за безвредност спрямо базовата линия SL-CAI, без пропорционално да жертва Elo за полезност — основното емпирично твърдение на документа.
  • Моделът за ИИ обратна връзка постига „добре над 90% двоична точност“ при предсказване кой от двата отговора е по-добър, приближавайки човешкото представяне в същата задача за сравнение.
  • Меките етикети за предпочитания (нормализирани логаритмични вероятности) значително превъзхождат твърдите 0/1 етикети по време на обучението на модела за награди. Затягането на вероятностите за верига на мисълта в диапазон 40–60% значително подобрява стабилността на RL в сравнение с неограничените confidence скорове.
  • Броят на конституционните принципи в набора не влияе значително на общите резултати за безвредност — важното е да има някои принципи, а не да се оптимизира броят.
  • Аблациите показват, че критикуваните преразглеждания превъзхождат директните преразглеждания за по-малки модели; при 52B параметри разликата се стеснява, но критиките все пак помагат в маргинални случаи.

Какво издържа — и какво не

Централното твърдение — че ИИ обратната връзка може да замести човешките етикети за вреда, като същевременно запазва полезността — е подкрепено от реални сравнения от тълпата, и механиката на RLAIF е достатъчно здрава, че оттогава се е превърнала в стандартна практика. Тази част издържа.

Ограниченията, които авторите признават, заслужават внимание. Първо, Гудхартинг: RL-CAI моделите „могат да станат преобучени“, произвеждайки банални изрази като „ти си валиден, ценен и обгрижван“ вместо съществен ангажимент. Моделът за предпочитания се насища, резултатите губят калибрация при високи стойности, и политиката научава повърхностни модели на безвредност, вместо истинско разсъждение. Второ, калибрация: вероятностите за верига на мисълта обикновено са близки до 0 или 1 и не са добре калибрирани — авторите трябвало да ги ограничат, за да стабилизират обучението. Трето, твърдението, че методът изисква „никакви човешки етикети“, е преувеличено, както отбелязва прегледът на Austin ML Journal Club: хора са написали конституцията, хора са етикирали данните за полезност, и хора са оценили крайните модели. Човешкият вход е по-малък, а не отсъстващ.

Притеснението за двойна употреба, скрито в документа, заслужава повече внимание, отколкото е получило. Техника, която улеснява евтиното обучение на модели, следващи правила, също намалява бариерата за обучение на модели, следващи злотворни правила евтино. Авторите го споменават; не го разрешават.

Защо това има значение за финансовия ИИ

Случаят на Bean Labs е почти директна замяна: замени „вредни изходи“ с „счетоводни нарушения на политиката“ и тръбопроводът CAI се превръща в правдоподобна архитектура за безопасност при запис. Дефинирай конституция от счетоводни правила — GAAP третиране на предплатени разходи, специфични за компанията ограничения на сметкоплана, проверки на баланса при двустранно записване, прагове за одобрение — и пусни SL-CAI, за да научиш агента да самокритикува предложените журнални записи, преди да ги запише. Пусни RL-CAI, за да обучиш модел за награди върху ИИ-генерирани преценки кой предложен запис е по-съответстващ.

Режимите на отказ се пренасят директно също. Гудхартинг в счетоводен агент би изглеждал като агент, учещ се да добавя банален отказ от отговорност към всеки запис — „тази транзакция може да изисква допълнителна документация“ — вместо действително да проверява съответствието. Това е вероятно по-лошо от никакъв слой за безопасност, защото създава фалшива увереност. Проблемът с калибрацията има значение за решения с прагове: твърде самоуверен модел за награди ще дава почти двоични резултати, които не улавят маргинални нарушения на политиката. И притеснението за двойна употреба изплува отново: същата техника би могла да се използва за обучение на агент, който надеждно следва инструкции, предназначени да скрият транзакции.

Това, което документът не разглежда, е времевата последователност — дали агент, обучен с CAI, прилага правилата равномерно върху цялата история на ledger-а или само локално за всеки запис. Тази празнина има значение за месечното съгласуване и многостъпковите работни процеси.

Какво да прочетете след това

  • Колективен конституционен ИИ: Съгласуване на езиков модел с публичен принос (FAccT 2024) — изследва краудсорсинг на самата конституция; пряко от значение за това как Bean Labs би могло да изведе счетоводни правила от множество заинтересовани страни, вместо да ги кодира едностранно.
  • Специфични срещу общи принципи за конституционен ИИ (arXiv:2310.13798) — тества дали един високо ниво принцип („прави каквото е най-добро за човечеството“) може да замени дълъг специфичен списък; отговорът има значение за това колко стриктно трябва да специфицираш счетоводни правила, вместо да разчиташ на обща финансова етика.
  • RLHF работен процес за LLM (Ouyang et al., InstructGPT, arXiv:2203.02155) — базовата линия RLHF, която CAI подобрява; разбирането на оригинала помага да се калибрира какво всъщност печели RLAIF.

Споделете тази статия

Източник: https://beancount.io/bg/bean-labs/research-logs/2026/04/21/constitutional-ai-harmlessness-from-ai-feedback

Публикувано: 21 април 2026 г.

Последно обновено: 15 юли 2026 г.