Към основното съдържание

Дневник на изследванията на Bean Labs

ReAct: Синергия между разсъждението и действието в езиковите модели

Публикувано Последно обновено 6 минути четенеMike ThriftMike Thrift
ReAct: Синергия между разсъждението и действието в езиковите модели

Документ: https://arxiv.org/abs/2210.03629

На тази страница

ReAct (Yao et al., ICLR 2023) е статията зад цикъла "разсъждение-преди-действие", който повечето съвременни финансови агенти вече използват като стандартна основа. Отлагах я, защото ми се струваше инфраструктура — нещо, което всички вече знаят — но след като прекарах време с автономно записване обратно в счетоводната книга, исках да разбера режимите на отказ в източника, а не от слухове по веригата.

Статията

Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan и Yuan Cao предлагат измамно проста идея: вместо да караме езиковия модел или да разсъждава (верига от мисли), или да действа (извиква инструменти), нека прави и двете в редуващ се поток. Всяка стъпка в траекторията е или Мисъл (свободно разсъждение какво да се направи след това), или двойка Действие/Наблюдение (действие и наблюдението му от средата). Твърдението е, че това редуване е синергично — разсъжденията оформят кои действия да се предприемат, а наблюденията преоформят разсъжденията.

Тестват това на четири бенчмарка: HotpotQA и Fever (интензивни на знание въпроси и отговори и проверка на факти, използващи Wikipedia търсачка като пространство за действия) и ALFWorld и WebShop (въплътени и симулирани среди за електронна търговия, изискващи многоетапно вземане на решения). Всички експерименти използват PaLM-540B и GPT-3 (text-davinci-002) с few-shot подкана и едва един или два примера в контекста.

Ключови идеи

  • На ALFWorld ReAct превъзхожда базираните на имитационно обучение и обучение с подкрепление baseline-и с 34 процентни пункта абсолютна разлика в процента на успешни задачи; на WebShop печалбата е 10 процентни пункта абсолютна разлика.
  • На Fever (проверка на факти) ReAct превъзхожда веригата от мисли. На HotpotQA (многоетапни въпроси и отговори) CoT всъщност побеждава ReAct — статията признава това директно, вместо да го скрива.
  • Случаите на отказ се разделят на два типа: грешки в разсъжденията (моделът преценява погрешно каква информация има) и грешки при търсене (неинформативен резултат от Wikipedia отклонява последващата верига от разсъждения). Те са качествено различни и изискват различни смекчавания.
  • Самият формат е интерпретируем: човек може да прочете траекторията от Мисли, да открие грешката и да я поправи, като редактира един ред. Това изрично е посочено като свойство за безопасност.
  • Фината настройка на по-малки модели върху ReAct траектории им позволява да превъзхождат подканени по-големи модели — което предполага, че редуващият се формат е научим, а не просто трик за подкана.

Какво издържа — и какво не

Интерактивните резултати при вземане на решения (ALFWorld, WebShop) са най-силната част на статията. Разликата спрямо чистото имитационно обучение е достатъчно голяма, че е трудно да се припише на късмет в хиперпараметрите. Траекториите от разсъждения са наистина четими, а анализът на грешките, разграничаващ грешки при търсене от грешки в разсъжденията, е честен и полезен.

Резултатите при интензивни на знание въпроси и отговори са по-слаби и статията го знае. Загубата на ReAct от CoT на HotpotQA е реален факт: когато отговорът може да се достигне чрез верига от вътрешно знание на модела, триенето от извикванията на инструменти всъщност вреди. Моделът понякога извлича пасаж от Wikipedia, който е само косвено свързан, закотвя се върху него и след това произвежда по-лоши разсъждения, отколкото ако беше останал само в главата си. Статията нарича това "разсейване, предизвикано от търсене" и то не е поправено от архитектурата — това е проблем с качеството на извличането, маскиран като проблем на агента.

Има и фундаментален проблем с оценката, който статията наследява от самите бенчмаркове: както ALFWorld, така и WebShop имат относително ограничени пространства за действия в сравнение с това, от което се нуждае агент в реалния свят. 34-процентното подобрение на ALFWorld е впечатляващо в рамките на играта, но ALFWorld е симулирана домашна среда с малък фиксиран речник от действия. Обобщаването от това към, да речем, Beancount счетоводна книга с отворена схема за транзакции изисква екстраполация, която статията не обосновава.

Few-shot настройката е едновременно сила и слабост. Един или два примера в контекста е впечатляващо, но също така означава, че резултатите са много чувствителни към това кои примери са избрани. Не открих аблации върху избора на примери в статията, което би било полезно.

Защо това има значение за финансовия ИИ

Проблемът с безопасността при записване обратно за автономни Beancount агенти е точно режимът на отказ, който ReAct осветлява. Ако агентът разсъждава върху решение за категоризиране на транзакция и извлече двусмислен запис в счетоводната книга — такъв, който може да се отнася или към Expenses:Food, или към Expenses:Entertainment — моделът на ReAct ще закотви последващите разсъждения върху интерпретацията, която първият извлечен запис предполага. Това е финансовият аналог на "разсейването, предизвикано от търсене" и то не изчезва с по-внимателна подкана.

Аргументът за интерпретируемост има по-голямо значение тук, отколкото статията вероятно е възнамерявала. В счетоводството одиторът не се нуждае само от правилния отговор — той се нуждае от проследима верига от разсъждения, която може да подпише. Траекториите от Мисли на ReAct ви дават тази верига, а наблюдението, че човек може да коригира траектория чрез редактиране на една Мисъл, е директно приложимо към стъпка за преглед с човек в цикъла, преди някое журнално записване да бъде ангажирано в счетоводната книга.

Режимът на отказ, за който ме е грижа най-много обаче, са натрупващите се грешки при задачи с дълъг хоризонт. Работа по съгласуване, докосваща петдесет транзакции, има много повече възможности за грешна Мисъл, отколкото еднократно търсене в Wikipedia. ReAct не предоставя вроден механизъм на агента да открие, че се е отклонил — той просто продължава. Reflexion (Shinn et al., arXiv:2303.11366) адресира това, като добавя стъпка за вербална самооценка, а ReAct + Reflexion затваря 130 от 134 задачи в ALFWorld в сравнение с ReAct самостоятелно. Тази разлика ви казва колко стойност има добавянето на цикъл за възстановяване върху основната структура на ReAct.

Какво да прочетете след това

  • Reflexion: Езикови агенти с вербално обучение с подкрепление (Shinn et al., 2023, arXiv:2303.11366) — добавя стъпка за саморефлексия, която позволява на ReAct агента да ревизира стратегията си между епизодите; най-директното разширение за агенти със счетоводни книги, които трябва да се възстановяват от грешки по средата на траекторията.
  • FireAct: Към фина настройка на езикови агенти (Chen et al., 2023, arXiv:2310.05915) — фино настройва модели специално върху ReAct траектории в множество инструменти; от значение за обучението на специфичен за Beancount агент върху реални извиквания на инструменти от счетоводната книга.
  • Дърво от мисли: Обмислено решаване на проблеми с големи езикови модели (Yao et al., 2023, arXiv:2305.10601) — изследва търсене върху пътища на разсъждение, вместо да се ангажира с единична верига; има значение за случаи, когато първата ReAct траектория е грешна и се нуждае от систематично връщане назад.

Споделете тази статия

Източник: https://beancount.io/bg/bean-labs/research-logs/2026/04/17/react-synergizing-reasoning-and-acting-in-language-models

Публикувано: 17 април 2026 г.

Последно обновено: 15 юли 2026 г.