Към основното съдържание

Дневник на изследванията на Bean Labs

Рефлексия: Езикови агенти, които се учат от грешки без преобучване

Публикувано Последно обновено 5 минути четенеMike ThriftMike Thrift
Рефлексия: Езикови агенти, които се учат от грешки без преобучване

Документ: https://arxiv.org/abs/2303.11366

На тази страница

Мислех си за това какво би било необходимо, за да се изгради Beancount агент за водене на сметки, който става по-добър с времето, без да се преобучава всеки път, когато направи грешка. „Рефлексия: Езикови агенти с вербално обучение с подкрепление“ на Шин и съавт. (NeurIPS 2023) директно отговаря на този въпрос, а отговорът е едновременно обещаващ и по-ограничен, отколкото сочат водещите числа.

Статията

Рефлексия (Шин, Касано, Берман, Гопинат, Нарасимхан, Яо; NeurIPS 2023) предлага, че вместо да се коригират теглата на модела чрез скъпо обучение с подкрепление, можете да подобрите агента, като го накарате сам да напише своя анализ на грешките на естествен език. След всеки опит модел за саморефлексия разчита траекторията и сигнала за наградата, произвежда вербален постмортем анализ и го добавя към буфер за епизодична памет. При следващия опит актьорът разчита натрупаните рефлексии, преди да действа. Не се изчислява градиент. Не се фино настройва модел. „Обучението“ се съдържа изцяло в контекстния прозорец.

Трикомпонентната архитектура — актьор, оценител, саморефлексия — е достатъчно модулна, за да обхване различни типове задачи. Оценителят може да бъде двоичен резултат от единичен тест, LLM жури или специфична за задачата евристика. Тази гъвкавост прави статията интересна отвъд бенчмарковете за кодиране.

Ключови идеи

  • На HumanEval Python pass@1, Рефлексия + GPT-4 достига 91%, спрямо базовата линия на GPT-4 от 80% — значителна и реална разлика. На Leetcode Hard скокът е от 7.5% → 15%, което е напредък, но също така напомня колко трудни остават тези задачи.
  • На AlfWorld (текстово базирано планиране на домакинство), Рефлексия решава 130/134 задачи след 12 опита срещу 108/134 за базовия модел ReAct — най-убедителният резултат в статията, отнасящ се до вземането на решения.
  • На HotpotQA (многостъпков въпрос-отговор), CoT + Рефлексия подобрява точния отговор от 61% на 75% сред 100 извадени въпроса.
  • На MBPP (втори Python бенчмарк), Рефлексия леко влошава резултатите: от 80.1% на 77.1%. Статията прикрива този факт.
  • На WebShop, Рефлексия не помага. Авторите приписват това на изискването за „значително разнообразие и проучване“ — агентът пише безполезни рефлексии, които не се обобщават при различни продуктови търсения.
  • Паметта е ограничена до 1–3 съхранени епизода. Това е практично предвид дължината на контекста, но означава, че агентът не може да натрупва учене от дълга експлоатация.

Какво издържа проверката — и какво не

Основното твърдение е вярно: вербалната рефлексия подобрява производителността при задачи с ясна и проверима обратна връзка. Ако знаете дали кодът е преминал единичните си тестове, рефлексивният модул има конкретно нещо, за което да разсъждава. Резултатите на AlfWorld и HumanEval са реални и значими.

Но неуспехът на WebShop е поучителен, а статията донякъде го подценява. Рефлексията работи, когато оценителят може да произведе ясен и действен сигнал. Когато отказът е „агентът изследва грешната част от голямо пространство за търсене“, казването му „опитай различни термини за търсене следващия път“ не води до сходимост. Това е структурно ограничение: вербалното подкрепление не замества стратегиите за проучване.

Експериментите с кодиране също имат цикличност, която авторите признават в блога си: агентът генерира свои собствени единични тестове, за да оценява собствения си код. Дефектен тестов пакет води до фалшиви положителни резултати. Числото 91% на HumanEval се задържа, защото HumanEval предоставя еталонни тестове (ground-truth), но цикълът на самооценка на агента е по-малко надежден при нови задачи, където няма външен оракул.

Възпроизводимостта е реален проблем. Всички основни резултати използват GPT-4, а експериментите със starchat-beta показват без подобрение спрямо основната линия, което означава, че техниката е ограничена от възможностите на модела. Екипи, работещи с по-малки или модели с отворени тегла, не трябва да очакват същите ползи.

Защо това има значение за финансовия ИИ

Случаят на използване на Beancount има точно свойството, което прави Рефлексия да работи добре: ясен оценител. Ако агент неправилно категоризира транзакция, проверката на баланса на сметката или стъпката за съгласуване може да произведе двоичен сигнал — книгите се изравняват или не. Това е много по-добра обратна връзка от двусмислената награда за търсене на продукта в WebShop.

По-конкретно, мога да си представя Beancount агент за обратно записване, който след неуспешен опит за публикуване (невалидна сметка, грешна валута, неуспешна проверка на инвариант), генерира вербална рефлексия: „Използвах Expenses:Meals, но тази сметка изисква подкатегория. Следващия път ще проверя йерархията на сметките, преди да публикувам.“ Тази рефлексия се съхранява и се извлича при следващата подобна транзакция. Агентът ефективно натрупва политика, специфична за сесията, от собствените си грешки.

Ограничението на паметта е основното архитектурно предизвикателство. Буфер от 1–3 епизода е подходящ за една сесия, но внедрен счетоводен агент трябва да се учи от хиляди транзакции и седмици работа. Разширяването на Рефлексия до дългосрочна памет — може би чрез обобщаване или индексиране на рефлексиите — е отворен проблем. Статията не го решава.

Какво да прочетете след това

  • Language Agent Tree Search (LATS) (Джоу и съавт., arXiv:2310.04406; ICML 2024) — разширява Рефлексия, като обвива търсене в дърво по метода Монте Карло (Monte Carlo Tree Search) около цикъла рефлексия-повторен опит, позволявайки на агентите да изследват множество разсъждаващи клона, вместо да се придържат към една траектория. Достига 92.7% на HumanEval с GPT-4.
  • Retroformer (Яо и съавт., arXiv:2308.02151; ICLR 2024) — вместо да разчита на същия LLM да саморефлектира, Retroformer обучава отделен лек ретроспективен модел чрез градиент по политиката, правейки процесът на рефлексия обучаем за различни задачи. По-принципен, но изисква фино настройване.
  • Self-Reflection в LLM агентите: Ефекти върху производителността при решаване на задачи (arXiv:2405.06682, 2024) — емпирично проучване, което специално изследва кога и защо рефлексията помага, с аблации за различни типове задачи. Полезно за калибриране кога да се прилага Рефлексия спрямо други коригиращи стратегии.

Споделете тази статия

Източник: https://beancount.io/bg/bean-labs/research-logs/2026/04/25/reflexion-language-agents-verbal-reinforcement-learning

Публикувано: 25 април 2026 г.

Последно обновено: 15 юли 2026 г.