Към основното съдържание

Дневник на изследванията на Bean Labs

LATS: Езиков агент с дървовидно търсене — разсъждение, действие и планиране в една рамка

Публикувано Последно обновено 6 минути четенеMike ThriftMike Thrift
LATS: Езиков агент с дървовидно търсене — разсъждение, действие и планиране в една рамка

Документ: https://arxiv.org/abs/2310.04406

На тази страница

Мислех си какво следва след Tree of Thoughts — ако може да търсиш сред стъпките на разсъждението, защо да не търсиш и сред действията? Точно това прави LATS (Language Agent Tree Search) и затова го чета сега. Статията на Анди Джоу, Кен Ян, Майкъл Шлапенток-Ротман, Хаохан Уан и Ю-Сионг Уан (ICML 2024, arXiv:2310.04406) е най-ясният досега синтез на разсъждение, действие и планиране в една агентна рамка, а резултатите са наистина трудни за отхвърляне.

Статията

Основният проблем, който LATS адресира, е структурна празнина в предишната работа върху агентите. ReAct преплита разсъждение и действие, но няма механизъм да се върне назад и да опита различен път, когато траекторията се обърка. Tree of Thoughts позволява разклоняване върху стъпките на разсъждение, но работи върху вътрешни знания на езиковия модел — не може да извиква инструменти или да получава външна обратна връзка по време на търсенето. Reflexion добавя вербална самокорекция, но неговият линеен цикъл на повторение се ангажира с нова траектория, без да изследва алтернативи. LATS слива тези три идеи със стабилна основа от Monte Carlo Tree Search (MCTS), позволявайки на LLM агентите да изследват множество разклонения, да получават реална обратна връзка от средата и да се връщат назад, когато даден път се провали.

Техническият механизъм е шестстъпков цикъл на MCTS: Селекция (избор на следващия възел за изследване чрез формулата UCT), Експанзия (вземане на проби от n кандидат-действия от езиковия модел), Оценка (оценяване на всеки възел чрез хибридна функция на стойност), Симулация (извеждане до крайно състояние), Обратно разпространение (актуализиране на стойностите на предшествениците) и Рефлексия (при провал — генериране на вербално обобщение за това какво се е объркало и съхраняването му като контекст). Функцията на стойност заслужава внимание: V(s) = λ·LM(s) + (1−λ)·SC(s), където LM(s) е собствената оценка на езиковия модел за качеството на траекторията след получаване на обратна връзка от средата, а SC(s) е резултат за самосъгласуваност, базиран на това колко често това действие е извадено като проба сред съседните възли. Това не е обучен модел за награда — функцията на стойност е изцяло управлявана от подсказки (prompts).

Ключови идеи

  • На HumanEval, GPT-4 + LATS достига 92.7% pass@1, в сравнение с 91.0% за GPT-4 + Reflexion и 56.9% за GPT-3.5 + ReAct самостоятелно. GPT-3.5 + LATS скача до 83.8%.
  • На HotPotQA, LATS (CoT + ReAct) достига 0.71 точно съвпадение (Exact Match) спрямо 0.32 за базовата линия ReAct — повече от удвояване на точността при многостъпкови въпроси.
  • На WebShop (уеб навигация + покупка), LATS постига 75.9 (38.0% успех) спрямо Reflexion с 64.2 (35.0%) — значителна разлика в задача, която изисква управление на състояние през много страници.
  • На Game of 24 (чисто логическа задача), LATS достига 0.44 успех спрямо 0.20 за ToT, въпреки че използва същия GPT-4 модел.
  • Изненадващо, LATS разширява по-малко възли, за да намери решение, отколкото ToT (средно 66.65 срещу 84.05 възела на HotPotQA при k=50) и използва по-малко токени (173 290 срещу 210 215), въпреки че на теория изглежда по-скъп.

Какво издържа — и какво не

Резултатите от бенчмарковете са реални, а рамката е концептуално чиста. Формулировката на UCT осигурява принципен компромис между изследване и експлоатация, който липсва на ad-hoc BFS/DFS в ToT. Интегрирането на външна обратна връзка от средата във функцията на стойност — вместо чист интроспекция на езиковия модел — е правилният ход и резултатите го показват.

Но статията носи критично допускане, което авторите признават, без да го подложат на пълен стрес-тест: LATS изисква способност за връщане на средата към предишно състояние. Без създаване на контролни точки не можеш да разклоняваш дървото — веднъж щом действие е предприето, си ангажиран. Авторите отбелязват, че за задачи с езикови модели това често е управляемо чрез „копиране и поставяне на исторически текстови входове", но за реални среди на действие (бази данни, файлови системи, API-та със странични ефекти) това е трудно изискване, което много производствени системи не могат да изпълнят. Резултатите от WebShop, макар и по-добри от базовите линии, показват, че в сложни среди саморефлексиите стават склонни към обобщения, вместо да са конкретни — агентите могат да заседнат и да повтарят повърхностно различни, но структурно идентични грешки. Статията отбелязва това, но не предлага решение.

Също така липсва аблация, която да изолира приноса на структурата на MCTS спрямо дизайна на функцията на стойност. Възможно е по-опростен подход с разклоняване и същата хибридна функция на стойност да затвори голяма част от разликата, а авторите не тестват това директно.

Защо това има значение за финансовия ИИ

Beancount счетоводните книги са почти идеална среда за LATS-стил дървовидно търсене поради една основна причина: всяка счетоводна книга е подкрепена от git хранилище. Изискването за връщане към предишно състояние — трудното ограничение, което прави LATS непрактичен в много реални среди — е тривиално изпълнимо чрез git checkout или git stash. Агент за записване би могъл да предложи кандидат-записи в журнала в множество разклонения, да ги оцени спрямо ограниченията на баланса (функцията на стойност) и да запише само пътя с най-висок резултат. Провалените разклонения получават вербална рефлексия: „Публикуваният запис наруши Активи = Пасиви + Собствен капитал, защото типът на сметката беше неправилно класифициран."

Хибридният дизайн на функцията на стойност също е пряко приложим. За агент за счетоводни книги, LM(s) би оценил предложен запис за семантично съответствие (изглежда ли като правилната категория?), докато SC(s) би проследявал колко последователно агентът класифицира подобни минали транзакции — естествена проверка за самосъгласуваност, вкоренена в собствената история на счетоводната книга.

Връщането към предишно състояние е единственото място, където бих възразил на финансовата аналогия. Реалните счетоводни книги често имат низходящи ефекти: публикуван запис задейства фактура, която задейства работен процес по плащане. В тези случаи допускането на LATS се срива. Конкретно за Beancount, където счетоводната книга е обикновен текстов файл под контрола на git и промените се случват локално, преди да задействат какъвто и да е низходящ тригер, допускането издържа — но това е ограничение на дизайна, което трябва да остане изрично.

Какво да прочетете след това

  • MCTS-базирано планиране без модели на средата: „Reasoning with Language Model is Planning with World Model" (Hao et al., 2023, arXiv:2305.14992) — RAP, върху което LATS надгражда и го подобрява.
  • Колко добре се обобщава функцията на стойност на езиковия модел? „Let's Verify Step by Step" (Lightman et al., 2023, arXiv:2305.20050) — процесни модели за награда като алтернатива на базираните на подсказки функции на стойност.
  • Безопасно многостъпково планиране при необратимост: „Decision-Making with Language Models via Successive Prompting" (Creswell et al., 2023) — по-опростен подход за планиране, който избягва изискването за връщане към предишно състояние.

Споделете тази статия

Източник: https://beancount.io/bg/bean-labs/research-logs/2026/05/10/lats-language-agent-tree-search-reasoning-acting-planning

Публикувано: 10 май 2026 г.

Последно обновено: 14 септември 2026 г.