Я размышлял о том, что придёт после Tree of Thoughts — если можно искать по шагам рассуждения, почему бы не искать и по действиям? Именно это и делает LATS (Language Agent Tree Search), и поэтому я читаю эту статью сейчас. Статья Энди Чжоу, Кэна Янь, Майкла Шлапентох-Ротмана, Хаохана Вана и Юй-Сюн Вана (ICML 2024, arXiv:2310.04406) — это самое ясное на сегодня объединение рассуждения, действия и планирования в одном агентном фреймворке, и результаты действительно трудно игнорировать.
Статья
Основная проблема, которую решает LATS, — это структурный разрыв в предыдущих работах об агентах. ReAct чередует рассуждение и действие, но не имеет механизма разворота и попытки другого пути, когда траектория уходит в неверном направлении. Tree of Thoughts позволяет ветвление по шагам рассуждения, но действует на внутренних знаниях LM — он не может вызывать инструменты или получать внешнюю обратную связь во время поиска. Reflexion добавляет вербальную самокоррекцию, но его линейный цикл повторных попыток берёт новую траекторию без исследования альтернатив. LATS объединяет все три идеи с полноценным каркасом Monte Carlo Tree Search (MCTS), позволяя LLM-агентам исследовать множество ветвей, получать реальную обратную связь от среды и откатываться при неудаче пути.
Технический механизм — это шестиэтапный цикл MCTS: Выбор (выбор следующего узла для исследования через формулу UCT), Расширение (выборка n кандидатов действий из LM), Оценка (оценка каждого узла гибридной функцией ценности), Симуляция (прогон до терминального состояния), Обратное распространение (обновление значений предков) и Рефлексия (при неудаче — формирование вербального резюме о том, что пошло не так, и сохранение его как контекста). Функция ценности заслуживает внимания: V(s) = λ·LM(s) + (1−λ)·SC(s), где LM(s) — это собственная оценка LM качества траектории после получения обратной связи от среды, а SC(s) — это оценка самосогласованности, основанная на том, как часто это действие выбирается среди соседних узлов. Это не обученная модель вознаграждения — функция ценности полностью управляется подсказками.
Ключевые идеи
- На HumanEval, GPT-4 + LATS достигает 92,7% pass@1 против 91,0% для GPT-4 + Reflexion и 56,9% для GPT-3.5 + ReAct без дополнительных методов. GPT-3.5 + LATS подскакивает до 83,8%.
- На HotPotQA, LATS (CoT + ReAct) достигает 0,71 точно совпадающего ответа против 0,32 для базового ReAct — более чем удваивая точность на многошаговых задачах.
- На WebShop (веб-навигация и покупки), LATS набирает 75,9 (38,0% успеха) против Reflexion с 64,2 (35,0%) — значимый разрыв на задаче, требующей управления состоянием через многие страницы.
- На игре 24 (чистая задача на рассуждение), LATS достигает 0,44 успеха против 0,20 у ToT, несмотря на использование того же базового GPT-4.
- Удивительно, но LATS раскрывает меньше узлов для поиска решения, чем ToT (в среднем 66,65 против 84,05 узлов на HotPotQA при k=50) и использует меньше токенов (173 290 против 210 215), хотя теоретически выглядит более дорогим.
Что выдерживает проверку — а что нет
Числа в бенчмарках реальны, и фреймворк концептуально чист. Формализация UCT обеспечивает принципиальный компромисс между исследованием и использованием, которого не хватает ad-hoc BFS/DFS у ToT. Интеграция внешней обратной связи от среды в функцию ценности — вместо чистой интроспекции LM — это правильный шаг, и результаты это показывают.
Но статья несёт критическое допущение, которое авторы признают, не подвергая его полному стресс-тесту: LATS требует возможности отката среды к предыдущему состоянию. Без создания контрольных точек вы не можете ветвить дерево — как только действие выполнено, вы связаны. Авторы отмечают, что для LM-задач это часто управляемо путём «копирования-вставки исторических текстовых вводов», но для реальных сред действий (базы данных, файловые системы, API с побочными эффектами) это жёсткое требование, которое многие производственные системы не могут выполнить. Результаты WebShop, хотя и лучше базовых, показывают, что в сложных средах саморефлексия имеет тенденцию становиться общей, а не специфичной — агенты могут застревать и повторять поверхностно различные, но структурно идентичные ошибки. Статья отмечает это, но предлагает remedy.
Также нет абляции, изолирующей вклад структуры MCTS против дизайна функции ценности. Вполне возможно, что более простой подход с ветвлением с той же гибридной функцией ценности закрыл бы значительную часть разрыва, и авторы не тестируют это напрямую.
Почему это важно для ИИ в финансах
Beancount-бухгалтерские книги — почти идеальная среда для поиска по дереву в стиле LATS по одной главной причине: каждая книга поддерживается git-репозиторием. Требование отката состояния — это жёсткое ограничение, которое делает LATS непрактичным во многих реальных средах — тривиально выполняется через git checkout или git stash. Агент записи мог бы предлагать кандидатные журнальные записи через множество ветвей, оценивать их по ограничениям балансового отчёта (функция ценности) и фиксировать только путь с наивысшим баллом. Неудачные ветви получают вербальную рефлексию: «Размещённая запись нарушила Активы = Обязательства + Собственный капитал, потому что тип счёта был классифицирован неверно».
Гибридный дизайн функции ценности также напрямую применим. Для агента книги, LM(s) оценивал бы предложенную запись на семантическое соответствие (похоже ли это на правильную категорию?), а SC(s) отслеживал бы, насколько последовательно агент классифицирует похожие прошлые транзакции — естественная проверка самосогласованности, основанная на собственной истории книги.
Откат состояния — это единственное место, где я бы оспорил финансовую аналогию. У реальных книг часто есть последующие эффекты: размещённая запись запускает счёт-фактуру, которая запускает платёжный процесс. В таких случаях допущение LATS ломается. Конкретно для Beancount, где книга — это текстовый файл под контролем git и изменения происходят локально до любого запуска последующих триггеров, допущение выполняется — но это ограничение дизайна, которое нужно явно упомянуть.
Что читать дальше
- Планирование на основе MCTS без моделей среды: «Reasoning with Language Model is Planning with World Model» (Hao et al., 2023, arXiv:2305.14992) — RAP, на котором LATS строится и которое он улучшает.
- Насколько хорошо обобщается функция ценности LM? «Let's Verify Step by Step» (Lightman et al., 2023, arXiv:2305.20050) — модели вознаграждения процесса как альтернатива функциям ценности на основе подсказок.
- Безопасное многошаговое планирование при необратимости: «Decision-Making with Language Models via Successive Prompting» (Creswell et al., 2023) — более простой подход к планированию, который избегает требования отката состояния.





