Я розмірковував про те, що буде після Tree of Thoughts — якщо можна шукати по кроках міркування, чому б не шукати по діях також? Саме це робить LATS (Language Agent Tree Search), і тому я читаю це зараз. Папір Енді Чжоу, Кая Яня, Міхала Шлапенток-Ротмана, Хаохана Вана та Ю-Сюн Вана (ICML 2024, arXiv:2310.04406) є найчистішим синтезом міркування, дії та планування в єдиному агентному фреймворку, і результати справді важко відкинути.
Папір
Основна проблема, яку вирішує LATS, — це структурний розрив у попередніх агентних роботах. ReAct чергує міркування та дію, але не має механізму, щоб розвернутися та спробувати інший шлях, коли траєкторія йде неправильно. Tree of Thoughts дозволяє розгалуження по кроках міркування, але працює на внутрішньому знанні LM — він не може викликати інструменти або отримувати зовнішній зворотний зв'язок під час пошуку. Reflexion додає вербальну самокорекцію, але його лінійний цикл повторних спроб зобов'язує до нової траєкторії без дослідження альтернатив. LATS об'єднує всі три ідеї з належним ядром Monte Carlo Tree Search (MCTS), дозволяючи LLM-агентам досліджувати кілька гілок, отримувати реальний зворотний зв'язок від середовища та повертатися назад, коли шлях зазнає невдачі.
Технічний механізм — це шестикроковий цикл MCTS: Selection (вибір наступного вузла для дослідження за формулою UCT), Expansion (семплювання n кандидатних дій з LM), Evaluation (оцінка кожного вузла гібридною функцією цінності), Simulation (прогін до термінального стану), Backpropagation (оновлення значень предків) та Reflection (при невдачі — генерація вербального резюме про те, що пішло не так, та збереження його як контексту). Функція цінності заслуговує уваги: V(s) = λ·LM(s) + (1−λ)·SC(s), де LM(s) — власна оцінка LM якості траєкторії після отримання зворотного зв'язку від середовища, а SC(s) — це показник самоконсистентності, заснований на тому, як часто ця дія семплюється серед сестринських вузлів. Це не навчена модель винагороди — функція цінності повністю керується промптами.
Ключові ідеї
- На HumanEval, GPT-4 + LATS досягає 92.7% pass@1, порівняно з 91.0% для GPT-4 + Reflexion та 56.9% для GPT-3.5 + ReAct окремо. GPT-3.5 + LATS стрибає до 83.8%.
- На HotPotQA, LATS (CoT + ReAct) досягає 0.71 Exact Match порівняно з 0.32 для базового ReAct — більш ніж подвоює точність багатокрокового пошуку.
- На WebShop (веб-навігація + покупки), LATS отримує 75.9 (38.0% успіху) проти Reflexion на 64.2 (35.0%) — суттєвий розрив у завданні, що вимагає керування станом через багато сторінок.
- На Game of 24 (чисто логічна головоломка), LATS досягає 0.44 успіху проти 0.20 у ToT, попри використання того самого бекбону GPT-4.
- Несподівано, LATS розширює менше вузлів для знаходження рішення, ніж ToT (у середньому 66.65 проти 84.05 вузлів на HotPotQA при k=50) та використовує менше токенів (173,290 проти 210,215), хоча теоретично виглядає дорожчим.
Що тримається — а що ні
Цифри бенчмарків реальні, а фреймворк концептуально чистий. Формула UCT забезпечує принциповий баланс дослідження та використання, якого бракує ad-hoc BFS/DFS у ToT. Інтеграція зовнішнього зворотного зв'язку від середовища у функцію цінності — замість чистого інтроспективного аналізу LM — є правильним кроком, і результати це показують.
Але папір несе критичне припущення, яке автори визнають, не провівши повного стрес-тестування: LATS вимагає можливості відновлення середовища до попереднього стану. Без чекпоінтингу неможливо розгалужувати дерево — щойно дія виконана, ви зобов'язані. Автори зазначають, що для LM-завдань це часто можна впоратися «копіюванням-вставленням історичних текстових входів», але для реальних дієвих середовищ (бази даних, файлові системи, API з побічними ефектами) це жорстка вимога, яку багато виробничих систем не можуть задовольнити. Результати WebShop, хоч і кращі за базові, показують, що у складних середовищах саморефлексія має тенденцію ставати загальною, а не специфічною — агенти можуть застрягати та повторювати поверхнево різні, але структурно ідентичні помилки. Папір зазначає це, але не пропонує рішення.
Також немає абляції, яка б ізолювала внесок структури MCTS порівняно з дизайном функції цінності. Цілком можливо, що простіший підхід із розгалуженням із тією ж гібридною функцією цінності зміг би закрити більшу частину розриву, і автори не тестують це безпосередньо.
Чому це важливо для фінансового ШІ
Beancount-бухгалтерські книги є майже ідеальним середовищем для LATS-стилю дерева пошуку з однієї головної причини: кожна книга підтримується git-репозиторієм. Вимога відновлення стану — жорстке обмеження, яке робить LATS непрактичним у багатьох реальних середовищах — тривіально задовольняється за допомогою git checkout або git stash. Агент запису міг би пропонувати кандидатні журнальні записи у кількох гілках, оцінювати їх згідно з обмеженнями балансового звіту (функція цінності) та комітувати лише шлях із найвищою оцінкою. Невдалі гілки отримують вербальну рефлексію: «Проведений запис порушив Актив = Зобов'язання + Власний капітал, оскільки тип рахунку був неправильно класифікований».
Гібридний дизайн функції цінності також безпосередньо застосовний. Для агента бухгалтерської книги LM(s) оцінював би запропонований запис на семантичну відповідність (чи виглядає це як правильна категорія?), тоді як SC(s) відстежував би, наскільки послідовно агент класифікує подібні минулі транзакції — природна перевірка самоконсистентності, заснована на власній історії книги.
Відновлення стану — це єдине місце, де я б заперечив проти фінансової аналогії. Реальні книги часто мають низхідні ефекти: проведений запис запускає рахунок-фактуру, який запускає платіжний робочий процес. У таких випадках припущення LATS руйнується. Конкретно для Beancount, де книга є файлом у plain text під контролем git, а зміни відбуваються локально до будь-якого низхідного тригера, припущення виконується — але це обмеження дизайну, яке слід тримати явним.
Що читати далі
- MCTS-планування без моделей середовища: «Reasoning with Language Model is Planning with World Model» (Hao et al., 2023, arXiv:2305.14992) — RAP, на якому базується та вдосконалює LATS.
- Наскільки добре узагальнюється функція цінності LM? «Let's Verify Step by Step» (Lightman et al., 2023, arXiv:2305.20050) — процесні моделі винагороди як альтернатива функціям цінності на основі промптів.
- Безпечне багатокрокове планування при незворотності: «Decision-Making with Language Models via Successive Prompting» (Creswell et al., 2023) — простіший підхід до планування, який уникає вимоги відновлення стану.





