Preskočiť na hlavný obsah

Výskumný denník Bean Labs

LATS: Language Agent Tree Search — Uvažovanie, Konanie a Plánovanie v Jednom Frameworku

Publikované Naposledy aktualizované 5 min čítaniaMike ThriftMike Thrift
LATS: Language Agent Tree Search — Uvažovanie, Konanie a Plánovanie v Jednom Frameworku

Článok: https://arxiv.org/abs/2310.04406

Na tejto stránke

Premýšľal som o tom, čo príde po Tree of Thoughts — ak môžete prehľadávať kroky uvažovania, prečo neprehľadávať aj akcie? To je presne to, čo robí LATS (Language Agent Tree Search), a prečo to teraz čítam. Článok od Andy Zhou, Kai Yan, Michala Shlapentokh-Rothmana, Haohana Wanga a Yu-Xionga Wanga (ICML 2024, arXiv:2310.04406) je zatiaľ najjasnejšou syntézou uvažovania, konania a plánovania v jednom agentskom frameworku, a výsledky sú naozaj ťažko ignorovateľné.

Článok

Jadro problému, ktorý LATS rieši, je štrukturálna medzera v predchádzajúcej agentskej práci. ReAct prelína uvažovanie a konanie, ale nemá mechanizmus na zvrátenie a skúšanie inej cesty, keď trajektória zlyhá. Tree of Thoughts umožňuje vetvenie cez kroky uvažovania, ale funguje na interných znalostiach LM — nemôže volať nástroje ani prijímať externú spätnú väzbu počas prehľadávania. Reflexion pridáva verbálnu seba-korekciu, ale jeho lineárna retry slučka sa zaväzuje k novej trajektórii bez skúmania alternatív. LATS spája všetky tri myšlienky s poriadnym Monte Carlo Tree Search (MCTS) chrbtom, umožňujúc LLM agentom preskúmať viacero vetiev, získať skutočnú spätnú väzbu z prostredia a vrátiť sa späť, keď cesta zlyhá.

Technický mechanizmus je šesťkroková MCTS slučka: Selekcia (vyber ďalší uzol na preskúmanie cez UCT vzorec), Expanzia (vzorkuj n kandidátskych akcií z LM), Evaluácia (ohodnoť každý uzol hybridnou hodnotovou funkciou), Simulácia (roll out do terminálneho stavu), Backpropagácia (aktualizuj hodnoty predkov) a Reflexia (pri zlyhaní vygeneruj verbálne zhrnutie toho, čo sa pokazilo, a ulož ho ako kontext). Hodnotová funkcia si zaslúži pozornosť: V(s) = λ·LM(s) + (1−λ)·SC(s), kde LM(s) je vlastný odhad LM kvality trajektórie po prijatí spätnej väzby z prostredia, a SC(s) je self-consistency skóre založené na tom, ako často je daná akcia vzorkovaná naprieč sesterskými uzlami. Toto nie je trénovaný reward model — hodnotová funkcia je úplne poháňaná promptom.

Kľúčové myšlienky

  • Na HumanEval, GPT-4 + LATS dosahuje 92,7% pass@1, oproti 91,0% pre GPT-4 + Reflexion a 56,9% pre GPT-3.5 + ReAct samotný. GPT-3.5 + LATS skáče na 83,8%.
  • Na HotPotQA, LATS (CoT + ReAct) dosahuje 0,71 Exact Match oproti 0,32 pre ReAct baseline — viac ako zdvojnásobenie multi-hop presnosti.
  • Na WebShop (webová navigácia + nákup), LATS skóruje 75,9 (38,0% úspešnosť) oproti Reflexion na 64,2 (35,0%) — zmysluplný rozdiel na úlohe, ktorá vyžaduje správu stavu naprieč mnohými stránkami.
  • Na Game of 24 (čisto logická hádanka), LATS dosahuje 0,44 úspešnosť oproti ToT's 0,20, napriek použitiu rovnakého GPT-4 základu.
  • Prekvapivo, LATS expanduje menej uzlov na nájdenie riešenia ako ToT (priemer 66,65 vs. 84,05 uzlov na HotPotQA pri k=50) a používa menej tokenov (173 290 vs. 210 215), aj keď v teórii vyzerá drahšie.

Čo obstojí — a čo nie

Benchmark čísla sú reálne a framework je koncepčne čistý. UCT formulácia poskytuje principiálny exploration–exploitation kompromis, ktorý ToT's ad-hoc BFS/DFS nemá. Integrácia externej spätnej väzby z prostredia do hodnotovej funkcie — namiesto čistej LM introspekcie — je správny krok a výsledky to ukazujú.

Ale článok nesie kritický predpoklad, ktorý autori uznávajú bez plného stresového testovania: LATS vyžaduje schopnosť vrátiť prostredie do predchádzajúceho stavu. Bez checkpointingu nemôžete vetviť strom — akonáhle je akcia vykonaná, ste zaviazaní. Autori poznamenávajú, že pre LM úlohy je to často zvládnuteľné „kopírovaním a vkladaním historických textových vstupov", ale pre reálne akčné prostredia (databázy, súborové systémy, API s vedľajšími účinkami) je to tvrdá požiadavka, ktorú mnohé produkčné systémy nemôžu splniť. WebShop výsledky, hoci lepšie ako baselines, ukazujú, že v komplexných prostrediach majú tendenciu self-reflexie stať sa generickými skôr než špecifickými — agenti môžu uviaznuť a opakovať povrchne odlišné, ale štrukturálne identické chyby. Článok to poznamenáva, ale neponúka žiadny liek.

Tiež neexistuje žiadna ablácia izolujúca príspevok MCTS štruktúry oproti dizajnu hodnotovej funkcie. Je pravdepodobné, že jednoduchší prístup vetvenia s rovnakou hybridnou hodnotovou funkciou by uzavrel veľkú časť medzery, a autori to priamo netestujú.

Prečo to záleží pre finančnú AI

Beancount účtovné knihy sú takmer ideálnym prostredím pre LATS-štýlové stromové prehľadávanie z jedného hlavného dôvodu: každá účtovná kniha je podporovaná git repozitárom. Požiadavka na reverziu stavu — tvrdé obmedzenie, ktoré robí LATS nepraktickým v mnohých reálnych prostrediach — je triviálne splnená pomocou git checkout alebo git stash. Write-back agent by mohol navrhovať kandidátske účtovné zápisy naprieč viacerými vetvami, ohodnocovať ich proti bilančným obmedzeniam (hodnotová funkcia) a commitnúť len najlepšie hodnotenú cestu. Zlyhané vetvy dostanú verbálnu reflexiu: „Zverejnený zápis porušil Aktíva = Pasíva + Vlastné imanie, pretože typ účtu bol nesprávne klasifikovaný."

Hybridný dizajn hodnotovej funkcie je tiež priamo aplikovateľný. Pre účtovného agenta by LM(s) ohodnotil navrhovaný zápis na sémantickú vhodnosť (vyzerá to ako správna kategória?), zatiaľ čo SC(s) by sledovalo, ako konzistentne agent klasifikuje podobné minulé transakcie — prirodzená self-consistency kontrola zakorenená v histórii samotnej účtovnej knihy.

Reverzia stavu je jediné miesto, kde by som tlačil späť na finančnú analógiu. Reálne účtovné knihy majú často downstream efekty: zverejnený zápis spustí faktúru, ktorá spustí platobný workflow. V týchto prípadoch sa LATS predpoklad rozpadá. Špecificky pre Beancount, kde je účtovná kniha plain-text súbor pod git kontrolou a zmeny sa dejú lokálne pred akýmkoľvek downstream spúšťačom, predpoklad platí — ale toto je dizajnové obmedzenie, ktoré treba mať explicitné.

Čo čítať ďalej

  • MCTS-založené plánovanie bez modelov prostredia: „Reasoning with Language Model is Planning with World Model" (Hao et al., 2023, arXiv:2305.14992) — RAP, na ktorom LATS stavia a zlepšuje ho.
  • Ako dobre generalizuje LM hodnotová funkcia? „Let's Verify Step by Step" (Lightman et al., 2023, arXiv:2305.20050) — procesné reward modely ako alternatíva k prompt-založeným hodnotovým funkciám.
  • Bezpečné viackrokové plánovanie pri nezvratnosti: „Decision-Making with Language Models via Successive Prompting" (Creswell et al., 2023) — jednoduchší prístup plánovania, ktorý sa vyhýba požiadavke na reverziu stavu.

Zdieľať tento článok

Zdroj: https://beancount.io/sk/bean-labs/research-logs/2026/05/10/lats-language-agent-tree-search-reasoning-acting-planning

Publikované: 10. mája 2026

Naposledy aktualizované: 14. septembra 2026