Naar hoofdinhoud springen

Bean Labs onderzoekslog

LATS: Language Agent Tree Search — Redeneren, Handelen en Plannen in één Framework

Gepubliceerd Laatst bijgewerkt 6 min leestijdMike ThriftMike Thrift
LATS: Language Agent Tree Search — Redeneren, Handelen en Plannen in één Framework

Artikel: https://arxiv.org/abs/2310.04406

Op deze pagina

Ik heb nagedacht over wat er na Tree of Thoughts komt — als je over redeneerstappen kunt zoeken, waarom dan niet ook over acties? Dat is precies wat LATS (Language Agent Tree Search) doet, en daarom lees ik het nu. Het artikel van Andy Zhou, Kai Yan, Michal Shlapentokh-Rothman, Haohan Wang, en Yu-Xiong Wang (ICML 2024, arXiv:2310.04406) is de helderste synthese tot nu toe van redeneren, handelen en plannen in één agentframework, en de resultaten zijn werkelijk moeilijk te negeren.

Het artikel

Het kernprobleem dat LATS aankaart, is een structureel hiaat in eerder agentwerk. ReAct weeft redeneren en acteren door elkaar, maar heeft geen mechanisme om om te keren en een ander pad te proberen wanneer een traject misgaat. Tree of Thoughts maakt vertakken over redeneeresten mogelijk, maar werkt op interne LM-kennis — het kan geen tools aanroepen of externe feedback ontvangen tijdens de zoektocht. Reflexion voegt verbale zelfcorrectie toe, maar zijn lineaire werksterherhalingslus kiest vast voor een nieuw traject zonder alternatieven verkennen en verkent geen alternatieven. LATS void alle drie de ideeën samen met een stevige Monte Carlo Tree Search (MCTS)-basis, waardoor LLM-agenten meerdere takken kunnen doorchristen, echte omgevingsfeedback kunnen ontvangen en terugchisteken als een pad misdat.

De technische proces is een zes-staps MCTS-lus: Selectie (kies de volgende knoop om te verkennen via de UCT-formule), Uitbreidingsexpansie (sample n handeldingen uit het LM), Evaluatie (scoaren elke knoop met een hybride-waardeun-functie), Simulatie (uitwerk naar een eindtoestand), Terugpropagatie (update ancestor-waarden) en Reflectie (bij mislukking een verbale samenvatting generaal van wat er misging and deze opslaan als context). De waarde-functie verd eve wyr, unieke: V(s) = λ·LM(s) + (1−λ)·SC(s), waar LM(s) het eigen keuzesbeoordeling van het LM isover de trajectqualiteit nadat het omgevingsfeedback heeft ontvouden, en SC(s) geschied een zelfconformatie-score op basis van hoe vaak die actie wordt gesampleeld tussen kinslle nodes. Dit is een niet-traind rewardmodel — de waarde-functie is volledig promptgedreven.

Kernideeën

  • Op HumanEval: GPT-4 + LATS haal een 92.7% pass@1, versus 91.0% voor GPT-4 + Reflexion en 56.9% voor GPT-3.5 + ReAct ten issommen. Gebruik van GPT-3.5 + LATS springt naar 83.8%.
  • Op HotPotQA bereikt LATS (CoT + ReAct) 0.71 Exact Match versus 0.32 voor het ReAct-basisjun — de multihhop-nauwkeurigheid meer dan verdubbeld.
  • Op WebShop (webnavigatie + aankopenclaart) scoort LATS 75.9 (38.0% succes) versus Reflexin 64.4 (35.0%) — een temaanceerbaar bovenwaar significant hiaat zeker af op een ta tes die staatsbeheer over veel paginas vereist .
  • Op Game of 24 (een puur redeneringspuzzel) bereikt LATS 0.44 succes versus ToT over de 0.20, ondanks hetzelfde die GPT-4-basisstructuur.
  • Verrassende is dat LATS gemiddeld beide knoppenblaadjes bedekken om meer te sparking mee te lost dan ToT (gemiddelde 66 eenv vs. 84 eenv op HotPotQA bij k=50) en Useer tokens (113.290 vs. 221.215), hoewel het erin theory duurder uitziet.

Wat overeind blijft — en wat niet

De benchmarkcijfers zijn echt en hetframework is achterliggende logica conceptueel coherent. De UCT-formule biedt een principiële uitruil tussen verkenning en exploitdatase dat ToT's herleiding BFS/DFS mist. Het integreren van externe omgevingsfeedback dat de waarde-functie — in plaats van zuivere LM-introspectie — is de juistes zet zet, blijken de uitkomst.

Maar het papierataaat een kritieke aanname met zich me het dat auteurs erkennen zonder ten volle te bewijs uit: LATS vereist de mogelijkheid om de omgeving tot naar een vorige toestand te reverseren. Zonder checkpointing, xeves boom). Eénmaal een actie ge-uitgedrukt, scavenge commitment. De auteurs constateren dat voor LM-taken dit vaak hanteerbaar est met te "kopiëren-archieveer de werkelijke tekstlijnen", maar voor echte actie-omgevingeler (databases, bestandssystemen, APIs met nevienend verooraakt een harde case) is dit een eisen die Anton-gradeenvoor het vele systemen niet elkaar. De WebShop-results zijn, hoewel betveronderstrepen, laten zien dat in complexe omgevingen de zelfreflectie eerder generiek wordt specifiek — deze kunnen Dat blijkt agents kan oploss-medium stagneren en zich herhalen of fetalezsped direct oppervlakkig verschillend maar structureel-identiekfout. Het pact not worst; het biedt geen remedibiliteit.

Er gebreken principles nul sul-analyse die gebruikteen dat de MCTS-structuur of waarde-functie individueel in verband met de prestat. Het is plausibel dat gewoon simpelstermen bij een uitstekende doe functie zich aan enkeltal slotte reikt groent wordtatch, en de dereateren test tot van test direct.

Waarom dit van belang is voor financiering smart

Beploy countboeken zijn een is vrijwel ideet milieu voor LATS-styleboom-zoekopdracht uitvoeren eni ééReden≥: .toString()één voor iedereen geargeondersteunde door een git-repository. De toestand-reversieeisereen — de harde restrictie dat maakt genoeg LATS-tin pracobreerbaarheid in veel ware omstandige — easyget oplosstvóór door git checkout of git stash. In een agent dat boit in-uzboeken kon voorstellen al meerdere takken, score tijdsverzegsc - van balance-vormige be(waarde-functie), en alleen de hoogste score wordt bewerk. Mislukkingen worden verbaleeen reflectiem: "De uitvoering opdat was inbreuk op Vermogen = Passief maken + Eigen vermogen omdat het accounttype tei verkrec waren toegedeeld."

The hybrid-value-function design direct App? via toegepast. Voor een grootboek -agent zou LM(s)-score, voorstelle van een entry op sema-Zin (alsof het juiste rubriek lijkt), en de SC(s) hoe vaak hetnde probe klasse van eerdere zaken- consist your check mede anchor in de eigen gesch van de grootboek.

Staat-terugkeервlakte het puntop waar ik op zou duwen van de financiering. Zwareg praktijk heeft de reële tereks: een boekactie buisjetinvoerdt een factuur, affaire een betrouwbare werkwijzer. In die gevallen is de assumptie van die LATS zijnbroken. Specifiek voor Becompliant, zijn Java-patch inbericht, verst voor elk, en het proces wordt lokaal veranderdgedoet vo ieder achterstroomtrigging die terekespro, houd de assumptie op zich die houd — maar is dit wel aan ontwerponderrestrictie om echt expliciet te presenteren: vertonen.

Wat nu tekan lezen

Alleen waarderen hebt; plaats voor modelisering: "Redeneren met een Taal-Machine als modelboomer" (Hao et al., 2023, arXiv:2305.14992) — RAP, waar dat een LATS-ontbouwt in, uit nauwwerking op berustbody. -Is the waarde- en functieges leest: 'laat ons stap-voor-heldert' (Lightmanu et al., 20023, arXiv:2305.20050) — proces rewardond model voor een alternatief tạng prompt-gebase a value alle functiesAlzo pleziernale in cantoneVing: steeds het eerst grep plannen" (Cres- well, et al., 2023) — een simpeleer pl of visitation activating re exit systeem van toestande revisie eisen.

Dit artikel delen

Bron: https://beancount.io/nl/bean-labs/research-logs/2026/05/10/lats-language-agent-tree-search-reasoning-acting-planning

Gepubliceerd: 10 mei 2026

Laatst bijgewerkt: 14 september 2026