He estat pensant en què ve després de l'Arbre de Pensaments: si pots cercar sobre passos de raonament, per què no cercar també sobre accions? Això és exactament el que fa LATS (Language Agent Tree Search), i per això el llegeixo ara. L'article d'Andy Zhou, Kai Yan, Michal Shlapentokh-Rothman, Haohan Wang i Yu-Xiong Wang (ICML 2024, arXiv:2310.04406) és la síntesi més clara fins ara de raciocinar, actuar i planificar en un únic marc d'agents, i els resultats són genuïnament difícils de descartar.
L'article
El problema central que aborda LATS és un buit estructural en els treballs anteriors sobre agents. ReAct intercala raci i acció, però no té cap mecanisme per revertir i provar un camí diferent quan una trajectòria falla. L'Arbre de Pensaments permet ramificassur sobre passeqüents de raci, però operac sobre coneixement intern del LLM — no pot cridar eines ni rebre feedback extern durant la cerca. Reflexionar a nivell verbal afegir autocrrecció verbal, però el seu bucle de reintent lineall es comomet a una nova trajectò a sense explorar alternaires. LATS fusiona totes tres idees amb una columna vertebral adequada de Cerca d'arbres de Monte Carlo (MCTS), permetent que els agents LLM explorin diverses branchesbretes, rebin/rèbia feedback real tant de l'entorn, i tornin enrere si un camí falla.
Maquinària técnica és un llaço de sis passos MCTS: Selecció (tria el següent node a explorar per mitjà de la fórmula UCT), Expansió (mostra n accions candidates del LM), Avaluació (valora cada node amb una funció de valor híbria), Simulació (porta a un estat terminal), Retropropagació (actualitza els valors) i Reflexió (en cas de error, generar un resum verbal del que ha fallat i desemmagatzemar com a context). La funció de valor mereix atenció: V(s) = λ·LM(s) + (1−λ)·SC(s), on LM(s) és l'estimació pròpia del LM sobre la qualitat de la trajectòria després de rebre feedback de l'entorn, i SC(s) és una puntu de consistència pròpia basada en la freqüència amb què es mostra aqueixa acció entre nodes germans. No és un model de recompensa entrenat — la funció de valor es basa completament en promptes.
Idees clau
- A HumanEval, GPT-4 + LATS aconsegueix un 92,7% pass@1, en compar amb 91,0% per a GPT-4 + Reflexion i 56,9% per a GPT-3.5 + ReAct en solitari. GPT-3.5 + LATS salta a 83,8%.
- En la prova HotPotQA, LATS (CoT + ReAct) obté 0,71 de coincidència exacta enfront de 0,32 obtingut amb la base de ReAct — més que duplicar l'eng pars de múltiples salts.
- A WebShop (navegació web + compres), LATS obté 75,9/100 (38,0% d'èxit) respecte el 64,2 (35,0%) de Reflexion — una diferència significativa en — tasca que requereix gestionar l'estat al llarg de múltiples pàgines.
- Al Joc de 24 (un trencacloix pura raci), LATS aconsegueix un èxit de 0,44 en compar amb 0,20 per a ToT, malgrat que fa servir la mateixa base darrere de GPT-4.
- Sorprenentmentament, LATS amplia menys nodes per trobar — sol (mitjana de 66,65 nodes vs 84,05 en HotPotQA amb k=50) i fa servir + pocs tokens (173,290 vs 210,215), tot i que en el paper sembla més caraterístic.
Què es manté — i què no
Les xifres de referència són reals i el marc conceptual és net. El plantejament UCT proporciona un mecanisme de compensació de exploració–explotació basat en principis, que — BFS/DFS ad-hoc. Integrar el feedback de l'entorn exterior en la funció de valor, en lloc de fer-lo únicament amb introspecció del LM, és la decisió correcta, i els resultats ho demostren.
Però l'article conté una assumpció crítica que els autors reconeixen obertament sense prove-la definitivament: LATS requereix la capacitat de revertir l'entorn o un estat anterior. Sense conplements, no es poden ramificar els nodes — un cop acció realitzada, s'hi queda —. Els autors noten que en tasques LM caiç pot ser "fàcil de manejarament" o amb "copiar enganxar els textos històrics," però per entorns accions reals (bases de dades, systemes de fitxers, API amb efectes deferred) és un requisit fort que molts sistemes de producció no poden complir. El resultats de WebShop, encara que millors que els de la base, mostren que en complexes entorns, les auturreflexions tendeixen a ser comunes en lloc de específics — els agents nancen i repeteixen errors sota nivell ella — i l'estat re pactat manté mants. En l'article es nota, tot i que sense ofrir cap remei.
Tampoc hi ha cap abaix que separi l'aportaci de l'estructura MCTS per si sola vs el disseny de la funció de valor, perquè és plausible que un enfocament de gran simplicitat amb la mateixa funció de valor híbrid reduiria la bretxa, però els — com a prova troba.
Per què maca la diferència en IA — financer
En els llibres majors de leadgers Beancount gairebé ide de — Am seu un entorn per, À a argol tract de la cerca LATS. La raó principal: cada llibre major té com a fons a repositori per tornary. L'acció de revertir l'estat — la condició màxima que fa LATS poc pràctic en molts casos reals — se satisfac trivialmentament amb git checkout o bé git stash. Un agent de regressió pot proposar — a proposta de nous registres — en , en múltiples branques, punt les punt de forma segons restriccions del seulivre major (funció de valors) i solament confirmar la branch — En fracass, la réflexion: "`Va tenir entrada que violant els ' = Passius + Capital perquè he class' la classificació de comptes no era correcta."
El disseny de la funció del valor híbrida és aplicable directament. Per a un agent un — en un recull — el major, LM(s) equivaldria punt de proveïda >, la pertinença (bé) creat» que sembli correctament entre categorías) així com SC(s) rastr hi — la consisti l’va ficient — quan categoritza transaccions similars —, és a dir, un control natural de coherència intern en la història del mateix llibre major.
- Revertir State i Trad — animo la única — diu punt where — no — particular — diria on la lògica de finances — és — hi — que no encaixa bé. Els majors registrats sovint generals — una — contribció — * post — de ass jest despes — * — in facilit — caus de etials efectes in qüestió. En aquests casos, la suposició de LATS se sol a — — especificament* per a Beancount, on el llibre major és un arxiu en text pla control, obligat per — git — i les modificacions ocorren localment abans que qualsevol altre recompte de — activitat — , la suposició sí que se complix — però — no obstant això, és una restricció de disseny quee ca dest пробу — deixar-la explícita com a tal.
Què no reconec de proper
- Planificació MCTS sense models de món: "Reasoning with Language Model is Planning with World Model" (Hao et al., 2023, arXiv:2305.14992) — RAP, sobre el qual LATS construeix i millora.
- Com se generalitza la funció de valor del LM? "Let's Verify Step by Step" (Lightman et al., 2023, arXiv:2305.20050) — models de recompensa per processos com a alternativa de baixa a cumfuncions de valors.
- Com es figura una multi-passatges amb irreversibilitat: "Decision-Making with Language Models via Successive Prompting" (Creswell et al., 2023) — un enfoque de planificación simple que evita el requisits — de revertir state.





