Salta al contenuto principale

Albero dei Pensieri: Risoluzione Deliberata di Problemi con Ricerca LLM

7 minuti di letturaMike ThriftMike Thrift
Albero dei Pensieri: Risoluzione Deliberata di Problemi con Ricerca LLM

Dopo aver dedicato gli ultimi due articoli ad agenti che si auto-correggono tramite riflessione (Reflexion) e critica interattiva con strumenti (CRITIC), ho voluto fare un passo indietro e osservare un approccio più strutturale: cosa succederebbe se l'agente non si impegnasse mai in un unico percorso di ragionamento fin dall'inizio? L'Albero dei Pensieri (ToT) di Yao et al. (NeurIPS 2023) propone esattamente questo — un framework di ricerca in cui l'LLM esplora uno spazio ramificato di passaggi intermedi di ragionamento anziché una singola catena lineare. L'ho letto ora perché rappresenta la formulazione più chiara di ricerca deliberata per il ragionamento LLM, e la ricerca deliberata è ciò di cui hai bisogno quando un singolo passaggio intermedio errato in un calcolo finanziario può corrompere silenziosamente tutto ciò che segue.

L'articolo

Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran, Thomas L. Griffiths, Yuan Cao e Karthik Narasimhan introducono l'Albero dei Pensieri come una generalizzazione del prompting a catena di pensiero. La mossa chiave è trattare i passaggi intermedi di ragionamento come "pensieri" — unità testuali coerenti che possono essere valutate indipendentemente — e organizzarli in un albero anziché in una catena. In ogni nodo, il modello genera molteplici pensieri candidati, valuta ciascuno di essi (tramite una chiamata LLM separata che assegna punteggi agli stati come "certo / forse / impossibile"), e poi applica un algoritmo di ricerca standard (BFS o DFS) per attraversare l'albero. Se un ramo sembra senza uscita, il modello può potarlo o tornare indietro (backtrack) — cosa che né CoT né CoT-SC possono fare.

L'articolo valuta su tre compiti: Gioco del 24 (combinare quattro numeri per ottenere 24 usando l'aritmetica), Scrittura Creativa (produrre un brano coerente usando quattro finali di frase casuali) e Mini Cruciverba (risolvere un cruciverba 5×5). Tutti e tre richiedono un ragionamento che può beneficiare di esplorazione e backtracking, che è esattamente l'ambito per cui gli autori hanno progettato.

Idee chiave

  • Sul Gioco del 24, ToT con beam width b=5 raggiunge un successo del 74%, contro il 4% per GPT-4 con CoT standard e il 9% per CoT-SC con 100 campioni. Questo divario è notevole.
  • GPT-3.5 + ToT raggiunge solo il 19% sullo stesso compito; il beneficio del metodo dipende fortemente dal modello. La qualità di generazione dei pensieri di GPT-4 è ciò che guida la maggior parte del guadagno — GPT-4 generazione + GPT-3.5 valutazione raggiunge il 64%, mentre GPT-3.5 generazione + GPT-4 valutazione raggiunge solo il 31%.
  • Per la Scrittura Creativa, ToT ottiene un punteggio di 7,56 rispetto al 6,93 di CoT su una scala di coerenza GPT-4, e gli annotatori umani preferiscono gli output di ToT 41/100 volte contro 21/100 per CoT.
  • Mini Cruciverba: ToT raggiunge una precisione a livello di parole del 60% (CoT: 40,6%, IO: 15,6%) ma risolve solo 4 partite su 20 complete (20%). Il divario tra successo a livello di parola e di partita rivela che, anche con il backtracking, la soddisfazione di vincoli globali rimane difficile.
  • Il passo di valutazione è esso stesso una chiamata LLM. Sui cruciverba, l'articolo nota che i valutatori a volte giudicano stati parziali corretti come "impossibili" a causa di vocabolario sconosciuto — una modalità di fallimento composto in cui gli errori del valutatore avvelenano la ricerca.
  • Costo di calcolo: ToT costa circa $0,74 per caso sul Gioco del 24 contro $0,47 per best-of-100 CoT. Gli autori stessi segnalano che per compiti che GPT-4 già gestisce bene, il sovraccarico non vale la pena.

Cosa regge — e cosa no

Il risultato principale — che la ricerca ad albero su pensieri intermedi supera massicciamente il CoT sequenziale in compiti che richiedono backtracking — è reale e riproducibile. Il divario del 74% vs 4% sul Gioco del 24 non è rumore. La spiegazione è meccanicamente solida: una singola equazione intermedia errata in CoT fa precipitare il resto della catena, mentre ToT può potare quel ramo e provare una diversa scomposizione.

Quello che trovo meno convincente è l'affermazione di generalizzabilità. Tutti e tre i compiti di valutazione sono relativamente sintetici: un puzzle matematico, un prompt di scrittura creativa con vincoli strutturali e un gioco di parole. Nessuno di essi assomiglia ai problemi aperti e ambigui che appaiono nei flussi di lavoro finanziari di produzione. Gli autori valutano anche solo su GPT-4 (e GPT-3.5 come ablazione), quindi non sappiamo come si comporti ToT con modelli più piccoli o fine-tuned — e la cifra del 19% per GPT-3.5 suggerisce che la risposta è "non bene".

Il fallimento a livello di partita del cruciverba (20% nonostante una precisione di parola del 60%) indica un problema più profondo: ToT è una ricerca locale guidata da un valutatore locale. Non mantiene un modello di vincolo globale, che è esattamente ciò di cui hai bisogno per problemi in cui le interazioni tra sotto-soluzioni sono dense. L'articolo successivo sul Grafo dei Pensieri (Besta et al., AAAI 2024) rende questa critica esplicita e dimostra un miglioramento di qualità del 62% rispetto a ToT in compiti di ordinamento, riducendo al contempo il costo di oltre il 31% — permettendo ai pensieri di fondersi e formare cicli anziché essere confinati in un albero.

Infine, la struttura dei costi è importante in pratica. Con b=5 e chiamate ripetute del valutatore, ToT è circa 15–20× più costoso in chiamate API rispetto a un singolo passaggio CoT. Per applicazioni sensibili alla latenza o ai costi, questo non è banalmente accettabile.

Perché questo è importante per la finanza AI

La risposta onesta è: ToT è più importante per una nicchia ristretta dello spazio problematico di Beancount, ma quella nicchia è reale.

Il compito finanziario canonico in cui voglio il backtracking è la classificazione multi-stadio dei conti con transazioni ambigue. Quando un LLM sta mappando un estratto conto bancario importato a un piano dei conti, una singola assegnazione errata all'inizio della catena (ad esempio, trattare un erogazione di prestito come reddito) può propagarsi in un controllo di bilancio fallito diversi passi dopo. In un agente CoT, quando il bilancio fallisce, il modello non ha meccanismi per rivisitare la classificazione originale. Un agente ToT potrebbe tornare indietro a quel nodo e provare Passività:Prestiti invece.

Allo stesso modo, l'ottimizzazione fiscale su un intero anno fiscale è un genuino problema di ricerca ad albero: dettagliare vs. prendere la deduzione standard, tempizzare le plusvalenze, raggruppare i contributi di beneficenza. Queste decisioni interagiscono in modo non lineare, e devi valutare molteplici rami prima di impegnarti. Il framework BFS/DFS di ToT si adatta naturalmente a questa struttura.

Ciò in cui ToT non aiuta è il caso dominante in Beancount: inserimento e riconciliazione di transazioni di routine. Per una transazione che ha una controparte chiara nel registro, CoT + PAL (scaricare l'aritmetica su un interprete di codice) è più veloce, più economico e già abbastanza accurato. Portare ToT sulla classificazione di spese:alimentari è usare un martello pneumatico per uno spillo.

La preoccupazione più pressante per la sicurezza di riscrittura è il problema dell'affidabilità del valutatore. Se anche il valutatore di stato è un LLM, può sbagliarsi — e valutazioni errate non solo rallentano la ricerca, ma potano percorsi corretti. Qualsiasi agente finanziario in produzione che usi ToT avrebbe bisogno di un oracolo esterno (un controllo di bilancio, un validatore di schema, un motore di regole) come valutatore, non un'altra chiamata LLM.

Cosa leggere dopo

  • Graph of Thoughts: Solving Elaborate Problems with Large Language Models (Besta et al., AAAI 2024) — arXiv:2308.09687. Estende ToT da alberi a grafi arbitrari, consentendo la fusione di pensieri e cicli di feedback. L'affermazione di riduzione dei costi (>31%) è direttamente rilevante se vuoi un ragionamento basato su ricerca senza il sovraccarico di ToT.
  • Large Language Models Cannot Self-Correct Reasoning Yet (Huang et al., ICLR 2024) — arXiv:2310.01798. Un contrappunto critico: senza feedback esterno, l'auto-correzione intrinseca degrada le prestazioni di ragionamento. Questo sfida l'assunzione che il valutatore basato su LLM di ToT sia abbastanza affidabile da guidare la ricerca.
  • RethinkMCTS: Refining Erroneous Thoughts in Monte Carlo Tree Search for Code Generation (arXiv:2409.09584) — applica MCTS invece di BFS/DFS alla ricerca di pensieri, con feedback di esecuzione come oracolo esterno. L'ambito di generazione di codice è strutturalmente simile al write-back contabile: hai una verità di base verificabile (il codice funziona? Il controllo di bilancio passa?), che è esattamente dove i rollout Monte Carlo aggiungono valore.

Condividi questo articolo