Salta al contenuto principale

Registro di ricerca Bean Labs

AgentBench: valutare gli LLM come agenti — lezioni per l'affidabilità dell'AI finanziaria

Pubblicato Ultimo aggiornamento 6 minuti di letturaMike ThriftMike Thrift
AgentBench: valutare gli LLM come agenti — lezioni per l'affidabilità dell'AI finanziaria

Articolo: https://arxiv.org/abs/2308.03688

In questa pagina

Quando mi chiedo cosa deve fare realmente un agente di scrittura beancount in modo affidabile, la risposta non è "generare testo" — è "eseguire una sequenza di azioni in un ambiente strutturato senza uscire dai binari." AgentBench (Liu et al., Tsinghua, ICLR 2024) è uno dei primi seri tentativi di misurare quella capacità su larga scala, e l'istantanea del 2023 contiene ancora lezioni che vale la pena estrarre.

L'articolo​

AgentBench, di Xiao Liu e 21 coautori dell'Università Tsinghua, definisce otto ambienti progettati per mettere alla prova gli LLM come agenti interattivi piuttosto che come generatori di testo passivi. Cinque ambienti sono originali: OS (interazione con bash), Database (generazione di SQL e recupero da errori), Grafo di Conoscenza (query strutturate basate su strumenti), Gioco di Carte Digitale (competizione strategica su più turni) e Puzzle di Pensiero Laterale (dialogo deduttivo). Tre sono adattati da dataset precedenti: House-Holding da ALFWorld, Web Shopping da WebShop e Web Browsing da Mind2Web. L'articolo valuta 27 modelli — modelli API commerciali e modelli open-source fino a 70B — su circa 4.000 generazioni della suddivisione di sviluppo e 13.000 della suddivisione di test, e riporta sia i tassi di successo per ambiente sia un punteggio complessivo composito.

Idee chiave​

  • GPT-4 è in testa con un punteggio complessivo di 4,01. Claude-2 ottiene 2,49, GPT-3.5-turbo 2,32. CodeLlama-34B, il modello open-source più forte al momento della sottomissione, ottiene solo 0,96. I modelli API raggiungono in media 2,24 contro 0,42 per i modelli open-source.
  • GPT-4 ottiene il 42,4% su OS, il 32,0% su Database e il 78,0% su House-Holding — la diffusione mostra quali ambienti premiano il seguire le istruzioni rispetto al ragionamento strutturato.
  • "Limite di Attività Superato" è la modalità di errore dominante: il 67,9% degli errori del Grafo di Conoscenza raggiunge il limite di passi prima di risolvere l'attività. Si tratta di un fallimento di ragionamento a lungo orizzonte, non di una carenza di conoscenza.
  • Gli errori di conformità al formato rappresentano il 53,3% degli errori del Database — l'agente produce SQL sintatticamente non valido, oppure avvolge le query in prosa che il valutatore non riesce a interpretare.
  • La selezione di azioni non validi guida il 64,1% dei fallimenti di House-Holding — l'agente nomina un'azione non disponibile nello stato corrente.
  • L'addestramento sul codice ha "effetti contraddittori tra le attività": aiuta gli ambienti che richiedono di seguire procedure ma può danneggiare il ragionamento generale in quelli incentrati sul dialogo.

Cosa regge — e cosa no​

La scelta progettuale centrale — valutazione interattiva, multi-turno e multi-ambiente — è giusta e ancora poco utilizzata. La maggior parte dei benchmark per LLM misura ancora la qualità della generazione a turno singolo; AgentBench insiste correttamente sul fatto che gli agenti devono continuare a prendere decisioni finché un'attività non è completata o il budget non è esaurito.

Detto questo, l'istantanea è datata in modi che contano. Il divario tra GPT-4 (4,01) e il miglior modello open-source (0,96) sembrava allarmante a metà 2023, ma entro il 2025 si è in gran parte colmato. Modelli come Llama 3.1 70B o Qwen 2.5 72B superano ora ostacoli di conformità al formato e di seguire le istruzioni che due anni fa erano sfide nuove. Leggere l'articolo come "l'open-source non può fare compiti da agente" sarebbe un errore; leggerlo come "la conformità al formato e la coerenza a lungo orizzonte sono i problemi difficili" resta corretto.

C'è anche un compromesso tra ampiezza e profondità. Otto ambienti sembrano completi, ma ciascuno è relativamente superficiale. WebArena (Zhou et al., 2024) copre 812 attività modellate a lungo orizzonte per la sola navigazione web; OSWorld (Xie et al., 2024) confronta 369 attività desktop reali su Ubuntu e Windows. AgentBench può offrire un segnale cross-ambiente, ma non sostituisce un benchmark specifico del dominio una volta che sai quale ambiente ti interessa.

La tassonomia delle modalità di errore nella Tabella 4 è probabilmente il contributo più duraturo. Gli autori suddividono i fallimenti in limite di attività superato, errore di formato, azione non valida e alcuni altri. Questi non sono bug di implementazione — sono debolezze strutturali nel modo in cui gli LLM mantengono lo stato, tracciano le azioni disponibili e producono output interpretabile sotto pressione multi-turno. Qualsiasi sistema agente serio deve affrontarli.

Perché questo è importante per l'AI finanziaria​

Le tre modalità di errore dominanti si traducono quasi direttamente in ciò che mi aspetto potrebbe rompere un agente di scrittura beancount.

Limite di Attività Superato è la modalità di errore della riconciliazione del registro. Chiudere un periodo su più conti significa controllare i saldi iniziali, abbinare dare e avere, identificare discrepanze e proporre correzioni — una catena che facilmente arriva a 10–20 passi. Un agente che raggiunge un limite di contesto o di passi a metà catena e si arrende non fallisce solo in modo elegante; può lasciare il registro in uno stato parzialmente modificato.

Errore di Formato è la modalità di errore dell'inserimento di transazioni. Beancount ha una sintassi rigorosa: una registrazione malformata (valuta mancante, indentazione errata, flag non valido) è un errore del parser che corrompe il file. Un agente che genera prosa attorno alla sua output Beancount, o produce una sintassi dall'aspetto corretto nel formato sbagliato, è inutile. Questo è il problema centrale del paper CRITIC applicato a un dominio più rigoroso.

Azione Non Valida è il problema di sicurezza della scrittura. Un agente Beancount che opera su un registro reale ha un insieme limitato di operazioni sicure: aggiungere una transazione, correggere un flag, spostare una registrazione. Allucinare un'azione al di fuori di quell'insieme — ad esempio eliminare un conto che ha ancora posizioni aperte — è un fallimento di correttezza che potrebbe non emergere fino a un audit.

La scoperta che "l'addestramento sul codice ha effetti contraddittori" è anche rilevante. La scrittura beancount è più vicina alla generazione di codice che al recupero di conoscenza, quindi un modello pre-addestrato sul codice dovrebbe essere una scelta naturale. Ma se l'addestramento sul codice danneggia il seguire il dialogo in contesti multi-turno, è necessaria una valutazione ibrida come quella di AgentBench per far emergere questi compromessi prima dell'implementazione.

Cosa leggere dopo​

  • WebArena (Zhou et al., 2024; arXiv:2307.13854) — 812 attività di navigazione web in un ambiente browser dal vivo; il seguito più approfondito del livello web di AgentBench.
  • OSWorld (Xie et al., 2024; NeurIPS 2024) — benchmark completo dell'ambiente desktop che include attività su filesystem e GUI; l'ambiente OS di OSWorld è un successore diretto e più approfondito del livello OS di AgentBench.
  • TAU-bench (Yao et al., 2024) — valuta gli agenti in ambienti API di vendita al dettaglio e compagnie aeree con uso reale di strumenti e simulazione dell'utente; il benchmark pubblicato più vicino a trattare un registro beancount come ambiente.

Condividi questo articolo

Fonte: https://beancount.io/it/bean-labs/research-logs/2026/05/06/agentbench-evaluating-llms-as-agents

Pubblicato: 6 maggio 2026

Ultimo aggiornamento: 14 settembre 2026