Salta al contenuto principale

TheAgentCompany: Benchmark degli Agenti LLM su Compiti Aziendali Reali

6 minuti di letturaMike ThriftMike Thrift
TheAgentCompany: Benchmark degli Agenti LLM su Compiti Aziendali Reali

TheAgentCompany è il benchmark per agenti aziendali più realistico che abbia letto finora in questa serie. Proviene dal gruppo di Graham Neubig alla CMU ed è stato presentato a NeurIPS 2024, motivato da una chiara lacuna: i benchmark esistenti testano la navigazione web isolata o la risoluzione di problemi su GitHub, ma i compiti lavorativi reali richiedono agli agenti di navigare piattaforme interne, scrivere messaggi ai colleghi, scrivere codice ed eseguire programmi all'interno di un singolo compito. Lo sto leggendo ora perché è l'esperimento controllato più vicino che abbiamo per capire se gli agenti LLM possano effettivamente funzionare come colleghi digitali in un ambiente rilevante.

L'articolo

Xu et al. costruiscono un'azienda simulata autonoma: una postazione di lavoro locale più una intranet che esegue istanze reali di GitLab, OwnCloud, Plane (project management) e RocketChat (messaggistica di team). L'ambiente include anche colleghi simulati—NPC basati su LLM—così che gli agenti possano inviare messaggi e ricevere assistenza durante il compito. I compiti coprono sette categorie di ruoli: ingegneria dello sviluppo software (SDE), project management, HR, data science, finanza, amministrazione e una categoria "altro" generica. Il totale è di 175 compiti, curati da 20 studenti di informatica e ingegneri del software per circa 3.000 ore-persona nell'arco di due mesi.

La valutazione utilizza un sistema di checkpoint: ogni compito ha tappe intermedie che valgono una frazione del punteggio totale, più un bonus per il completamento completo. I valutatori sono deterministici (controllo del contenuto dei file, output del codice, stato dell'ambiente) o basati su LLM (valutazione di testo libero). Tutti i modelli vengono eseguiti con il framework agente OpenHands, che fornisce esecuzione di codice, navigazione web e accesso al terminale da un'unica configurabile interfaccia.

Idee chiave

  • Gemini-2.5-Pro è in testa con il 30,3% di completamento completo e 39,3% di punteggio parziale; Claude-3.7-Sonnet segue con il 26,3% / 36,4%; GPT-4o raggiunge solo l'8,6% / 16,7%; Llama-3.1-405B gestisce il 7,4%.
  • Il modello migliore impiega in media circa 27 passi agente e costa oltre $4 per compito—anche per compiti che gli autori descrivono come più semplici della complessità lavorativa reale.
  • I compiti finanziari sono tra le categorie più difficili, insieme a quelli amministrativi e di data science; i compiti SDE sono affidabilmente i più facili nonostante richiedano conoscenze tecniche più specializzate.
  • Dominano tre modalità di fallimento: navigare interfacce web complesse (specialmente la suite per ufficio di OwnCloud), non riuscire a utilizzare produttivamente i messaggi dei colleghi ("mancanza di abilità sociali") e abbandonare compiti amministrativi multi-documento che richiedono un noioso confronto incrociato.
  • Gli autori attribuiscono il vantaggio SDE direttamente a un bias nei dati di addestramento: il pre-addestramento degli LLM è fortemente sbilanciato verso il codice e i dati di GitHub a causa di benchmark prominenti e abbondante segnale di addestramento pubblico, quindi i modelli generalizzano molto meglio ai compiti software che ai flussi di lavoro HR o finanziari.

Cosa regge — e cosa no

Il design dell'ambiente è genuinamente impressionante. Eseguire GitLab, OwnCloud e RocketChat reali invece di stub simulati significa che gli agenti affrontano una complessità UI autentica—popup reali, flussi di autenticazione e casi limite. Il punteggio parziale basato su checkpoint è anche la scelta giusta: successo/fallimento binario renderebbe la maggior parte dei compiti uniformemente senza speranza, oscurando dove gli agenti fanno effettivamente progressi.

Detto questo, diverse debolezze meritano di essere segnalate. La più critica è che non esiste una baseline di performance umana. Gli autori lo riconoscono—vincoli di risorse hanno impedito la raccolta di tempi o tassi di successo umani—il che significa che non abbiamo un denominatore. Il 30% di completamento degli agenti sembra scarso, ma senza sapere se un umano impiegherebbe 20 minuti o 3 ore sullo stesso compito, o se alcuni compiti siano genuinamente ambigui, il numero è difficile da contestualizzare.

La categoria finanza ha solo 12 compiti. È troppo pochi per trarre conclusioni robuste sui fallimenti specifici della finanza. Gli agenti sono peggiori nella finanza a causa di qualche proprietà del ragionamento finanziario, o perché i compiti finanziari coinvolgono più navigazione di documenti OwnCloud? L'articolo non può distinguere a questa scala, e gli autori non ci provano.

Gli autori riconoscono anche che i compiti "sono generalmente dal lato più semplice a causa della necessità di valutare automaticamente con programmi e casi di test." I compiti contabili o finanziari reali più difficili—preparare una riconciliazione di fine anno da dati di origine incoerenti, segnalare problemi di conformità normativa, produrre un report direzionale su più periodi contabili—sono essenzialmente impossibili da valutare automaticamente. Il benchmark probabilmente sottocampiona esattamente i compiti che sarebbero più importanti per agenti finanziari autonomi.

Perché questo è importante per l'AI finanziaria

I risultati qui sono utili in modo sobrio. Un tasso di completamento del 30% su compiti che gli autori definiscono semplificati significa che gli agenti autonomi sono ben lontani dall'essere operativi per flussi di lavoro contabili reali. La categoria finanza è specificamente debole, e le modalità di fallimento dominanti—UI complesse, recupero multi-documento, interruzioni della comunicazione con controparti umane—sono precisamente le competenze di cui un agente di automazione di Beancount avrebbe bisogno: estrarre dati dall'archivio documenti, incrociare transazioni tra report e porre domande chiarificatrici prima di impegnare scritture.

Il costo di $4 per compito per il modello migliore è un fattore forzante. A quel ritmo, eseguire un agente su una chiusura mensile di routine che coinvolge dozzine di sotto-compiti costerebbe centinaia di dollari senza garanzia di affidabilità. Lo schema di Gemini-2.0-Flash di interrompere presto le perdite—raggiungendo un punteggio parziale del 19,0% a meno di $1 per compito—suggerisce che c'è un reale valore ingegneristico nel sapere quando fermarsi e escalare piuttosto che bruciare token su una traiettoria fallimentare.

Gli NPC colleghi simulati sono un interessante primitivo di design che si mappa direttamente sul vincolo reale di Beancount: gli agenti che ignorano il feedback dell'utente e procedono con presupposti sbagliati sono più pericolosi degli agenti che si fermano e chiedono. La scoperta del benchmark che i modelli attuali non riescono a estrarre informazioni utili dai messaggi dei colleghi dovrebbe essere un input di design diretto per qualsiasi agente di scrittura che interagisce con un contabile umano durante la sessione.

Cosa leggere dopo

  • OpenHands: An Open Platform for AI Software Developers as Generalist Agents — il framework agente alla base di TheAgentCompany; arXiv:2407.16741, ICLR 2025. Comprendere l'architettura CodeAct + navigazione di OpenHands chiarisce quali capacità dell'agente sono di base rispetto a ciò che TheAgentCompany sta effettivamente testando.
  • DocFinQA: A Long-Context Financial Reasoning Dataset — estende 7.437 domande FinQA a interi documenti SEC che in media 123.000 parole; arXiv:2401.06915, ACL 2024. Testa direttamente il ragionamento finanziario su documenti lunghi che i 12 compiti finanziari di TheAgentCompany non possono campionare adeguatamente.
  • Evaluation and Benchmarking of LLM Agents: A Survey — arXiv:2507.21504. Un'indagine del 2025 sul panorama della valutazione degli agenti che contestualizza TheAgentCompany insieme a WebArena, OSWorld e SWE-bench e traccia come le scelte di progettazione dei benchmark influenzino ciò che possiamo concludere sulle capacità degli agenti.

Condividi questo articolo