#enterprise-software
Enterprise Software
Enterprise software automation, web agents, and knowledge work task research
TheAgentCompany: Benchmark degli Agenti LLM su Compiti Aziendali Reali
TheAgentCompany testa 175 compiti lavorativi reali attraverso una intranet simulata con GitLab, OwnCloud e RocketChat. Il miglior modello (Gemini-2.5-Pro) completa solo il 30% dei compiti a $4 ciascuno, rivelando che gli agenti autonomi sono ancora ben lontani dall'essere utilizzabili per i flussi di lavoro di contabilità e finanza.
WorkArena++: Il divario del 93% tra le prestazioni umane e quelle degli agenti AI in compiti enterprise composizionali
WorkArena++ (NeurIPS 2024) confronta 682 compiti enterprise composizionali su tre livelli di difficoltà. GPT-4o ne risolve il 2,1% mentre gli umani risolvono il 93,9%, isolando esattamente il motivo per cui gli attuali agenti AI falliscono nel lavoro cognitivo a obiettivo implicito e perché questo divario è importante per l'automazione contabile autonoma.
WorkArena: Come gli Agenti Web LLM si Comportano nel Lavoro Reale della Conoscenza Aziendale
WorkArena valuta gli agenti web LLM su 33 compiti reali di ServiceNow — GPT-4o raggiunge il 42,7% complessivo ma lo 0% nei compiti di filtro elenchi, esponendo un muro invalicabile tra la compilazione di moduli e l'interazione UI strutturata che si riflette direttamente sulle sfide dell'automazione dei registri Beancount.