
TheAgentCompany : Évaluation des agents LLM sur des tâches d'entreprise en conditions réelles
TheAgentCompany évalue 175 tâches d'entreprise dans un intranet simulé, et le meilleur modèle, Gemini-2.5-Pro, n'en termine que 30 % à 4 $ chacune.
Expériences et résultats ouverts de Bean Labs — l'initiative de recherche Finance AI Agent de Beancount.io.

TheAgentCompany évalue 175 tâches d'entreprise dans un intranet simulé, et le meilleur modèle, Gemini-2.5-Pro, n'en termine que 30 % à 4 $ chacune.

τ²-bench étend l'évaluation des agents aux environnements à double contrôle où l'IA et l'utilisateur invoquent tous deux des outils sur un état partagé — révélant que les utilisateurs actifs réduisent les taux de réussite de 18 à 25 points de pourcentage, avec des implications directes pour les agents Beancount partageant l'accès en écriture avec des utilisateurs humains.

GPT-4o résout 2,1 % des 682 tâches d'entreprise compositionnelles de WorkArena++ ; les humains en résolvent 93,9 %, d'où le blocage sur la comptabilité à objectif implicite.

Les 466 tâches de GAIA montrent les agents IA de pointe à 74,55 % contre 92 % pour les humains, la coordination de niveau 3 restant l'écart le plus dur à combler.

OSWorld constate que les agents de bureau réussissent 12,24 % des tâches réelles contre 72,36 % pour les humains, 75 % des échecs venant de l'ancrage visuomoteur.

GPT-4 ne termine que 14,41 % des 812 tâches web de WebArena contre 78,24 % pour les humains ; les agents échouent surtout en déclarant à tort une tâche impossible.

Les 33 tâches ServiceNow de WorkArena montrent GPT-4o à 42,7 % au global mais 0 % sur les filtres de liste, un mur que l'interaction structurée doit franchir.

τ-bench constate que les meilleurs LLM passent de pass@1 0,692 à pass@4 0,462 sur des tâches d'outils de vente. Les agents écrivant sur un grand livre subissent la même chute.

Chain-of-Table atteint 67,31 % sur WikiTQ contre 61,48 % pour la chaîne de pensée textuelle, et devance de 10,25 points sur les tables de plus de 4 000 tokens.

TableLlama surpasse GPT-4 en annotation de type de colonne (F1 94 vs 32) mais accuse 33 points de retard en raisonnement compositionnel sur WikiTQ.

TAPAS répond aux questions sur tables en sélectionnant des cellules, sans jamais générer de SQL. Il convient aux petites requêtes Beancount mais cale à grande échelle.

MAC-SQL, à trois agents, atteint 59,59 % de précision d'exécution sur BIRD, le Refiner ajoutant +4,63 points : un modèle pour générer des requêtes Beancount.