
TheAgentCompany: Бенчмаркінг агентів LLM на реальних корпоративних завданнях
TheAgentCompany оцінює 175 корпоративних завдань у симульованій інтрамережі, і найкраща модель, Gemini-2.5-Pro, виконує лише 30% за $4 кожне.
#enterprise-software
Автоматизація корпоративного ПЗ, веб-агенти та дослідження інтелектуальної праці

TheAgentCompany оцінює 175 корпоративних завдань у симульованій інтрамережі, і найкраща модель, Gemini-2.5-Pro, виконує лише 30% за $4 кожне.

GPT-4o розв'язує 2.1% з 682 композиційних корпоративних задач WorkArena++; люди — 93.9%, що показує, чому агенти застрягають на бухгалтерській роботі з неявними цілями.

33 завдання WorkArena у ServiceNow показують GPT-4o на рівні 42,7% загалом, але 0% на фільтрах списків — стіна, яку має подолати структурована взаємодія з UI.