
TheAgentCompany: Бенчмаркинг LLM-агентов на реальных корпоративных задачах
TheAgentCompany тестирует 175 корпоративных задач в смоделированном интранете, и лучшая модель Gemini-2.5-Pro выполняет лишь 30% по $4 за каждую.
#enterprise-software
Автоматизация корпоративного ПО, веб-агенты и исследования интеллектуального труда

TheAgentCompany тестирует 175 корпоративных задач в смоделированном интранете, и лучшая модель Gemini-2.5-Pro выполняет лишь 30% по $4 за каждую.

GPT-4o решает 2,1% из 682 композиционных корпоративных задач WorkArena++, а люди решают 93,9%, показывая, почему агенты буксуют на бухгалтерской работе с неявными целями.

33 задачи ServiceNow в WorkArena показывают GPT-4o на уровне 42.7% в целом, но 0% на фильтрах списков — стена, которую должно преодолеть структурированное взаимодействие с UI.