
TheAgentCompany: 실제 기업 업무에서의 LLM 에이전트 벤치마킹
TheAgentCompany는 시뮬레이션 인트라넷에서 175개 기업 작업을 벤치마크하며, 최고 모델 Gemini-2.5-Pro는 건당 $4로 30%만 완료합니다.
#enterprise-software
엔터프라이즈 소프트웨어 자동화, 웹 에이전트 및 지식 업무 과제 연구

TheAgentCompany는 시뮬레이션 인트라넷에서 175개 기업 작업을 벤치마크하며, 최고 모델 Gemini-2.5-Pro는 건당 $4로 30%만 완료합니다.

GPT-4o는 WorkArena++의 682개 구성형 기업 작업 중 2.1%만 해결하고 인간은 93.9%를 해결해, 암묵적 목표 회계 작업에서 에이전트가 멈추는 이유를 보여줍니다.

WorkArena의 33개 ServiceNow 작업에서 GPT-4o는 전체 42.7%지만 목록 필터에서는 0%로, 구조화된 UI 상호작용이 넘어야 할 벽을 보여줍니다.