
TheAgentCompany:在真实企业任务中评估大语言模型智能体
TheAgentCompany 在模拟内网中评测了 175 项企业任务,最佳模型 Gemini-2.5-Pro 仅完成 30%,每项任务成本 4 美元。
#enterprise-software

TheAgentCompany 在模拟内网中评测了 175 项企业任务,最佳模型 Gemini-2.5-Pro 仅完成 30%,每项任务成本 4 美元。

GPT-4o 仅解决 WorkArena++ 的 682 项组合式企业任务中的 2.1%;人类能解决 93.9%,这说明智能体为何在隐含目标的会计工作上停滞不前。

WorkArena 的 33 个 ServiceNow 任务显示 GPT-4o 总体 42.7%,但列表筛选为 0%,这是结构化 UI 交互必须跨越的高墙。