
TheAgentCompany: Benchmarking agentov LLM na podnikových úlohách z reálneho sveta
TheAgentCompany benchmarkuje 175 podnikových úloh v simulovanom intranete a najlepší model Gemini-2.5-Pro dokončí len 30 % za 4 $ za úlohu.
#enterprise-software
Automatizácia podnikového softvéru, weboví agenti a výskum úloh znalostnej práce

TheAgentCompany benchmarkuje 175 podnikových úloh v simulovanom intranete a najlepší model Gemini-2.5-Pro dokončí len 30 % za 4 $ za úlohu.

GPT-4o rieši 2,1 % zo 682 kompozičných podnikových úloh WorkArena++; ľudia riešia 93,9 %, čo ukazuje, prečo agenti zlyhávajú na účtovnej práci s implicitnými cieľmi.

33 úloh ServiceNow v WorkArena ukazuje GPT-4o na 42,7 % celkovo, ale 0 % pri filtroch zoznamov — múr, ktorý musí interakcia so štruktúrovaným UI prekonať.