
TheAgentCompany: محکزنی عاملهای LLM در وظایف سازمانی دنیای واقعی
TheAgentCompany 175 وظیفه سازمانی را در یک اینترانت شبیهسازیشده ارزیابی میکند، و بهترین مدل، Gemini-2.5-Pro، تنها 30% را با هزینه 4 دلار هر کدام کامل میکند.
آزمایشها و یافتههای باز از Bean Labs — ابتکار پژوهشی Finance AI Agent از Beancount.io.

TheAgentCompany 175 وظیفه سازمانی را در یک اینترانت شبیهسازیشده ارزیابی میکند، و بهترین مدل، Gemini-2.5-Pro، تنها 30% را با هزینه 4 دلار هر کدام کامل میکند.

τ²-bench نشان میدهد کاربران فعال با ابزارهای خودشان، موفقیت عامل گفتوگویی را ۱۸ تا ۲۵ واحد کاهش میدهند. عاملهای Beancount با دسترسی نوشتن مشترک هم همینطور میبازند.

GPT-4o تنها 2.1% از 682 وظیفه ترکیبی سازمانی WorkArena++ را حل میکند؛ انسانها 93.9% را حل میکنند، که نشان میدهد چرا عاملها در کار حسابداری با اهداف ضمنی متوقف میشوند.

466 وظیفه GAIA نشان میدهد عاملهای AI پیشرو به 74.55% میرسند در برابر 92% برای انسانها، و هماهنگی سطح 3 همچنان سختترین شکاف برای پر کردن است.

OSWorld نشان میدهد عاملهای هوش مصنوعی دسکتاپ در 12.24% وظایف واقعی موفق میشوند در برابر 72.36% برای انسانها، با 75% شکستها ناشی از زمینگیری بینایی-حرکتی، نه استدلال.

GPT-4 تنها 14.41% از 812 وظیفه وب WebArena را کامل میکند در برابر 78.24% برای انسانها؛ عاملها بیشتر با اعلام نادرست غیرممکن بودن یک وظیفه شکست میخورند.

33 وظیفه ServiceNow در WorkArena نشان میدهد GPT-4o در کل 42.7% است اما در فیلترهای فهرست 0%، دیواری که تعامل ساختاریافته با رابط کاربری باید از آن عبور کند.

τ-bench نشان میدهد LLMهای برتر در وظایف ابزاری خردهفروشی از pass@1 0.692 به pass@4 0.462 میافتند. عامل نوشتنی روی دفتر کل هم همین پرتگاه را دارد.

Chain-of-Table به 67.31% در WikiTQ میرسد در برابر 61.48% برای زنجیره تفکر فقط متنی، و با 10.25 واحد در جداول بالای 4,000 توکن پیشتاز است.

TableLlama در حاشیهنویسی نوع ستون GPT-4 را شکست میدهد (F1 ۹۴ در برابر ۳۲) اما در استدلال ترکیبی WikiTQ ۳۳ امتیاز عقب است.

TAPAS به سؤالات جدولی با انتخاب سلولها پاسخ میدهد، هرگز SQL تولید نمیکند. برای پرسوجوهای کوچک دفتر کل Beancount مناسب است اما در مقیاس بزرگ شکست میخورد.

طراحی سهعاملی MAC-SQL به دقت اجرای 59.59% در BIRD میرسد، با Refiner که 4.63+ واحد اضافه میکند — الگویی برای تولید پرسوجوهای دفتر کل Beancount.