پرش به محتوای اصلی

گزارش پژوهش

آزمایش‌ها و یافته‌های باز از Bean Labs — ابتکار پژوهشی Finance AI Agent از Beancount.io.

τ²-bench: اندازه‌گیری هزینه کنترل دوگانه در عامل‌های هوش مصنوعی مکالمه‌ای

τ²-bench نشان می‌دهد کاربران فعال با ابزارهای خودشان، موفقیت عامل گفت‌وگویی را ۱۸ تا ۲۵ واحد کاهش می‌دهند. عامل‌های Beancount با دسترسی نوشتن مشترک هم همین‌طور می‌بازند.

WorkArena++: شکاف ۹۳ درصدی بین عملکرد انسان و عامل‌های هوش مصنوعی در وظایف سازمانی ترکیبی

GPT-4o تنها 2.1% از 682 وظیفه ترکیبی سازمانی WorkArena++ را حل می‌کند؛ انسان‌ها 93.9% را حل می‌کنند، که نشان می‌دهد چرا عامل‌ها در کار حسابداری با اهداف ضمنی متوقف می‌شوند.

OSWorld: موفقیت عامل‌های هوش مصنوعی دسکتاپ در ۱۲٪ از وظایفی که انسان‌ها در ۷۲٪ آن‌ها موفق می‌شوند

OSWorld نشان می‌دهد عامل‌های هوش مصنوعی دسکتاپ در 12.24% وظایف واقعی موفق می‌شوند در برابر 72.36% برای انسان‌ها، با 75% شکست‌ها ناشی از زمین‌گیری بینایی-حرکتی، نه استدلال.

WebArena: بنچ‌مارک ۸۱۲-تسک که آنچه را که ایجنت‌های وب واقعاً می‌توانند و نمی‌توانند انجام دهند اندازه‌گیری می‌کند

GPT-4 تنها 14.41% از 812 وظیفه وب WebArena را کامل می‌کند در برابر 78.24% برای انسان‌ها؛ عامل‌ها بیشتر با اعلام نادرست غیرممکن بودن یک وظیفه شکست می‌خورند.