پرش به محتوای اصلی

وبلاگ پژوهش Bean Labs

AgentBench: ارزیابی LLMها بهعنوان عاملها — درسهایی برای پایایی هوش مصنوعی مالی

منتشر شده آخرین بهروزرسانی زمان مطالعه 5 دقیقهMike ThriftMike Thrift
AgentBench: ارزیابی LLMها بهعنوان عاملها — درسهایی برای پایایی هوش مصنوعی مالی

مقاله: https://arxiv.org/abs/2308.03688

فهرست مطالب این صفحه

وقتی میپرسم که یک عامل نوشتن-بازگشت Beancount واقعاً برای اطمینان نیاز دارد چه کند، جواب «تولید متن» نیست — بلکه «اجرای دنبالهای از کنشها در یک محیط ساختارمند بدون انحراف از مسیر» است. AgentBench (Liu و همکاران، Tsinghua، ICLR 2024) یکی از اولین تلاشهای جدی برای اندازهگیری آن توانایی در مقیاس بزرگ است، و لحظهنما ۲۰۲۳ هنوز درسهایی ارزش استخراج دارد.

مقاله

AgentBench، نوشته Xiao Liu و ۲۱ همکار در دانشگاه Tsinghua، هشت محیط تعریف میکند که برای فشار-آزمون LLMها بهعنوان عاملهای تعاملی بهجای مولدهای متن منفعل طراحی شدهاند. پنج محیط اصلی هستند: OS (تعامل با bash)، پایگاهداده (تولید SQL و بازیابی از خطا)، گراف دانش (پرسوجوهای ساختاری بر پایه ابزار)، بازی ورق دیجیتال (رقابت استراتژیک چند-دوری)، و معماهای فکر جانبی (گفتوگوی استنتاجی). سه مورد از مجموعهدادههای قبلی اقتباس شدهاند: House-Holding از ALFWorld، Web Shopping از WebShop، و Web Browsing از Mind2Web. مقاله ۲۷ مدل — مدلهای API تجاری و مدلهای متنباز تا ۷۰B — در حدود ۴,۰۰۰ تولید در بخش توسعه و ۱۳,۰۰۰ تولید در بخش آزمون ارزیابی میکند، و هم نمره موفقیت محیط-به-محیط و هم نمره کلی مرکب را گزارش میدهد.

ایدههای کلیدی

  • GPT-4 با نمره کلی ۴.۰۱ رهبر است. Claude-2 نمره ۲.۴۹ و GPT-3.5-turbo نمره ۲.۳۲ دارد. CodeLlama-34B، قویترین مدل متنباز در زمان ارسال، فقط نمره ۰.۹۶ دارد. مدلهای API بهطور میانگین ۲.۲۴ در برابر ۰.۴۲ برای مدلهای متنباز.
  • GPT-4 در OS نمره ۴۲.۴٪، در پایگاهداده ۳۲.۰٪، و در House-Holding ۷۸.۰٪ دارد — این پراکندگی نشان میدهد که کدام محیطها پیروی-از-دستور را در برابر استدلال ساختاری پاداش میدهند.
  • «تجاوز از حد وظیفه» حالت شکست غالب است: ۶۷.۹٪ از شکستهای گراف دانش قبل از حل وظیفه به بودجه قدم برخورد میکنند. این شکست استدلال افق بلند است، نه کمبود دانش.
  • خطاهای سازگاری با فرمت ۵۳.۳٪ از شکستهای پایگاهداده را تشکیل میدهند — عامل SQL نحوی نامعتبر تولید میکند، یا پرسوجو را در نثر میپیچد که ارزیابگر نمیتواند تجزیه کند.
  • انتخاب کنش نامعتبر ۶۴.۱٪ از شکستهای House-Holding را راندهد — عامل کنشی نامیبرد که در حالت فعلی در دسترس نیست.
  • آموزش کد «اثرات متناقض در سراس وظایف» دارد: به محیطهای پیروی-از-رویه کمک میکند اما ممکن است به استدلال عمومی در محیطهای گفتوگو-سنگین آسیب بزند.

چه ایستاده میماند — و چه نه

انتخاب اصلی طراحی — ارزیابی چند-محیطی، چند-دوری، تعاملی — درست است و هنوز کم استفاده. بیشتر معیارهای LLM هنوز کیفیت تولید تک-دوری را اندازه میگیرند؛ AgentBench بهدرست اصرار میکند که عاملها باید تا اتمام وظیفه یا اتمام بودجه به تصمیمگیری ادامه دهند.

با این، لحظهنما به شکلی که مهم است قدیمی است. شکاف بین GPT-4 (۴.۰۱) و بهترین مدل متنباز (۰.۹۶) در میانه ۲۰۲۳ هشداردهنده بهنظر میرسید، اما تا ۲۰۲۵ تقریباً بسته شده است. مدلهایی مانند Llama 3.1 70B یا Qwen 2.5 72B اکنون موانع پیروی-از-دستور و سازگاری-با-فرمت را که دو سال پیش موانع نو بودند، پشت سر میگذارند. خواندن مقاله بهعنوان «مدلهای متنباز نمیتوانند وظایف عاملی انجام دهند» اشتباه است؛ خواندن آن بهعنوان «سازگاری با فرمت و سازگاری افق بلند مشکلات سخت هستند» درست میماند.

همچنین تجارت عرض-در-برابر-عمق وجود دارد. هشت محیط جامع بهنظر میرسند، اما هر کدام نسبتاً کمعمق است. WebArena (Zhou و همکاران، ۲۰۲۴) ۸۱۲ وظیفه الگوی بلند-افق فقط برای مرور وب را پوشش میدهد؛ OSWorld (Xie و همکاران، ۲۰۲۴) ۳۶۹ وظیفه واقعی میزکار در Ubuntu و Windows را معیار میکند. AgentBench میتواند سیگنال عرض-محیطی بدهد، اما وقتی میدانید به کدام محیط اهمیت میدهید، جایگزین معیار حوزه-خاص نمیشود.

طبقهبندی حالتهای شکست در جدول ۴ احتمالاً پایدارترین مشارکت است. نویسندگان شکستها را به تجاوز از حد وظیفه، خطای فرمت، کنش نامعتبر، و چند مورد دیگر تجزیه میکنند. اینها باگهای پیادهسازی نیستند — بلکه ضعفهای ساختاری در چگونگی حفظ حالت، ردیابی کنشهای در دسترس، و تولید خروجی قابل تجزیه تحت فشار چند-دوری LLMها هستند. هر سیستم عاملی جدی باید به آنها بپردازد.

چرا این برای هوش مصنوعی مالی مهم است

سه حالت شکست غالب تقریباً مستقیم به چیزی که انتظار میدارم یک عامل نوشتن-بازگشت Beancount را بشکند، نگاشت میشوند.

تجاوز از حد وظیفه حالت شکست سازش-دفترکل است. بستن یک دوره در سراس حسابها به معنی چک کردن موجودی افتتاحی، مطابقت بدهی و اعتباریها، شناسایی ناهماهنگیها، و پیشنهاد اصلاحات — زنجیری که به آسانی ۱۰–۲۰ قدم اجرا میکند. عاملی که در میانه زنجیر به بودجه زمینه یا قدم برخورد کند و تسلیم شود، فقط با شکست زیبا شکست نمیکند؛ بلکه میتواند دفترکل را در حالت نیمه-تغییری رها کند.

خطای فرمت حالت شکست ورود تراکنش است. Beancount نحو سخت دارد: یک قید ناساز (بدون ارز، فرورفتگی نادرست، پرچم نامعتبر) خطای تجزیهگر است که فایل را فاسد میکند. عاملی که نثر دور خروجی Beancount خود تولید کند، یا نحو درست-بهنظر در فرمت نادرست تولید کند، بفایده است. این مشکل اصلی مقاله CRITIC است که به حوزهای سختتر اعمال میشود.

کنش نامعتبر مشکل امنیت نوشتن-بازگشت است. یک عامل Beancount که بر دفترکل واقعی کار میکند، یک مجموعه محدود از کنشهای امن دارد: افزودن تراکنش، اصلاح پرچم، جابجایی قید. تصور کنشی خارج از آن مجموعه — مثلاً حذف حسابی که هنوز مواضع باز دارد — شکست درستی است که ممکن است تا بازرسی ظاهر نشود.

یافته که «آموزش کد اثرات متناقض دارد» نیز مرتبط است. نوشتن-بازگشت Beancount به تولید کد نزدیکتر است تا بازیابی دانش، بنابراین مدل پیش-آموزش-کدی باید بهطور طبیعی سازگار باشد. اما اگر آموزش کد به پیروی-از-گفتگو در محیطهای چند-دوری آسیب بزند، ارزیابی هیبریدی مانند AgentBench برای آشکار کردن این تجارتها قبل از استقرار لازم است.

چه بعدی بخوانید

  • WebArena (Zhou و همکاران، ۲۰۲۴؛ arXiv:2307.13854) — ۸۱۲ وظیفه مرور وب در محیط مرورگر زنده؛ دنباله عمیقتر به طبقه وب AgentBench.
  • OSWorld (Xie و همکاران، ۲۰۲۴؛ NeurIPS 2024) — معیار کامل محیط میزکار شامل وظایف سیستم فایل و GUI؛ محیط OS در OSWorld جانشین مستقیم و عمیقتر به طبقه OS در AgentBench است.
  • TAU-bench (Yao و همکاران، ۲۰۲۴) — عاملها را در محیطهای API خردهفروشی و ایرلاین با استفاده ابزار واقعی و شبیهسازی کاربر ارزیابی میکند؛ نزدیکترین معیار منتشرشده به درمان دفترکل Beancount بهعنوان محیط.

این مقاله را به‌اشتراک بگذارید

منبع: https://beancount.io/fa/bean-labs/research-logs/2026/05/06/agentbench-evaluating-llms-as-agents

منتشر شده: ۱۶ اردیبهشت ۱۴۰۵

آخرین بهروزرسانی: ۲۳ شهریور ۱۴۰۵