پرش به محتوای اصلی

وبلاگ پژوهش Bean Labs

FinToolBench: ارزیابی عوامل LLM در استفاده از ابزارهای مالی دنیای واقعی

منتشر شده آخرین بهروزرسانی زمان مطالعه 6 دقیقهMike ThriftMike Thrift
FinToolBench: ارزیابی عوامل LLM در استفاده از ابزارهای مالی دنیای واقعی

مقاله: https://arxiv.org/abs/2603.08262

فهرست مطالب این صفحه

بیشتر معیارهای ارزیابی هوش مصنوعی مالی، توانایی مدل در خواندن یک سند را آزمایش میکنند. FinToolBench آزمایش میکند که آیا یک مدل میتواند کاری انجام دهد — یک API زنده را فراخوانی کند، دادههای بازار جاری را دریافت کند، و پاسخ صحیحی برگرداند. این شکافی است که برای هر سیستمی که سعی در خودکارسازی کارهای مالی واقعی دارد حیاتی است، و شکافی است که مدتها منتظر بستهشدن دقیق آن بودهام.

مقاله

جیا‌شوان لو و همکارانش FinToolBench (arXiv:2603.08262، مارس 2026) را به عنوان اولین معیار ارزیابی قابل اجرای دنیای واقعی برای سنجش عواملی که یاد میگیرند از ابزارهای مالی استفاده کنند، معرفی میکنند. چارچوببندی مستقیم است: ارزیابیهای موجود هوش مصنوعی مالی بر پرسش و پاسخ استاتیک اسناد تمرکز دارند، در حالی که معیارهای عمومی استفاده از ابزار مانند ToolLLM، امور مالی را تنها به عنوان یک دسته API دیگر بدون محدودیتهای انطباق خاص دامنه در نظر میگیرند. FinToolBench تلاش میکند فضای بین این دو حالت شکست را پر کند.

این معیار، 760 ابزار مالی قابل اجرا — 261 نقطه پایانی زنده از RapidAPI و 499 رابط از AkShare — را با 295 پرسوجوی ارزیابی دقیقاً انتخابشده جفت میکند که به 166 مورد تکابزاری و 129 مورد چندابزاری تقسیم میشوند. ابزارها سهام، اوراق قرضه، صندوقها، ارز، مشتقات، اقتصاد کلان و ارز دیجیتال را پوشش میدهند. نکته حیاتی این است که اینها APIهای واقعی و قابل فراخوانی هستند، نه شبیهسازیهای تقلبی. نویسندگان همچنین FATR (مسیریابی آگاه از امور مالی) را معرفی میکنند، یک عامل پایه که از بازیابی BGE-M3 (20 نامزد برتر)، کارتهای ابزار با ویژگیهای مالی، و یک برنامهریز ReAct آگاه از محدودیت که به پنج مرحله محدود شده، استفاده میکند.

ایدههای کلیدی

  • اجرا گلوگاه نیست — استدلال بر روی خروجیها گلوگاه است. GPT-4o بالاترین امتیاز نرم مشروط (CSS = 0.670) را دارد، به این معنی که وقتی با موفقیت ابزاری را فراخوانی میکند پاسخهای صحیح میدهد، اما ابزارها را تنها در 22.7 درصد مواقع فراخوانی میکند (TIR = 0.227). Qwen3-8B در 87.1 درصد مواقع ابزارها را فراخوانی میکند اما تنها در 40.4 درصد مواقع که فراخوانی موفق است پاسخ صحیح میگیرد.
  • ناسازگاری قصد، شکست غالب انطباق است. نرخ ناسازگاری قصد (IMR) برای اکثر مدلها بیش از 50 درصد است، به این معنی که عوامل به طور معمول فراخوانیهای تراکنشی صادر میکنند وقتی پرسوجو تنها درخواست بازیابی اطلاعات دارد. این مشکل جدی در زمینههای مالی تنظیمشده است.
  • تزریق ویژگیهای مالی به انطباق کمک میکند بدون آسیب به توانایی. کارتهای ابزار پایه FATR — که هر ابزار را با تازگی، نوع قصد و حوزه نظارتی برچسبگذاری میکنند — فراخوانیهای داده قدیمی (TMR) و نقضهای دامنه (DMR) را بدون کاهش معنادار نرخ فراخوانی کاهش میدهند.
  • پرسوجوهای چندابزاری شکاف قابلیت اطمینان را آشکار میکنند. 129 پرسوجوی چندابزاری نیاز به زنجیرهکردن فراخوانیها و انتقال خروجیها بین مراحل دارند؛ عملکرد به طور قابل توجهی نسبت به موارد تکابزاری کاهش مییابد، مطابق با یافتههای FinTrace و TheAgentCompany.
  • مدلهای کوچک میتوانند در فراخوانی از مدلهای بزرگ جلو بزنند اما در استدلال نه. TIR برابر 0.871 برای Qwen3-8B در مقابل 0.227 برای GPT-4o نشان میدهد که مدلهای کوچکتر در فراخوانی شتابزده هستند، اما CER (نرخ اجرای مشروط، یعنی TESR/TIR) برابر 0.339 برای Qwen3-8B در مقابل 0.618 برای GPT-4o آشکار میسازد که GPT-4o زمانی که تصمیم به فراخوانی ابزار میگیرد بسیار دقیقتر است.

چه چیزی محکم است — و چه چیزی نه

انتخاب این معیار برای استفاده از APIهای واقعاً زنده و قابل اجرا، سهم اصلی آن است و سهمی قابل توجه است. APIهای شبیهسازیشده راز کثیف معیارهای استفاده از ابزار بودند: 16,000 API مربوط به ToolLLM چشمگیر به نظر میرسند تا زمانی که متوجه شوید ارزیابی از یک LLM به عنوان قاضی برای اینکه آیا یک فراخوانی "میتوانست" کار کند استفاده میکند. FinToolBench از این مسئله اجتناب میکند.

معیارهای انطباق (TMR, IMR, DMR) از نظر مفهومی درست هستند — عوامل مالی باید تفاوت بین دریافت قیمت بستهشدن دیروز و آغاز یک معامله را بدانند — اما توصیف مقاله از نحوه اعمال این طبقهبندیها کمرنگ است. مشخص نیست که آیا برچسبهای حقیقت زمینی برای نوع قصد (اطلاعاتی در مقابل تراکنشی) توسط متخصصان حقوقی یا انطباق تأیید شدهاند یا صرفاً توسط نویسندگان مجموعه داده اختصاص داده شدهاند. این موضوع در عمل بسیار مهم است.

فهرست مدلها نیز به طرز عجیبی محدود است: Doubao-Seed-1.6، Qwen3-8B، GLM-4.7-Flash و GPT-4o. هیچ Claude Sonnet یا Gemini 2.5 وجود ندارد که مقایسههای طبیعی بودند. جدول نتایج GPT-4o را به عنوان یک مورد پرت با دقت بالا و پوشش پایین نشان میدهد؛ من میخواهم بدانم که آیا رفتار استفاده از ابزار Claude به الگوی محافظهکارانه GPT-4o نزدیکتر است یا به الگوی تهاجمی Qwen3-8B.

مجموعه ارزیابی 295 پرسوجویی با استانداردهای معیارهای مدرن کوچک است. با 760 ابزار، نرخ پوشش 295 پرسوجو به این معنی است که اکثر ابزارها هرگز آزمایش نمیشوند. مقاله هیچ آمار پوشش به تفکیک دامنه ارائه نمیدهد، به این معنی که اعداد برجسته میتوانند توسط زیرمجموعهای از دامنههای با پوشش خوب مانند سهام و اقتصاد کلان هدایت شوند.

چرا این برای هوش مصنوعی مالی مهم است

عوامل بازنویسی Beancount — هر عاملی که bean-add را فراخوانی میکند، فایل دفتر کل را وصله میکند، یا beanquery را پرسوجو میکند — دقیقاً با حالتهای شکستی مواجه میشوند که FinToolBench آشکار میسازد. مشکل ناسازگاری قصد مستقیماً نگاشت میشود: یک عامل Beancount که فراخوانی نوشتن را صادر میکند وقتی کاربر سؤال خواندن پرسیده، همان امضای شکست نقض IMR را دارد. بعد تازگی به فراخوانی وضعیت دفتر کل کششده قدیمی نگاشت میشود وقتی کاربر انتظار موجودی فعلی را دارد.

تنش دقت در برابر پوشش (GPT-4o در برابر Qwen3-8B) نیز بلافاصله مرتبط است. برای بازنویسی Beancount من به شدت رفتار فراخوانی محافظهکارانه GPT-4o را ترجیح میدهم — TIR پایین، CER و CSS بالا — بر مدلی با فراخوانی بالا که اغلب ابزار اشتباه را اجرا میکند. نوشتنهای اشتباه بسیار بیشتر از عملیاتهای بیاثر هزینه دارند.

رویکرد FATR در برچسبگذاری ابزارها با ویژگیهای انطباق، به جای تکیه بر استنباط مدل از آنها، الگوی طراحیای است که ارزش اتخاذ دارد. پوششدادن ابزارهای خط فرمان Beancount با فرادادههای صریح درباره اینکه آیا یک فراخوانی فقطخواندنی یا جهشدهنده است، و اینکه آیا به وضعیت دفتر کل جاری یا بایگانیشده مربوط میشود، همان ایده در مقیاس کوچکتر است.

چه چیزی بعدی بخوانید

  • FinTrace (arXiv:2604.10015) — ارزیابی سطح مسیر در 34 دسته وظیفه مالی با 9 متریک؛ به طور مستقیم ارزیابی تکفراخوانی FinToolBench را به توالیهای چندمرحلهای گسترش میدهد و Qwen-3.5-9B را با DPO برای بهبود استدلال میانی تنظیم دقیق میکند.
  • FinMCP-Bench (arXiv:2603.24943) — 613 نمونه بر روی 65 ابزار مالی مبتنی بر MCP، با آزمایش فراخوانیهای تکابزاری، چندابزاری و چندنوبتی؛ چارچوب MCP به طور مستقیم برای رابطهای ابزار Beancount مرتبط است.
  • ToolLLM (arXiv:2307.16789, ICLR 2024) — مقاله ToolBench که FinToolBench به صراحت خود را در برابر آن قرار میدهد؛ درک اینکه خط پایه API شبیهسازیشده چه چیزی میتواند و نمیتواند اندازهگیری کند، روشن میکند که قابلیت اجرای واقعی FinToolBench چقدر ارزش دارد.

این مقاله را به‌اشتراک بگذارید

منبع: https://beancount.io/fa/bean-labs/research-logs/2026/07/05/fintoolbench-evaluating-llm-agents-real-world-financial-tool-use

منتشر شده: ۱۴ تیر ۱۴۰۵

آخرین بهروزرسانی: ۲۳ شهریور ۱۴۰۵

زمان مطالعه 5 دقیقه

FinMCP-Bench: معیار سنجش عامل‌های LLM برای استفاده از ابزارهای مالی واقعی تحت MCP

FinMCP-Bench شش مدل LLM را در ۶۱۳ وظیفه واقعی استفاده از ابزار مالی که توسط ۶۵…

ai
llm
زمان مطالعه 6 دقیقه

WildToolBench: چرا هیچ مدل زبانی بزرگی در دقت جلسات استفاده از ابزار در دنیای واقعی از ۱۵٪ فراتر نمی‌رود

بنچ‌مارک WildToolBench (ICLR 2026) ۵۷ مدل زبانی بزرگ را بر روی ۱۰۲۴ وظیفه…

ai
llm
زمان مطالعه 5 دقیقه

FinTrace: ارزیابی در سطح مسیر فراخوانی ابزار توسط مدل‌های زبانی بزرگ برای وظایف مالی

بنچمارک FinTrace، ۱۳ مدل زبانی بزرگ را در ۸۰۰ مسیر وظایف مالی با حاشیه‌نویسی…

llm
ai
زمان مطالعه 5 دقیقه

OmniEval: بنچمارک ارزیابی همه‌جانبه RAG برای حوزه مالی

OmniEval (EMNLP 2025) سیستم‌های RAG را در ۵ نوع تسک × ۱۶ موضوع مالی با استفاده…

ai
machine-learning
زمان مطالعه 6 دقیقه

بنچمارک GAIA: اندازه‌گیری آنچه مدل‌های هوش مصنوعی پیشرو واقعاً می‌توانند انجام دهند

بنچمارک GAIA شامل ۴۶۶ وظیفه دنیای واقعی در سه سطح دشواری است؛ عوامل پیشرو در…

ai
llm