
FinToolBench: ارزیابی عوامل LLM در استفاده از ابزارهای مالی دنیای واقعی
FinToolBench با جفتکردن 760 ابزار API مالی زنده با 295 پرسوجوی قابل اجرا، عوامل LLM را بر روی وظایف مالی واقعی ارزیابی میکند — نشان میدهد که نرخ فراخوانی محافظهکارانه 22.7 درصدی GPT-4o کیفیت پاسخ بالاتری (CSS 0.670) نسبت به نرخ فراخوانی تهاجمی 87.1 درصدی Qwen3-8B (TIR) ایجاد میکند، در حالی که ناسازگاری قصد در همه مدلهای آزمایششده بیش از 50 درصد است.
