پرش به محتوای اصلی

#llm

مدل زبانی بزرگ

پژوهش مدل‌های زبانی بزرگ با کاربرد در وظایف مالی

آیا عامل‌های LLM می‌توانند مدیر مالی باشند؟ شبیه‌سازی ۱۳۲ ماهه EnterpriseArena شکاف بزرگی را فاش می‌کند

تنها Qwen3.5-9B از ۸۰٪ از ۱۳۲ اجرای CFO در EnterpriseArena جان سالم به در می‌برد، در حالی که GPT-5.4 و DeepSeek-V3.1 به ۰٪ می‌رسند. نادیده‌گرفتن تطبیق دفتر عامل شکست است.

WildToolBench: چرا هیچ مدل زبانی بزرگی در دقت جلسات استفاده از ابزار در دنیای واقعی از ۱۵٪ فراتر نمی‌رود

WildToolBench می‌یابد هیچ LLM از ۱۵٪ دقت نشست در ۱,۰۲۴ وظیفه کاربران واقعی فراتر نمی‌رود و قصد پنهان و گذارهای دستور، تیزترین حالت‌های شکست‌اند.

FinTrace: ارزیابی در سطح مسیر فراخوانی ابزار توسط مدل‌های زبانی بزرگ برای وظایف مالی

FinTrace نشان می‌دهد LLMهای پیشرو ابزارهای مالی درست را برمی‌گزینند (F1 ~۰.۹) اما تنها ۳.۲۳/۵ در استفاده از نتایج می‌گیرند؛ همان گامی که عامل‌های بازنویسی را می‌شکند.