پرش به محتوای اصلی

#ai

هوش مصنوعی

پژوهش و کاربردهای هوش مصنوعی در امور مالی و حسابداری

آیا عامل‌های LLM می‌توانند مدیر مالی باشند؟ شبیه‌سازی ۱۳۲ ماهه EnterpriseArena شکاف بزرگی را فاش می‌کند

تنها Qwen3.5-9B از ۸۰٪ از ۱۳۲ اجرای CFO در EnterpriseArena جان سالم به در می‌برد، در حالی که GPT-5.4 و DeepSeek-V3.1 به ۰٪ می‌رسند. نادیده‌گرفتن تطبیق دفتر عامل شکست است.

WildToolBench: چرا هیچ مدل زبانی بزرگی در دقت جلسات استفاده از ابزار در دنیای واقعی از ۱۵٪ فراتر نمی‌رود

WildToolBench می‌یابد هیچ LLM از ۱۵٪ دقت نشست در ۱,۰۲۴ وظیفه کاربران واقعی فراتر نمی‌رود و قصد پنهان و گذارهای دستور، تیزترین حالت‌های شکست‌اند.

FinTrace: ارزیابی در سطح مسیر فراخوانی ابزار توسط مدل‌های زبانی بزرگ برای وظایف مالی

FinTrace نشان می‌دهد LLMهای پیشرو ابزارهای مالی درست را برمی‌گزینند (F1 ~۰.۹) اما تنها ۳.۲۳/۵ در استفاده از نتایج می‌گیرند؛ همان گامی که عامل‌های بازنویسی را می‌شکند.

تعویق آگاه از عدم قطعیت برای عامل‌های LLM: چه زمانی از مدل‌های کوچک به بزرگ ارجاع دهیم

ReDAct تنها زمانی از یک مدل کوچک به بزرگ تعویق می‌اندازد که پرپلکسیتی عدم قطعیت را نشان دهد، هزینه را 64% با دقت مطابق برای جریان‌های کاری عامل کاهش می‌دهد.