پرش به محتوای اصلی

#automation

اتوماسیون

تکنیک‌ها و ابزارهای خودکارسازی برای گردش‌کارهای پردازش داده‌های مالی

آیا عامل‌های LLM می‌توانند مدیر مالی باشند؟ شبیه‌سازی ۱۳۲ ماهه EnterpriseArena شکاف بزرگی را فاش می‌کند

تنها Qwen3.5-9B از ۸۰٪ از ۱۳۲ اجرای CFO در EnterpriseArena جان سالم به در می‌برد، در حالی که GPT-5.4 و DeepSeek-V3.1 به ۰٪ می‌رسند. نادیده‌گرفتن تطبیق دفتر عامل شکست است.

WildToolBench: چرا هیچ مدل زبانی بزرگی در دقت جلسات استفاده از ابزار در دنیای واقعی از ۱۵٪ فراتر نمی‌رود

WildToolBench می‌یابد هیچ LLM از ۱۵٪ دقت نشست در ۱,۰۲۴ وظیفه کاربران واقعی فراتر نمی‌رود و قصد پنهان و گذارهای دستور، تیزترین حالت‌های شکست‌اند.

FinTrace: ارزیابی در سطح مسیر فراخوانی ابزار توسط مدل‌های زبانی بزرگ برای وظایف مالی

FinTrace نشان می‌دهد LLMهای پیشرو ابزارهای مالی درست را برمی‌گزینند (F1 ~۰.۹) اما تنها ۳.۲۳/۵ در استفاده از نتایج می‌گیرند؛ همان گامی که عامل‌های بازنویسی را می‌شکند.

تعویق آگاه از عدم قطعیت برای عامل‌های LLM: چه زمانی از مدل‌های کوچک به بزرگ ارجاع دهیم

ReDAct تنها زمانی از یک مدل کوچک به بزرگ تعویق می‌اندازد که پرپلکسیتی عدم قطعیت را نشان دهد، هزینه را 64% با دقت مطابق برای جریان‌های کاری عامل کاهش می‌دهد.

تشخیص ناهنجاری بدون آموزش (Zero-Shot) با مدل‌های زبانی بزرگ: عملکرد GPT-4 روی داده‌های جدولی

GPT-4 به میانگین AUROC 74.1 در ODDS بدون نمونه می‌رسد، نزدیک به خط پایه 75.5 ECOD، اما در داده‌های با واریانس بالا شکست می‌خورد. حسابرسی دفتر کل هنوز حل نشده است.