پرش به محتوای اصلی

#data-science

علم داده

روش‌های علم داده برای مجموعه‌داده‌های مالی و گردش‌کارهای حسابداری

WildToolBench: چرا هیچ مدل زبانی بزرگی در دقت جلسات استفاده از ابزار در دنیای واقعی از ۱۵٪ فراتر نمی‌رود

WildToolBench می‌یابد هیچ LLM از ۱۵٪ دقت نشست در ۱,۰۲۴ وظیفه کاربران واقعی فراتر نمی‌رود و قصد پنهان و گذارهای دستور، تیزترین حالت‌های شکست‌اند.

FinDER: پرس‌وجوهای واقعی تحلیل‌گران شکاف بازخوانی ۷۴ درصدی را در RAG مالی فاش می‌کنند

۵,۷۰۳ پرس‌وجوی واقعی تحلیلگر در FinDER نشان می‌دهد برترین RAG تنها ۲۵.۹۵٪ شواهد 10-K را بازیابی می‌کند. نخست اختصارها را نرمال کنید، پیش از تغییر امبدینگ‌ها.

بنچ‌مارک AD-LLM: مدل GPT-4o به امتیاز AUROC بالای ۰.۹۳ در تشخیص ناهنجاری متنی بدون آموزش (Zero-Shot) دست یافت

AD-LLM نشان می‌دهد GPT-4o به 0.93–0.99 AUROC بدون نمونه برای تشخیص ناهنجاری متنی می‌رسد، اما انتخاب مدل LLM برای هوش مصنوعی حسابرسی مالی غیرقابل اعتماد می‌ماند.