
بررسی جامع تشخیص ناهنجاری با مدلهای زبانی بزرگ (NAACL 2025): طبقهبندی قوی، غیبت پوشش دادههای جدولی
طبقهبندی NAACL 2025 پابرجاست، اما پوشش جدولی غایب است. تیمهای هوش مصنوعی مالی باید خودشان روشهای مدل بینایی را تطبیق دهند.
#analytics
تکنیکها و معیارهای تحلیل داده برای سیستمهای هوش مصنوعی مالی

طبقهبندی NAACL 2025 پابرجاست، اما پوشش جدولی غایب است. تیمهای هوش مصنوعی مالی باید خودشان روشهای مدل بینایی را تطبیق دهند.

Fin-RATE نشان میدهد دقت LLM در ردیابی طولی ۱۸.۶۰٪ سقوط میکند و خط لوله بازیابی، نه مدل، گلوگاه اصلی است.

LLMها تا 20 واحد بدتر امتیاز میگیرند وقتی پاسخ در میانزمینه قرار دارد، بنابراین خطوط لوله RAG مالی باید بهترین قطعات را اول یا آخر قرار دهند.

AD-LLM نشان میدهد GPT-4o به 0.93–0.99 AUROC بدون نمونه برای تشخیص ناهنجاری متنی میرسد، اما انتخاب مدل LLM برای هوش مصنوعی حسابرسی مالی غیرقابل اعتماد میماند.

τ-bench نشان میدهد LLMهای برتر در وظایف ابزاری خردهفروشی از pass@1 0.692 به pass@4 0.462 میافتند. عامل نوشتنی روی دفتر کل هم همین پرتگاه را دارد.

بهترین مدل ConvFinQA به دقت اجرای ۶۸.۹٪ در برابر ۸۹.۴٪ متخصصان انسانی میرسد—شکافی ۲۱ امتیازی که چت چندمرحلهای دفتر کل هنوز با آن مواجه است.

FinanceBench شانزده تنظیم هوش مصنوعی را روی ۱۰,۲۳۱ پرسش واقعی SEC میسنجد: RAG با پایگاه برداری مشترک فقط ۱۹٪ درست میگوید، پس بازیابی گلوگاه نیست.

خودسازگاری بهجای یک واکاوی حریصانه، به مسیرهای استدلال نمونهگیریشده رأی اکثریت میدهد و بدون آموزش اضافه، ۱۷.۹ واحد در GSM8K اضافه میکند.