
FinRAGBench-V: RAG چندوجهی با استنادهای بصری در حوزه مالی
FinRAGBench-V مییابد برترین مدلها تنها به ۲۰–۶۱٪ بازیابی استناد در سطح بلوک در صفحات مالی میرسند. بازیابی چندوجهی تقریباً ۵۰ واحد از متنمحور بهتر است.
#financial-reporting
تولید و حسابرسی گزارشهای مالی با مدلهای زبانی

FinRAGBench-V مییابد برترین مدلها تنها به ۲۰–۶۱٪ بازیابی استناد در سطح بلوک در صفحات مالی میرسند. بازیابی چندوجهی تقریباً ۵۰ واحد از متنمحور بهتر است.

Fin-RATE نشان میدهد دقت LLM در ردیابی طولی ۱۸.۶۰٪ سقوط میکند و خط لوله بازیابی، نه مدل، گلوگاه اصلی است.

۵,۷۰۳ پرسوجوی واقعی تحلیلگر در FinDER نشان میدهد برترین RAG تنها ۲۵.۹۵٪ شواهد 10-K را بازیابی میکند. نخست اختصارها را نرمال کنید، پیش از تغییر امبدینگها.

DocFinQA متنهای 700 کلمهای FinQA را با پروندههای کامل SEC جایگزین میکند، زمینهای 175 برابر طولانیتر که دقت GPT-4 را در اسناد طولانی تقریباً نصف میکند.

FinAuditing نشان میدهد LLMهای برتر در تأیید ریاضی پروندههای واقعی XBRL فقط ۱۳.۸۶٪ میگیرند و همین سقف اتوماسیون حسابداری بدون کمک است.

TAT-LLM با تنظیم LLaMA 2 7B به ۶۴.۶۰٪ EM در FinQA میرسد و از ۶۳.۹۱٪ GPT-4 جلو میزند: خط لوله استخراج-استدلال-اجرا حساب جدولی را ممکن میکند.

MultiHiertt نشان میدهد مدلها در ۱۰٬۴۴۰ جفت پرسشوپاسخ مالی ۳۸٪ F1 در برابر ۸۷٪ انسان امتیاز میگیرند، با افت ۱۵ امتیازی در پرسشهای بینجدولی.

بهترین مدل ConvFinQA به دقت اجرای ۶۸.۹٪ در برابر ۸۹.۴٪ متخصصان انسانی میرسد—شکافی ۲۱ امتیازی که چت چندمرحلهای دفتر کل هنوز با آن مواجه است.

پرسشهای ترکیبی جدول-متن TAT-QA نشان داد زمینگیر کردن شواهد، نه حساب، گلوگاه هوش مصنوعی مالی است. مدلهای زبانی بزرگ ۷B تنظیمشده تا ۲۰۲۴ به ۸۳٪ F1 رسیدند.

FinQA نشان داد مدلهای عصبی در ریاضیات گزارشهای مالی ۶۱٪ در برابر ۹۱٪ متخصصان انسانی امتیاز گرفتند و در مسائل سهمرحلهای یا بیشتر به ۲۲٪ سقوط کردند.

FinanceBench شانزده تنظیم هوش مصنوعی را روی ۱۰,۲۳۱ پرسش واقعی SEC میسنجد: RAG با پایگاه برداری مشترک فقط ۱۹٪ درست میگوید، پس بازیابی گلوگاه نیست.

PHANTOM (NeurIPS 2025) تشخیص توهم LLM را روی پروندههای واقعی SEC میسنجد. Qwen3-30B با F1=0.882 پیشتاز است، اما مدلهای 7B تقریباً تصادفی حدس میزنند.