
FinRAGBench-V: RAG چندوجهی با استنادهای بصری در حوزه مالی
FinRAGBench-V مییابد برترین مدلها تنها به ۲۰–۶۱٪ بازیابی استناد در سطح بلوک در صفحات مالی میرسند. بازیابی چندوجهی تقریباً ۵۰ واحد از متنمحور بهتر است.
#data-science
روشهای علم داده برای مجموعهدادههای مالی و گردشکارهای حسابداری

FinRAGBench-V مییابد برترین مدلها تنها به ۲۰–۶۱٪ بازیابی استناد در سطح بلوک در صفحات مالی میرسند. بازیابی چندوجهی تقریباً ۵۰ واحد از متنمحور بهتر است.

WildToolBench مییابد هیچ LLM از ۱۵٪ دقت نشست در ۱,۰۲۴ وظیفه کاربران واقعی فراتر نمیرود و قصد پنهان و گذارهای دستور، تیزترین حالتهای شکستاند.

اطمینان کلامیشده GPT-4 تنها به ~۶۲.۷٪ AUROC میرسد، اندکی بالاتر از تصادف. عاملهای مالی آگاه به عدمقطعیت به کالیبراسیون بهتری نیاز دارند.

FinToolBench نشان میدهد عدمتطابق قصد برای هر LLM آزمایششده بالای ۵۰٪ است؛ پس فراخوانی تهاجمی ابزار به معنای پاسخهای بهتر در وظایف مالی نیست.

OmniEval بهترین سیستمهای RAG را در ۵ نوع وظیفه مالی با دقت عددی ۳۶٪ ارزیابی میکند؛ پس عاملهای دفتر کل پیش از ثبت اسناد به اعتبارسنجی نیاز دارند.

طبقهبندی NAACL 2025 پابرجاست، اما پوشش جدولی غایب است. تیمهای هوش مصنوعی مالی باید خودشان روشهای مدل بینایی را تطبیق دهند.

کاهش سوگیری مکانی از وزنهای توجه LLM تا ۱۵ واحد دقت RAG را وقتی شواهد میان متن است بازیابی میکند و به خط لولههای عامل مالی کمک میرساند.

Fin-RATE نشان میدهد دقت LLM در ردیابی طولی ۱۸.۶۰٪ سقوط میکند و خط لوله بازیابی، نه مدل، گلوگاه اصلی است.

۵,۷۰۳ پرسوجوی واقعی تحلیلگر در FinDER نشان میدهد برترین RAG تنها ۲۵.۹۵٪ شواهد 10-K را بازیابی میکند. نخست اختصارها را نرمال کنید، پیش از تغییر امبدینگها.

LLMها تا 20 واحد بدتر امتیاز میگیرند وقتی پاسخ در میانزمینه قرار دارد، بنابراین خطوط لوله RAG مالی باید بهترین قطعات را اول یا آخر قرار دهند.

AD-LLM نشان میدهد GPT-4o به 0.93–0.99 AUROC بدون نمونه برای تشخیص ناهنجاری متنی میرسد، اما انتخاب مدل LLM برای هوش مصنوعی حسابرسی مالی غیرقابل اعتماد میماند.

CausalTAD ستونهای جدول را بر اساس وابستگی علّی قبل از سریالسازی LLM مرتب میکند، میانگین AUC-ROC را از 0.803 به 0.834 در برابر AnoLLM میرساند.