
FinRAGBench-V: RAG چندوجهی با استنادهای بصری در حوزه مالی
FinRAGBench-V مییابد برترین مدلها تنها به ۲۰–۶۱٪ بازیابی استناد در سطح بلوک در صفحات مالی میرسند. بازیابی چندوجهی تقریباً ۵۰ واحد از متنمحور بهتر است.
#ai
پژوهش و کاربردهای هوش مصنوعی در امور مالی و حسابداری

FinRAGBench-V مییابد برترین مدلها تنها به ۲۰–۶۱٪ بازیابی استناد در سطح بلوک در صفحات مالی میرسند. بازیابی چندوجهی تقریباً ۵۰ واحد از متنمحور بهتر است.

تنها Qwen3.5-9B از ۸۰٪ از ۱۳۲ اجرای CFO در EnterpriseArena جان سالم به در میبرد، در حالی که GPT-5.4 و DeepSeek-V3.1 به ۰٪ میرسند. نادیدهگرفتن تطبیق دفتر عامل شکست است.

WildToolBench مییابد هیچ LLM از ۱۵٪ دقت نشست در ۱,۰۲۴ وظیفه کاربران واقعی فراتر نمیرود و قصد پنهان و گذارهای دستور، تیزترین حالتهای شکستاند.

اطمینان کلامیشده GPT-4 تنها به ~۶۲.۷٪ AUROC میرسد، اندکی بالاتر از تصادف. عاملهای مالی آگاه به عدمقطعیت به کالیبراسیون بهتری نیاز دارند.

JSONSchemaBench مییابد پوشش از ۸۶٪ در طرحوارههای ساده به ۳٪ در پیچیده سقوط میکند؛ پس خروجی ساختیافته LLM میتواند بیصدا JSON ناسازگار بدهد.

FinMCP-Bench بهترین از شش LLM را تنها ۳.۰۸٪ تطابق دقیق در ۶۱۳ وظیفه واقعی مالی MCP میسنجد؛ سقوطی ۲۰ برابری از تکابزار به چندنوبت.

FinTrace نشان میدهد LLMهای پیشرو ابزارهای مالی درست را برمیگزینند (F1 ~۰.۹) اما تنها ۳.۲۳/۵ در استفاده از نتایج میگیرند؛ همان گامی که عاملهای بازنویسی را میشکند.

FinToolBench نشان میدهد عدمتطابق قصد برای هر LLM آزمایششده بالای ۵۰٪ است؛ پس فراخوانی تهاجمی ابزار به معنای پاسخهای بهتر در وظایف مالی نیست.

OmniEval بهترین سیستمهای RAG را در ۵ نوع وظیفه مالی با دقت عددی ۳۶٪ ارزیابی میکند؛ پس عاملهای دفتر کل پیش از ثبت اسناد به اعتبارسنجی نیاز دارند.

طبقهبندی NAACL 2025 پابرجاست، اما پوشش جدولی غایب است. تیمهای هوش مصنوعی مالی باید خودشان روشهای مدل بینایی را تطبیق دهند.

کاهش سوگیری مکانی از وزنهای توجه LLM تا ۱۵ واحد دقت RAG را وقتی شواهد میان متن است بازیابی میکند و به خط لولههای عامل مالی کمک میرساند.

ReDAct تنها زمانی از یک مدل کوچک به بزرگ تعویق میاندازد که پرپلکسیتی عدم قطعیت را نشان دهد، هزینه را 64% با دقت مطابق برای جریانهای کاری عامل کاهش میدهد.