
FinRAGBench-V: RAG چندوجهی با استنادهای بصری در حوزه مالی
FinRAGBench-V مییابد برترین مدلها تنها به ۲۰–۶۱٪ بازیابی استناد در سطح بلوک در صفحات مالی میرسند. بازیابی چندوجهی تقریباً ۵۰ واحد از متنمحور بهتر است.
#finance
پژوهش مالی، تحلیل و دانش تخصصی برای هوش مصنوعی حسابداری

FinRAGBench-V مییابد برترین مدلها تنها به ۲۰–۶۱٪ بازیابی استناد در سطح بلوک در صفحات مالی میرسند. بازیابی چندوجهی تقریباً ۵۰ واحد از متنمحور بهتر است.

اطمینان کلامیشده GPT-4 تنها به ~۶۲.۷٪ AUROC میرسد، اندکی بالاتر از تصادف. عاملهای مالی آگاه به عدمقطعیت به کالیبراسیون بهتری نیاز دارند.

FinTrace نشان میدهد LLMهای پیشرو ابزارهای مالی درست را برمیگزینند (F1 ~۰.۹) اما تنها ۳.۲۳/۵ در استفاده از نتایج میگیرند؛ همان گامی که عاملهای بازنویسی را میشکند.

OmniEval بهترین سیستمهای RAG را در ۵ نوع وظیفه مالی با دقت عددی ۳۶٪ ارزیابی میکند؛ پس عاملهای دفتر کل پیش از ثبت اسناد به اعتبارسنجی نیاز دارند.

۵,۷۰۳ پرسوجوی واقعی تحلیلگر در FinDER نشان میدهد برترین RAG تنها ۲۵.۹۵٪ شواهد 10-K را بازیابی میکند. نخست اختصارها را نرمال کنید، پیش از تغییر امبدینگها.

LLMها تا 20 واحد بدتر امتیاز میگیرند وقتی پاسخ در میانزمینه قرار دارد، بنابراین خطوط لوله RAG مالی باید بهترین قطعات را اول یا آخر قرار دهند.

AnoLLM با امتیازدهی ردیفها بر پایه لگاریتم درستنمایی منفی LLM از خطوط پایه کلاسیک در دادههای تقلب با انواع مختلط پیشی میگیرد، اما در جداول کاملاً عددی برتری نمیافزاید.

DocFinQA متنهای 700 کلمهای FinQA را با پروندههای کامل SEC جایگزین میکند، زمینهای 175 برابر طولانیتر که دقت GPT-4 را در اسناد طولانی تقریباً نصف میکند.

TheAgentCompany 175 وظیفه سازمانی را در یک اینترانت شبیهسازیشده ارزیابی میکند، و بهترین مدل، Gemini-2.5-Pro، تنها 30% را با هزینه 4 دلار هر کدام کامل میکند.

InvestorBench: Qwen2.5-72B با نرخ موفقیت ۴۶.۱۵٪ پیشتاز معاملات سهام است؛ Palmyra-Fin تنظیمشده برای مالی در سهام نتیجه معکوس میدهد—اندازه بر تنظیمدقیق دامنه برتری دارد.

در بودجههای برابر توکن تفکر، مدلهای زبانی تکعاملی در استدلال چندمرحلهای با سیستمهای چندعاملی برابری یا برتری دارند—طراحیهای سادهتر عامل مالی را ترجیح دهید.

M3MAD-Bench دریافت که توهم جمعی عامل ۶۵٪ شکستهای مناظره چندعاملی است و مناظره تخاصمی دقت را تا ۱۲.۸٪ کاهش میدهد.