
آیا عامل شما میتواند این حسابها را تراز کند؟
یک اجرای عامل دفتر کل سهردیفی را با ۲۹۵۸.۵۰ دلار حساب جاری و ۱۹۵۸.۵۰ دلار سود سپتامبر تطبیق داد و از شکستی که خود تشخیص داد بازیابی کرد.
#llm
پژوهش مدلهای زبانی بزرگ با کاربرد در وظایف مالی

یک اجرای عامل دفتر کل سهردیفی را با ۲۹۵۸.۵۰ دلار حساب جاری و ۱۹۵۸.۵۰ دلار سود سپتامبر تطبیق داد و از شکستی که خود تشخیص داد بازیابی کرد.

FinRAGBench-V مییابد برترین مدلها تنها به ۲۰–۶۱٪ بازیابی استناد در سطح بلوک در صفحات مالی میرسند. بازیابی چندوجهی تقریباً ۵۰ واحد از متنمحور بهتر است.

تنها Qwen3.5-9B از ۸۰٪ از ۱۳۲ اجرای CFO در EnterpriseArena جان سالم به در میبرد، در حالی که GPT-5.4 و DeepSeek-V3.1 به ۰٪ میرسند. نادیدهگرفتن تطبیق دفتر عامل شکست است.

WildToolBench مییابد هیچ LLM از ۱۵٪ دقت نشست در ۱,۰۲۴ وظیفه کاربران واقعی فراتر نمیرود و قصد پنهان و گذارهای دستور، تیزترین حالتهای شکستاند.

اطمینان کلامیشده GPT-4 تنها به ~۶۲.۷٪ AUROC میرسد، اندکی بالاتر از تصادف. عاملهای مالی آگاه به عدمقطعیت به کالیبراسیون بهتری نیاز دارند.

JSONSchemaBench مییابد پوشش از ۸۶٪ در طرحوارههای ساده به ۳٪ در پیچیده سقوط میکند؛ پس خروجی ساختیافته LLM میتواند بیصدا JSON ناسازگار بدهد.

FinMCP-Bench بهترین از شش LLM را تنها ۳.۰۸٪ تطابق دقیق در ۶۱۳ وظیفه واقعی مالی MCP میسنجد؛ سقوطی ۲۰ برابری از تکابزار به چندنوبت.

FinTrace نشان میدهد LLMهای پیشرو ابزارهای مالی درست را برمیگزینند (F1 ~۰.۹) اما تنها ۳.۲۳/۵ در استفاده از نتایج میگیرند؛ همان گامی که عاملهای بازنویسی را میشکند.

FinToolBench نشان میدهد عدمتطابق قصد برای هر LLM آزمایششده بالای ۵۰٪ است؛ پس فراخوانی تهاجمی ابزار به معنای پاسخهای بهتر در وظایف مالی نیست.

OmniEval بهترین سیستمهای RAG را در ۵ نوع وظیفه مالی با دقت عددی ۳۶٪ ارزیابی میکند؛ پس عاملهای دفتر کل پیش از ثبت اسناد به اعتبارسنجی نیاز دارند.

طبقهبندی NAACL 2025 پابرجاست، اما پوشش جدولی غایب است. تیمهای هوش مصنوعی مالی باید خودشان روشهای مدل بینایی را تطبیق دهند.

کاهش سوگیری مکانی از وزنهای توجه LLM تا ۱۵ واحد دقت RAG را وقتی شواهد میان متن است بازیابی میکند و به خط لولههای عامل مالی کمک میرساند.