
آیا عامل شما میتواند این حسابها را تراز کند؟
یک اجرای عامل دفتر کل سهردیفی را با ۲۹۵۸.۵۰ دلار حساب جاری و ۱۹۵۸.۵۰ دلار سود سپتامبر تطبیق داد و از شکستی که خود تشخیص داد بازیابی کرد.
#reconciliation
تطبیق خودکار دفتر کل با استفاده از عاملهای مدل زبانی

یک اجرای عامل دفتر کل سهردیفی را با ۲۹۵۸.۵۰ دلار حساب جاری و ۱۹۵۸.۵۰ دلار سود سپتامبر تطبیق داد و از شکستی که خود تشخیص داد بازیابی کرد.

FinRAGBench-V مییابد برترین مدلها تنها به ۲۰–۶۱٪ بازیابی استناد در سطح بلوک در صفحات مالی میرسند. بازیابی چندوجهی تقریباً ۵۰ واحد از متنمحور بهتر است.

تنها Qwen3.5-9B از ۸۰٪ از ۱۳۲ اجرای CFO در EnterpriseArena جان سالم به در میبرد، در حالی که GPT-5.4 و DeepSeek-V3.1 به ۰٪ میرسند. نادیدهگرفتن تطبیق دفتر عامل شکست است.

FinMCP-Bench بهترین از شش LLM را تنها ۳.۰۸٪ تطابق دقیق در ۶۱۳ وظیفه واقعی مالی MCP میسنجد؛ سقوطی ۲۰ برابری از تکابزار به چندنوبت.

کاهش سوگیری مکانی از وزنهای توجه LLM تا ۱۵ واحد دقت RAG را وقتی شواهد میان متن است بازیابی میکند و به خط لولههای عامل مالی کمک میرساند.

Fin-RATE نشان میدهد دقت LLM در ردیابی طولی ۱۸.۶۰٪ سقوط میکند و خط لوله بازیابی، نه مدل، گلوگاه اصلی است.

کتابخانه مهارت کد پایدار وویجر، ۳.۳ برابر موارد ماینکرفت بیشتری نسبت به SOTA قبلی بدون تنظیم دقیق کشف میکند—الگوی استفاده مجددی که عوامل دفتر کل نیاز دارند.

مکالمه دو عاملی AutoGen دقت MATH را از ۵۵٪ به ۶۹٪ میرساند و عامل SafeGuard آن تا ۳۵ امتیاز F1 در تشخیص کد ناایمن اضافه میکند.

CodeAct فراخوانیهای ابزار JSON را با Python اجراپذیر جایگزین میکند، موفقیت عامل GPT-4 را حدود ۲۰ واحد بالا میبرد و نوبتها را ۳۰٪ کم میکند.

CRITIC پرسش و پاسخ دامنه باز را ۷.۷ F1 بالا میبرد و سمیت را ۷۹.۲٪ کم میکند، با تأیید بازنگریهای LLM در برابر ابزارهای بیرونی، نه خودش.

ReAct استدلال را با اقدامات ابزار درهم میآمیزد و در تأیید واقعیت ۳۴ واحد از CoT خالص جلوتر است. حالتهای شکست آن، عاملهای نوشتنی در دفترهای Beancount را شکل میدهد.