
تعویق آگاه از عدم قطعیت برای عاملهای LLM: چه زمانی از مدلهای کوچک به بزرگ ارجاع دهیم
ReDAct تنها زمانی از یک مدل کوچک به بزرگ تعویق میاندازد که پرپلکسیتی عدم قطعیت را نشان دهد، هزینه را 64% با دقت مطابق برای جریانهای کاری عامل کاهش میدهد.
آزمایشها و یافتههای باز از Bean Labs — ابتکار پژوهشی Finance AI Agent از Beancount.io.

ReDAct تنها زمانی از یک مدل کوچک به بزرگ تعویق میاندازد که پرپلکسیتی عدم قطعیت را نشان دهد، هزینه را 64% با دقت مطابق برای جریانهای کاری عامل کاهش میدهد.

عامل CodeAct در OpenHands در SWE-Bench Lite ۲۶٪ میگیرد؛ یعنی کار مطمئن امروز محدود است. اتوماسیون مالی باید محدود آغاز شود، نه خودمختار.

Fin-RATE نشان میدهد دقت LLM در ردیابی طولی ۱۸.۶۰٪ سقوط میکند و خط لوله بازیابی، نه مدل، گلوگاه اصلی است.

۵,۷۰۳ پرسوجوی واقعی تحلیلگر در FinDER نشان میدهد برترین RAG تنها ۲۵.۹۵٪ شواهد 10-K را بازیابی میکند. نخست اختصارها را نرمال کنید، پیش از تغییر امبدینگها.

LLMها تا 20 واحد بدتر امتیاز میگیرند وقتی پاسخ در میانزمینه قرار دارد، بنابراین خطوط لوله RAG مالی باید بهترین قطعات را اول یا آخر قرار دهند.

AD-LLM نشان میدهد GPT-4o به 0.93–0.99 AUROC بدون نمونه برای تشخیص ناهنجاری متنی میرسد، اما انتخاب مدل LLM برای هوش مصنوعی حسابرسی مالی غیرقابل اعتماد میماند.

CausalTAD ستونهای جدول را بر اساس وابستگی علّی قبل از سریالسازی LLM مرتب میکند، میانگین AUC-ROC را از 0.803 به 0.834 در برابر AnoLLM میرساند.

AnoLLM با امتیازدهی ردیفها بر پایه لگاریتم درستنمایی منفی LLM از خطوط پایه کلاسیک در دادههای تقلب با انواع مختلط پیشی میگیرد، اما در جداول کاملاً عددی برتری نمیافزاید.

LLMFinLiteracy مییابد پنج مدل ~۷B تنها ۲.۳٪ مواقع تراکنشهای درست Beancount مینویسند و در استدلال حسابداری، نه نحو، شکست میخورند.

TableMaster با GPT-4o-mini به 78.13% در WikiTQ میرسد، 13 واحد بالاتر از Chain-of-Table، از طریق جدول تمرکز بهعلاوه استدلال تطبیقی برای عاملها روی دفترهای کل Beancount.

GPT-4 به میانگین AUROC 74.1 در ODDS بدون نمونه میرسد، نزدیک به خط پایه 75.5 ECOD، اما در دادههای با واریانس بالا شکست میخورد. حسابرسی دفتر کل هنوز حل نشده است.

DocFinQA متنهای 700 کلمهای FinQA را با پروندههای کامل SEC جایگزین میکند، زمینهای 175 برابر طولانیتر که دقت GPT-4 را در اسناد طولانی تقریباً نصف میکند.