
FinToolBench: ارزیابی عوامل LLM در استفاده از ابزارهای مالی دنیای واقعی
FinToolBench نشان میدهد عدمتطابق قصد برای هر LLM آزمایششده بالای ۵۰٪ است؛ پس فراخوانی تهاجمی ابزار به معنای پاسخهای بهتر در وظایف مالی نیست.
#compliance
پژوهش انطباق مقرراتی، اجرای سیاستها و رد حسابرسی برای سامانههای هوش مصنوعی مالی

FinToolBench نشان میدهد عدمتطابق قصد برای هر LLM آزمایششده بالای ۵۰٪ است؛ پس فراخوانی تهاجمی ابزار به معنای پاسخهای بهتر در وظایف مالی نیست.

STPA بههمراه MCP تقویتشده با قابلیت، مشخصات ایمنی رسمی برای استفاده از ابزار مدل زبانی بزرگ تولید میکند و Alloy در مطالعه موردی تقویم اثبات میکند جریان ناایمنی وجود ندارد.

FinAuditing نشان میدهد LLMهای برتر در تأیید ریاضی پروندههای واقعی XBRL فقط ۱۳.۸۶٪ میگیرند و همین سقف اتوماسیون حسابداری بدون کمک است.

محافظ دو مدل زبانی بزرگ AGrail موفقیت حمله تزریق پرامپت را به ۰٪ کاهش میدهد و در عین حال ۹۵.۶٪ اقدامات بیخطر عامل را در Safe-OS حفظ میکند.

ShieldAgent با استفاده از مدارهای قاعده احتمالاتی به جای محافظهای مدل زبانی بزرگ، به ۹۰.۴٪ دقت در حملات عامل با ۶۴.۷٪ تماس API کمتر میرسد.

AuditCopilot cuts journal entry fraud false positives from 942 to 12, but ablation shows the LLM mainly synthesizes Isolation Forest scores.

هوش مصنوعی قانون اساسی دادههای آسیب برچسبخورده دستی را با بازخورد AI جایگزین میکند، تا عاملهای حسابداری بدون بازبین برای هر تراکنش، قوانین دفتر کل را اجرا کنند.