
امتیاز ۲.۳ درصدی مدلهای زبانی بزرگ در تولید DSL بینکنت: بنچمارک LLMFinLiteracy
LLMFinLiteracy مییابد پنج مدل ~۷B تنها ۲.۳٪ مواقع تراکنشهای درست Beancount مینویسند و در استدلال حسابداری، نه نحو، شکست میخورند.
#transaction-validation
اعتبارسنجی و راستیآزمایی تراکنشهای مالی با عاملهای مدل زبانی

LLMFinLiteracy مییابد پنج مدل ~۷B تنها ۲.۳٪ مواقع تراکنشهای درست Beancount مینویسند و در استدلال حسابداری، نه نحو، شکست میخورند.

GuardAgent با اجرای کد پایتون خطمشیهای عوامل مدل زبانی بزرگ را اجرا میکند و به ۹۸.۷٪ دقت بدون شکست وظیفه میرسد، در برابر ۸۱٪ و تا ۷۱٪ شکست برای قواعد مبتنی بر پرامپت.

مناظره چندعاملی ۱۴.۸ امتیاز در حساب پیشرفت کرد، اما عاملان تکنفره با بودجه برابر همسطح آناند. این مناظره را بهعنوان بررسی ایمن پیش از ثبت دفتر کل محدود میکند.

CRITIC پرسش و پاسخ دامنه باز را ۷.۷ F1 بالا میبرد و سمیت را ۷۹.۲٪ کم میکند، با تأیید بازنگریهای LLM در برابر ابزارهای بیرونی، نه خودش.