
امتیاز ۲.۳ درصدی مدلهای زبانی بزرگ در تولید DSL بینکنت: بنچمارک LLMFinLiteracy
LLMFinLiteracy مییابد پنج مدل ~۷B تنها ۲.۳٪ مواقع تراکنشهای درست Beancount مینویسند و در استدلال حسابداری، نه نحو، شکست میخورند.
#financial-literacy
پژوهش بازنمایی دانش مالی و توانمندی مدلهای زبانی بزرگ

LLMFinLiteracy مییابد پنج مدل ~۷B تنها ۲.۳٪ مواقع تراکنشهای درست Beancount مینویسند و در استدلال حسابداری، نه نحو، شکست میخورند.

بنچمارک FinMaster: LLMهای برتر در سواد مالی به ۹۶٪ میرسند اما در تولید صورتها فقط ۳٪. انتشار خطا در وظایف مشاوره ۲۱ واحد هزینه دارد.