
MultiHiertt: بنچمارک استدلال عددی بر روی جداول مالی چندسلسلهمراتبی
MultiHiertt نشان میدهد مدلها در ۱۰٬۴۴۰ جفت پرسشوپاسخ مالی ۳۸٪ F1 در برابر ۸۷٪ انسان امتیاز میگیرند، با افت ۱۵ امتیازی در پرسشهای بینجدولی.
#financial-statements
پژوهش در ترازنامه، صورت سود و زیان و تولید جریان نقدی

MultiHiertt نشان میدهد مدلها در ۱۰٬۴۴۰ جفت پرسشوپاسخ مالی ۳۸٪ F1 در برابر ۸۷٪ انسان امتیاز میگیرند، با افت ۱۵ امتیازی در پرسشهای بینجدولی.

FinanceBench شانزده تنظیم هوش مصنوعی را روی ۱۰,۲۳۱ پرسش واقعی SEC میسنجد: RAG با پایگاه برداری مشترک فقط ۱۹٪ درست میگوید، پس بازیابی گلوگاه نیست.

بنچمارک FinMaster: LLMهای برتر در سواد مالی به ۹۶٪ میرسند اما در تولید صورتها فقط ۳٪. انتشار خطا در وظایف مشاوره ۲۱ واحد هزینه دارد.