
MultiHiertt: бенчмаркинг численных рассуждений в иерархических финансовых таблицах
MultiHiertt показывает, что модели набирают 38% F1 против 87% у людей на 10,440 парах финансовых вопросов, с падением на 15 баллов на межтабличных вопросах.
#financial-statements
Генерация баланса, отчёта о прибылях и убытках и движения денежных средств

MultiHiertt показывает, что модели набирают 38% F1 против 87% у людей на 10,440 парах финансовых вопросов, с падением на 15 баллов на межтабличных вопросах.

FinanceBench тестирует 16 конфигураций ИИ на 10 231 вопросе по отчётам SEC: RAG с общим векторным хранилищем даёт лишь 19% верных ответов, значит поиск — не узкое место.

FinMaster Benchmark: лучшие LLM достигают 96% в финансовой грамотности, но лишь 3% в генерации отчётов. Распространение ошибок стоит 21 пункт на консультационных задачах.