
MultiHiertt: Тестування чисельного міркування на основі багатоієрархічних фінансових таблиць
MultiHiertt показує, що моделі набирають 38% F1 проти 87% у людей на 10,440 фінансових QA-парах, з падінням на 15 пунктів на питаннях між таблицями.
#financial-statements
Дослідження генерації балансу, звіту про прибутки та грошових потоків

MultiHiertt показує, що моделі набирають 38% F1 проти 87% у людей на 10,440 фінансових QA-парах, з падінням на 15 пунктів на питаннях між таблицями.

FinanceBench тестує 16 AI-конфігурацій на 10 231 реальному питанні до звітів SEC: RAG зі спільним векторним сховищем дає лише 19% правильних, тож пошук не є вузьким місцем.

Бенчмарк FinMaster: найкращі LLM досягають 96% у фінансовій грамотності, але лише 3% у генерації звітів. Поширення помилок коштує 21 пункт у консалтингових завданнях.