
MultiHiertt: Benchmarking Numerical Reasoning Over Multi-Hierarchical Financial Tables
MultiHiertt shows models score 38% F1 against 87% for humans on 10,440 financial QA pairs, with a 15-point drop on cross-table questions.
#financial-statements
Изследвания за генериране на баланс, отчет за приходите и разходите и парични потоци

MultiHiertt shows models score 38% F1 against 87% for humans on 10,440 financial QA pairs, with a 15-point drop on cross-table questions.

FinanceBench tests 16 AI setups on 10,231 real SEC filing questions: shared-vector-store RAG answers only 19% right, so retrieval is not the bottleneck.

FinMaster Benchmark: водещите LLM достигат 96% по финансова грамотност, но само 3% при генериране на отчети. Разпространението на грешки струва 21 точки при консултации.