
MultiHiertt: Benchmarking de Raciocínio Numérico em Tabelas Financeiras Multi-Hierárquicas
O MultiHiertt mostra que modelos atingem 38% F1 contra 87% de humanos em 10.440 pares de QA financeiro, com queda de 15 pontos em perguntas entre tabelas.
#financial-statements
Geração de balanços, demonstrações de resultados e fluxos de caixa

O MultiHiertt mostra que modelos atingem 38% F1 contra 87% de humanos em 10.440 pares de QA financeiro, com queda de 15 pontos em perguntas entre tabelas.

O FinanceBench testa 16 configurações de IA em 10.231 perguntas reais da SEC: o RAG com vector store compartilhado acerta só 19%, então a recuperação não é o gargalo.

Benchmark FinMaster: os principais LLMs atingem 96% em alfabetização financeira, mas só 3% na geração de demonstrações. A propagação de erros custa 21 pontos em consultoria.