FinQA: O Benchmark que Mede o Raciocínio Numérico de IA em Relatórios Financeiros
O FinQA (EMNLP 2021) construiu 8.281 pares de perguntas e respostas a partir de relatórios de lucros do S&P 500 que exigem programas aritméticos de múltiplas etapas. Os modelos neurais pontuaram 61% no lançamento, contra 91% dos especialistas humanos; a precisão cai para 22% em programas de três ou mais etapas. Os modos de falha — constantes de domínio, ancoragem de cross-modality, comprimento da cadeia — mapeiam-se diretamente aos desafios que os agentes Beancount enfrentam hoje.