
FinRAGBench-V: RAG Multimodal com Citações Visuais no Domínio Financeiro
FinRAGBench-V: os melhores modelos atingem só 20–61% de recall de citações em blocos de páginas financeiras. A busca multimodal supera a textual em quase 50 pontos.
#financial-reporting
Geração e auditoria de relatórios financeiros com modelos de linguagem

FinRAGBench-V: os melhores modelos atingem só 20–61% de recall de citações em blocos de páginas financeiras. A busca multimodal supera a textual em quase 50 pontos.

O Fin-RATE mostra que a precisão dos LLMs cai 18,60% no acompanhamento longitudinal, com o pipeline de recuperação, não o modelo, como gargalo limitante.

As 5.703 consultas reais de analistas do FinDER mostram que o melhor RAG recupera apenas 25,95% da evidência de 10-K. Normalize abreviações antes de trocar embeddings.

O DocFinQA troca trechos de 700 palavras do FinQA por documentos completos da SEC, contexto 175× maior que quase corta a acurácia do GPT-4.

O FinAuditing mostra que os melhores LLMs atingem só 13,86% na verificação matemática de arquivos XBRL reais da SEC, limitando o que a contabilidade com IA automatiza sozinha.

TAT-LLM ajusta o LLaMA 2 7B para 64,60% de EM no FinQA, à frente dos 63,91% do GPT-4: um pipeline extrair-raciocinar-executar faz a aritmética de tabelas.

O MultiHiertt mostra que modelos atingem 38% F1 contra 87% de humanos em 10.440 pares de QA financeiro, com queda de 15 pontos em perguntas entre tabelas.

O melhor modelo do ConvFinQA alcança 68,9% de precisão de execução contra 89,4% dos especialistas humanos — uma lacuna de 21 pontos que o chat contábil de múltiplas etapas ainda enfrenta.

O TAT-QA é um benchmark de 16.552 perguntas sobre contextos híbridos de tabela e texto em relatórios financeiros que demonstrou que o embasamento em evidências — e não a aritmética — é o principal gargalo na IA financeira; até 2024, LLMs de 7B ajustados alcançaram 83% de F1, fechando a maior parte da lacuna em relação ao teto humano de 91%.

O FinQA constatou que modelos neurais pontuaram 61% em matemática de relatórios financeiros contra 91% de especialistas, caindo a 22% em programas de três ou mais etapas.

O FinanceBench testa 16 configurações de IA em 10.231 perguntas reais da SEC: o RAG com vector store compartilhado acerta só 19%, então a recuperação não é o gargalo.

O PHANTOM (NeurIPS 2025) mede a detecção de alucinação em LLMs em documentos reais da SEC. O Qwen3-30B lidera com F1=0,882, mas modelos de 7B chutam quase aleatoriamente.