
FinRAGBench-V: RAG Multimodal com Citações Visuais no Domínio Financeiro
FinRAGBench-V: os melhores modelos atingem só 20–61% de recall de citações em blocos de páginas financeiras. A busca multimodal supera a textual em quase 50 pontos.
#data-science
Métodos de ciência de dados aplicados a conjuntos de dados financeiros e fluxos de trabalho contabilísticos

FinRAGBench-V: os melhores modelos atingem só 20–61% de recall de citações em blocos de páginas financeiras. A busca multimodal supera a textual em quase 50 pontos.

O WildToolBench não encontra LLM acima de 15% de acurácia por sessão em 1.024 tarefas de usuários reais, com intenção oculta e transições de instrução como falhas mais agudas.

A confiança verbalizada do GPT-4 atinge apenas ~62,7% de AUROC, pouco acima do acaso. Agentes financeiros cientes da incerteza precisam de melhor calibração.

O FinToolBench encontra incompatibilidade de intenção acima de 50% em todo LLM testado, então chamadas agressivas não geram melhores respostas.

O OmniEval pontua os melhores sistemas RAG em 36% de acurácia numérica em 5 tipos de tarefa financeira, exigindo validação antes de lançar.

A taxonomia da NAACL 2025 se mantém, mas a cobertura tabular está ausente. Equipes de IA financeira precisam adaptar métodos de modelos de visão por conta própria.

Subtrair o viés posicional da atenção do LLM recupera até 15 pontos de acurácia do RAG quando a evidência fica no meio do contexto.

O Fin-RATE mostra que a precisão dos LLMs cai 18,60% no acompanhamento longitudinal, com o pipeline de recuperação, não o modelo, como gargalo limitante.

As 5.703 consultas reais de analistas do FinDER mostram que o melhor RAG recupera apenas 25,95% da evidência de 10-K. Normalize abreviações antes de trocar embeddings.

LLMs pontuam até 20 pontos pior quando a resposta fica no meio do contexto, então pipelines de RAG financeiro devem colocar os melhores trechos no início ou no fim.

O AD-LLM mostra o GPT-4o atingindo 0,93–0,99 de AUROC zero-shot em anomalias de texto, mas a seleção de modelo segue instável para auditoria.

O CausalTAD reordena colunas de tabelas por dependência causal antes da serialização para o LLM, elevando o AUC-ROC médio de 0,803 para 0,834 em relação ao AnoLLM.