
FinRAGBench-V: RAG Multimodal com Citações Visuais no Domínio Financeiro
FinRAGBench-V: os melhores modelos atingem só 20–61% de recall de citações em blocos de páginas financeiras. A busca multimodal supera a textual em quase 50 pontos.
#machine-learning
Técnicas de aprendizagem automática para análise e automação de dados financeiros

FinRAGBench-V: os melhores modelos atingem só 20–61% de recall de citações em blocos de páginas financeiras. A busca multimodal supera a textual em quase 50 pontos.

O WildToolBench não encontra LLM acima de 15% de acurácia por sessão em 1.024 tarefas de usuários reais, com intenção oculta e transições de instrução como falhas mais agudas.

A confiança verbalizada do GPT-4 atinge apenas ~62,7% de AUROC, pouco acima do acaso. Agentes financeiros cientes da incerteza precisam de melhor calibração.

O JSONSchemaBench encontra cobertura que cai de 86% em esquemas simples para 3% em complexos, então a saída estruturada de LLM pode emitir JSON não conforme silenciosamente.

O FinMCP-Bench pontua o melhor de seis LLMs em apenas 3,08% de correspondência exata em 613 tarefas reais de MCP, colapso de 20× no multiturno.

FinTrace: LLMs de ponta escolhem as ferramentas financeiras certas (F1 ~0,9), mas tiram só 3,23/5 ao usar os resultados, etapa que quebra agentes de write-back.

O FinToolBench encontra incompatibilidade de intenção acima de 50% em todo LLM testado, então chamadas agressivas não geram melhores respostas.

O OmniEval pontua os melhores sistemas RAG em 36% de acurácia numérica em 5 tipos de tarefa financeira, exigindo validação antes de lançar.

A taxonomia da NAACL 2025 se mantém, mas a cobertura tabular está ausente. Equipes de IA financeira precisam adaptar métodos de modelos de visão por conta própria.

Subtrair o viés posicional da atenção do LLM recupera até 15 pontos de acurácia do RAG quando a evidência fica no meio do contexto.

O ReDAct transfere de um modelo pequeno para um grande só quando a perplexidade sinaliza incerteza, cortando o custo em 64% com acurácia equivalente em fluxos de agentes.

O agente CodeAct do OpenHands pontua 26% no SWE-Bench Lite, mostrando o que agentes fazem de confiável hoje. Automação financeira deve começar restrita.