
FinRAGBench-V: RAG Multimodal com Citações Visuais no Domínio Financeiro
FinRAGBench-V: os melhores modelos atingem só 20–61% de recall de citações em blocos de páginas financeiras. A busca multimodal supera a textual em quase 50 pontos.
#finance
Investigação financeira, análise e conhecimento do domínio para IA contabilística

FinRAGBench-V: os melhores modelos atingem só 20–61% de recall de citações em blocos de páginas financeiras. A busca multimodal supera a textual em quase 50 pontos.

A confiança verbalizada do GPT-4 atinge apenas ~62,7% de AUROC, pouco acima do acaso. Agentes financeiros cientes da incerteza precisam de melhor calibração.

FinTrace: LLMs de ponta escolhem as ferramentas financeiras certas (F1 ~0,9), mas tiram só 3,23/5 ao usar os resultados, etapa que quebra agentes de write-back.

O OmniEval pontua os melhores sistemas RAG em 36% de acurácia numérica em 5 tipos de tarefa financeira, exigindo validação antes de lançar.

As 5.703 consultas reais de analistas do FinDER mostram que o melhor RAG recupera apenas 25,95% da evidência de 10-K. Normalize abreviações antes de trocar embeddings.

LLMs pontuam até 20 pontos pior quando a resposta fica no meio do contexto, então pipelines de RAG financeiro devem colocar os melhores trechos no início ou no fim.

O AnoLLM supera baselines em fraude de tipos mistos ao pontuar linhas com log-verossimilhança negativa, mas não ganha vantagem em tabelas numéricas.

O DocFinQA troca trechos de 700 palavras do FinQA por documentos completos da SEC, contexto 175× maior que quase corta a acurácia do GPT-4.

O TheAgentCompany avalia 175 tarefas empresariais em uma intranet simulada, e o melhor modelo, Gemini-2.5-Pro, conclui apenas 30% a US$ 4 cada.

InvestorBench: Qwen2.5-72B lidera negociação de ações com CR de 46,15%; Palmyra-Fin ajustada para finanças falha em ações—tamanho supera ajuste fino de domínio.

Com orçamentos iguais de tokens de raciocínio, LLMs de agente único igualam ou superam sistemas multiagentes em raciocínio multi-hop—favorecendo designs de agentes financeiros mais simples.

O M3MAD-Bench descobriu que a Ilusão Coletiva causa 65% das falhas em debates multiagente, e o debate adversarial reduz a precisão em até 12,8%.