
Seu agente consegue equilibrar estes livros?
Uma execução de agente reconciliou um livro-razão de três linhas com 2958,50 USD e 1958,50 USD de lucro de setembro, recuperando-se de uma falha.
#llm
Investigação de grandes modelos de linguagem com aplicações em tarefas financeiras

Uma execução de agente reconciliou um livro-razão de três linhas com 2958,50 USD e 1958,50 USD de lucro de setembro, recuperando-se de uma falha.

FinRAGBench-V: os melhores modelos atingem só 20–61% de recall de citações em blocos de páginas financeiras. A busca multimodal supera a textual em quase 50 pontos.

Só o Qwen3.5-9B sobrevive a 80% das 132 execuções de CFO do EnterpriseArena, enquanto GPT-5.4 e DeepSeek-V3.1 chegam a 0%. A conciliação ignorada causa as falhas.

O WildToolBench não encontra LLM acima de 15% de acurácia por sessão em 1.024 tarefas de usuários reais, com intenção oculta e transições de instrução como falhas mais agudas.

A confiança verbalizada do GPT-4 atinge apenas ~62,7% de AUROC, pouco acima do acaso. Agentes financeiros cientes da incerteza precisam de melhor calibração.

O JSONSchemaBench encontra cobertura que cai de 86% em esquemas simples para 3% em complexos, então a saída estruturada de LLM pode emitir JSON não conforme silenciosamente.

O FinMCP-Bench pontua o melhor de seis LLMs em apenas 3,08% de correspondência exata em 613 tarefas reais de MCP, colapso de 20× no multiturno.

FinTrace: LLMs de ponta escolhem as ferramentas financeiras certas (F1 ~0,9), mas tiram só 3,23/5 ao usar os resultados, etapa que quebra agentes de write-back.

O FinToolBench encontra incompatibilidade de intenção acima de 50% em todo LLM testado, então chamadas agressivas não geram melhores respostas.

O OmniEval pontua os melhores sistemas RAG em 36% de acurácia numérica em 5 tipos de tarefa financeira, exigindo validação antes de lançar.

A taxonomia da NAACL 2025 se mantém, mas a cobertura tabular está ausente. Equipes de IA financeira precisam adaptar métodos de modelos de visão por conta própria.

Subtrair o viés posicional da atenção do LLM recupera até 15 pontos de acurácia do RAG quando a evidência fica no meio do contexto.