
Seu agente consegue equilibrar estes livros?
Uma execução de agente reconciliou um livro-razão de três linhas com 2958,50 USD e 1958,50 USD de lucro de setembro, recuperando-se de uma falha.
#reconciliation
Reconciliação automatizada de livros de razão com agentes de modelos de linguagem

Uma execução de agente reconciliou um livro-razão de três linhas com 2958,50 USD e 1958,50 USD de lucro de setembro, recuperando-se de uma falha.

FinRAGBench-V: os melhores modelos atingem só 20–61% de recall de citações em blocos de páginas financeiras. A busca multimodal supera a textual em quase 50 pontos.

Só o Qwen3.5-9B sobrevive a 80% das 132 execuções de CFO do EnterpriseArena, enquanto GPT-5.4 e DeepSeek-V3.1 chegam a 0%. A conciliação ignorada causa as falhas.

O FinMCP-Bench pontua o melhor de seis LLMs em apenas 3,08% de correspondência exata em 613 tarefas reais de MCP, colapso de 20× no multiturno.

Subtrair o viés posicional da atenção do LLM recupera até 15 pontos de acurácia do RAG quando a evidência fica no meio do contexto.

O Fin-RATE mostra que a precisão dos LLMs cai 18,60% no acompanhamento longitudinal, com o pipeline de recuperação, não o modelo, como gargalo limitante.

La biblioteca persistente de habilidades de código de Voyager descubre 3,3× más objetos de Minecraft que el SOTA anterior sin ajuste fino—el patrón de reutilización que los agentes de ledger necesitan.

A conversa de dois agentes do AutoGen eleva a precisão do MATH de 55% para 69%, e seu agente SafeGuard adiciona até 35 pontos F1 na detecção de código inseguro.

O CodeAct substitui chamadas de ferramentas em JSON por Python executável, elevando o sucesso do agente GPT-4 em ~20 pontos e cortando turnos em 30%.

O CRITIC eleva QA aberto em 7,7 de F1 e corta a toxicidade em 79,2% ao verificar revisões de LLM contra ferramentas externas, não contra si mesmo.

O ReAct intercala raciocínio e ações de ferramentas, vencendo o CoT puro em 34 pontos na verificação de fatos. Suas falhas moldam agentes que escrevem em ledgers Beancount.