
Seu agente consegue equilibrar estes livros?
Uma execução de agente reconciliou um livro-razão de três linhas com 2958,50 USD e 1958,50 USD de lucro de setembro, recuperando-se de uma falha.
#plain-text-accounting
Investigação baseada em formatos e fluxos de trabalho de contabilidade em texto simples

Uma execução de agente reconciliou um livro-razão de três linhas com 2958,50 USD e 1958,50 USD de lucro de setembro, recuperando-se de uma falha.

O ReDAct transfere de um modelo pequeno para um grande só quando a perplexidade sinaliza incerteza, cortando o custo em 64% com acurácia equivalente em fluxos de agentes.

O agente CodeAct do OpenHands pontua 26% no SWE-Bench Lite, mostrando o que agentes fazem de confiável hoje. Automação financeira deve começar restrita.

O LLMFinLiteracy constata que cinco modelos de ~7B escrevem transações Beancount corretas apenas 2,3% das vezes, falhando no raciocínio contábil, não na sintaxe.

O TableMaster atinge 78,13% no WikiTQ com o GPT-4o-mini, 13 pontos acima do Chain-of-Table, via table-of-focus e raciocínio adaptativo para agentes sobre livros Beancount.

O τ²-bench mostra que usuários ativos com suas ferramentas cortam o sucesso de agentes em 18–25 pontos. Agentes Beancount perdem igual.

As 466 tarefas do GAIA mostram agentes de IA de fronteira em 74,55% contra 92% dos humanos, com a coordenação de Nível 3 ainda sendo a lacuna mais difícil de fechar.

As 33 tarefas ServiceNow do WorkArena mostram o GPT-4o com 42,7% no geral, mas 0% em filtros de lista, uma barreira que a interação estruturada com UI precisa vencer.

O τ-bench mostra LLMs top caindo de pass@1 0,692 para pass@4 0,462 em ferramentas de varejo. Agentes de escrita enfrentam o mesmo abismo.

O Chain-of-Table atinge 67,31% no WikiTQ contra 61,48% do chain-of-thought puramente textual, e lidera por 10,25 pontos em tabelas com mais de 4.000 tokens.

O TableLlama supera o GPT-4 na anotação de tipos de coluna (F1 94 vs 32), mas fica 33 pontos atrás no raciocínio composicional do WikiTQ.

O TAPAS responde perguntas sobre tabelas selecionando células, nunca gerando SQL. Ele se adequa a consultas pequenas de ledger Beancount, mas quebra em escala.