
LLMs pontuam 2,3% na Geração de DSL Beancount: O Benchmark LLMFinLiteracy
O LLMFinLiteracy constata que cinco modelos de ~7B escrevem transações Beancount corretas apenas 2,3% das vezes, falhando no raciocínio contábil, não na sintaxe.
#transaction-validation
Validação e verificação de transações financeiras com agentes de modelos de linguagem

O LLMFinLiteracy constata que cinco modelos de ~7B escrevem transações Beancount corretas apenas 2,3% das vezes, falhando no raciocínio contábil, não na sintaxe.

O GuardAgent aplica políticas de agentes LLM executando código Python, atingindo 98,7% de precisão sem falhas de tarefa, contra 81% e até 71% de falha para regras em prompt.

O debate multiagente ganhou 14,8 pontos em aritmética, mas agentes únicos com orçamento igual o igualam, limitando seu uso como verificação segura.

O CRITIC eleva QA aberto em 7,7 de F1 e corta a toxicidade em 79,2% ao verificar revisões de LLM contra ferramentas externas, não contra si mesmo.