
MemGPT: 92,5% de recall multi-sessão vs 32,1% de baseline
As camadas de memória estilo SO do MemGPT elevam a precisão do chat multi-sessão do GPT-4 para 92,5% contra 32,1% de contexto fixo—necessário para agentes de ledger plurianuais.

As camadas de memória estilo SO do MemGPT elevam a precisão do chat multi-sessão do GPT-4 para 92,5% contra 32,1% de contexto fixo—necessário para agentes de ledger plurianuais.

O SWE-agent (NeurIPS 2024) introduz as Interfaces Agente-Computador (ACIs) — camadas projetadas especificamente entre LLMs e ambientes de software — mostrando uma melhoria de 10,7 pontos percentuais em relação ao acesso bruto ao shell e 12,47% de resolução no SWE-bench com GPT-4 Turbo. O design da interface, e não a capacidade do modelo, é o principal gargalo para agentes de codificação autônomos.

O SWE-bench avalia modelos de linguagem em 2.294 problemas reais do GitHub em 12 repositórios Python usando testes baseados em execução; na publicação, o Claude 2 resolveu apenas 1,96% dos problemas com recuperação realista, estabelecendo o benchmark de fato para agentes de codificação e revelando modos de falha de recuperação e comprimento de patch diretamente relevantes para agentes de write-back do Beancount.

O CodeAct (ICML 2024) substitui a chamada de ferramentas via JSON por código Python executável, aumentando as taxas de sucesso de agentes GPT-4 em ~20 pontos percentuais em tarefas multi-ferramentas e reduzindo os turnos de interação em 30% — com implicações diretas para a construção de agentes de reconciliação Beancount confiáveis.

Huang et al. (ICLR 2024): a autocorreção intrínseca reduz o GPT-4 de 95,5% para 91,5% no GSM8K—agentes contábeis precisam de validadores externos, não de auto-revisão.

O Tree of Thoughts (ToT) alcança 74% no Game of 24 vs 4% para o GPT-4 CoT padrão, organizando o raciocínio de LLM em uma árvore de busca ramificada com poda e backtracking — com implicações diretas para classificação financeira em múltiplas etapas e otimização fiscal em fluxos de trabalho do Beancount.

O CRITIC (ICLR 2024) alcança ganhos de 7,7 no F1 em QA de domínio aberto e uma redução de 79,2% na toxicidade ao fundamentar a revisão de LLM em sinais de ferramentas externas — um loop de verificar-e-corrigir que se mapeia diretamente na segurança de gravação para agentes financeiros Beancount.

Reflexion (NeurIPS 2023) permite que agentes LLM melhorem ao armazenar post-mortems verbais em um buffer episódico — sem necessidade de atualizações de pesos. Alcança 91% no HumanEval com GPT-4, mas falha no WebShop, revelando uma restrição estrutural: o reforço verbal só funciona quando o avaliador produz um sinal claro e acionável. Veja o que isso significa para construir um agente de livro-razão Beancount auto-corretor.

A autoconsistência substitui a decodificação gananciosa de chain-of-thought por um voto majoritário sobre N caminhos de raciocínio amostrados — elevando a precisão do GPT-3 no GSM8K em 17,9 pontos percentuais sem treinamento extra — e se aplica diretamente a cálculos financeiros de múltiplas etapas, onde uma única decodificação do modelo não é confiável.

PAL ganha +38,1pp sobre chain-of-thought no GSM-hard ao executar Python para aritmética—a divisão certa para cálculos confiáveis no ledger Beancount.

Quatro benchmarks de 2024–2025 mostram o GPT-4 com uma pontuação de 42% em P&R de tabelas do mundo real contra 86% de humanos, com agregações complexas caindo para 19,6% — e a sintaxe nativa do Beancount situa-se na extremidade de pior desempenho da hierarquia de serialização para entrada de LLM.

O artigo sobre IA Constitucional da Anthropic (Bai et al., 2022) treina LLMs para seguir regras usando feedback gerado por IA em vez de rótulos humanos de danos. Este registro de pesquisa examina como o pipeline de crítica-revisão-preferência do RLAIF se mapeia na segurança de gravação para agentes autônomos de livros contábeis Beancount — e como são os riscos de Goodharting, falhas de calibração e uso dual quando a "constituição" é um plano de contas em vez de um conjunto de regras éticas.