
MemGPT: 92.5% multi-session recall vs 32.1% baseline
MemGPT's OS-style memory tiers push GPT-4 multi-session chat accuracy to 92.5% versus 32.1% fixed-context—needed for multi-year ledger agents.

MemGPT's OS-style memory tiers push GPT-4 multi-session chat accuracy to 92.5% versus 32.1% fixed-context—needed for multi-year ledger agents.

SWE-agent (NeurIPS 2024) introduces Agent-Computer Interfaces (ACIs) — purpose-built layers between LLMs and software environments — showing a 10.7-percentage-point improvement over raw shell access and 12.47% resolution on SWE-bench with GPT-4 Turbo. Interface design, not model capability, is the primary bottleneck for autonomous coding agents.

SWE-bench evaluates language models on 2,294 real GitHub issues across 12 Python repositories using execution-based tests; at publication, Claude 2 resolved only 1.96% of issues with realistic retrieval, establishing the de facto benchmark for coding agents and revealing retrieval and patch-length failure modes directly relevant to Beancount write-back agents.

CodeAct (ICML 2024) replaces JSON tool-calling with executable Python code, improving GPT-4 agent success rates by ~20 percentage points on multi-tool tasks and reducing interaction turns by 30% — with direct implications for building reliable Beancount reconciliation agents.

Huang et al. (ICLR 2024): intrinsic self-correction drops GPT-4 from 95.5% to 91.5% on GSM8K—ledger agents need external validators, not self-review.

Tree of Thoughts (ToT) achieves 74% on Game of 24 vs 4% for standard GPT-4 CoT by organizing LLM reasoning into a branching search tree with pruning and backtracking — with direct implications for multi-step financial classification and tax optimization in Beancount workflows.

CRITIC (ICLR 2024) achieves 7.7 F1 gains on open-domain QA and a 79.2% toxicity reduction by grounding LLM revision in external tool signals — a verify-then-correct loop that maps directly onto write-back safety for Beancount finance agents.

Рефлексия (NeurIPS 2023) позволява на LLM агентите да се усъвършенстват, като съхраняват вербални постмортем анализи в епизодичен буфер — без актуализации на теглата. Достига 91% на HumanEval с GPT-4, но се проваля на WebShop, разкривайки структурно ограничение: вербалното подкрепление работи само когато оценителят произвежда ясен и действен сигнал. Ето какво означава това за изграждането на самокоригиращ се Beancount агент за водене на сметки.

Самосъгласуваността заменя алчното декодиране по верига на мисълта с гласуване с мнозинство по N извадкови пътища на разсъждение — повишавайки точността на GPT-3 по GSM8K с 17,9 процентни пункта без допълнително обучение — и се прилага директно към многостъпкови финансови изчисления, където единично моделно декодиране е ненадеждно.

PAL постига +38.1pp над веригата на разсъждение при GSM-hard, като изпълнява аритметиката чрез Python — правилното разделение за надеждни изчисления в Beancount счетоводната книга.

Четири бенчмарка от 2024–2025 г. показват, че GPT-4 постига 42% при отговаряне на въпроси от реални таблици срещу 86% за хората, като сложните агрегации се сриват до 19,6% — а родният синтаксис на Beancount се намира в най-неефективния край на йерархията за сериализация при LLM вход.

Документът на Anthropic за конституционен ИИ (Bai et al., 2022) обучава LLM да следват правила, използвайки генерирана от ИИ обратна връзка, вместо човешки етикети за вреда. Този изследователски запис разглежда как RLAIF тръбопроводът критика-преразглеждане-предпочитание се пренася върху безопасността при запис за автономни Beancount ledger агенти — и как изглеждат Гудхартингът, калибрационните грешки и рисковете от двойна употреба, когато „конституцията“ е сметкоплан вместо етичен набор от правила.