
MemGPT:92.5%的多会话召回率对比32.1%的基线
MemGPT的类操作系统内存层级将GPT-4多会话聊天准确率提升至92.5%,而固定上下文仅为32.1%——这是多年账本代理所必需的。

MemGPT的类操作系统内存层级将GPT-4多会话聊天准确率提升至92.5%,而固定上下文仅为32.1%——这是多年账本代理所必需的。

SWE-agent (NeurIPS 2024) 引入了代理-计算机接口 (ACI) —— LLM 与软件环境之间专门构建的层 —— 在 SWE-bench 上相比原始 shell 访问提升了 10.7 个百分点,并配合 GPT-4 Turbo 实现了 12.47% 的解决率。接口设计而非模型能力,是自主编码代理的主要瓶颈。

SWE-bench 通过基于执行的测试,在 12 个 Python 仓库的 2,294 个真实 GitHub 问题上评估语言模型;在发布时,Claude 2 在现实检索设置下仅解决了 1.96% 的问题,这确立了编程智能体的行业基准,并揭示了检索和补丁长度的失败模式,这与 Beancount 回写智能体直接相关。

CodeAct (ICML 2024) 使用可执行的 Python 代码取代了 JSON 工具调用,在多工具任务中将 GPT-4 智能体的成功率提高了约 20 个百分点,并将交互轮数减少了 30% —— 这对于构建可靠的 Beancount 对账智能体具有直接意义。

Huang等(ICLR 2024):内在自我纠正使GPT-4在GSM8K上从95.5%降至91.5%——账本代理需要外部验证器,而非自我审查。

思维树 (ToT) 在 24 点游戏中实现了 74% 的成功率,而标准的 GPT-4 CoT 仅为 4%。它通过将大模型推理组织成具有剪枝和回溯功能的决策树来实现这一目标,这对 Beancount 工作流中的多步骤财务分类和税务优化具有直接意义。

CRITIC (ICLR 2024) 通过将大语言模型(LLM)的修订建立在外部工具信号的基础上,在开放域问答中实现了 7.7 的 F1 值提升,并减少了 79.2% 的有害内容——这种“先验证后修正”的循环直接对应了 Beancount 金融代理的回写安全机制。

Reflexion (NeurIPS 2023) 通过将语言事后分析存储在情节缓冲区中,使大语言模型 (LLM) 智能体得以改进,而无需更新权重。它在 GPT-4 的 HumanEval 测试中达到了 91% 的准确率,但在 WebShop 上表现不佳,这揭示了一个结构性限制:只有当评估器产生清晰、可操作的信号时,语言强化才有效。本文探讨了这对构建自校正 Beancount 账本智能体的意义。

自洽性用对N条采样推理路径的多数投票取代贪婪的思维链解码——在不进行额外训练的情况下,将GPT-3在GSM8K上的准确率提升了17.9个百分点——并直接适用于单次模型解码不可靠的多步金融计算。

PAL在GSM-hard上比思维链提升+38.1个百分点,通过运行Python进行算术——这是可靠Beancount账本计算的正确分工。

2024–2025 年的四个基准测试显示,GPT-4 在真实表格问答中的得分为 42%,而人类为 86%;复杂的聚合操作准确率甚至跌至 19.6%——而 Beancount 的原生语法在 LLM 输入的序列化层级中处于性能表现最差的一端。

Anthropic 的宪制 AI 论文(Bai 等人,2022 年)训练大语言模型使用 AI 生成的反馈而非人工伤害标签来遵循规则。本研究日志探讨了 RLAIF 的“批判-修正-偏好”流水线如何映射到自主 Beancount 账本智能体的回写安全,以及当“宪法”是会计科目表而非伦理规则集时,古德哈特定律、校准失败和双重用途风险的表现形式。