跳转到主要内容

Bean Labs 研究日志

AgentBench:评估作为智能体的 LLM —— 对金融 AI 可靠性的启示

发布日期 最后更新 阅读需 1 分钟Mike ThriftMike Thrift
AgentBench:评估作为智能体的 LLM —— 对金融 AI 可靠性的启示

论文: https://arxiv.org/abs/2308.03688

本页总览

当我问一个 Beancount 写回智能体真正需要可靠地做什么时,答案不是“生成文本”——而是“在结构化环境中执行一系列动作而不偏离轨道”。AgentBench(Liu 等人,清华大学,ICLR 2024)是首批在大规模上认真衡量这种能力的尝试之一,2023 年的快照至今仍有值得提炼的经验。

论文内容

AgentBench 由清华大学的 Xiao Liu 和 21 位合著者完成,定义了八个旨在将 LLM 作为交互式智能体而非被动文本生成器来压力测试的环境。五个环境是原创的:OS(bash 交互)、Database(SQL 生成和错误恢复)、Knowledge Graph(基于工具的结构化查询)、Digital Card Game(多轮战略对抗)和 Lateral Thinking Puzzles(演绎式对话)。三个改编自既有数据集:来自 ALFWorld 的 House-Holding、来自 WebShop 的 Web Shopping 和来自 Mind2Web 的 Web Browsing。论文评估了 27 个模型——商业 API 模型和高达 70B 的开源模型——涵盖约 4,000 个开发集和 13,000 个测试集的生成,并报告了每个环境的成功率和综合总分。

关键观点

  • GPT-4 以 4.01 的总分领先。Claude-2 得 2.49 分,GPT-3.5-turbo 得 2.32 分。提交时最强的开源模型 CodeLlama-34B 仅得 0.96 分。API 模型平均 2.24 分,而开源模型仅 0.42 分。
  • GPT-4 在 OS 上得 42.4%,在 Database 上得 32.0%,在 House-Holding 上得 78.0%——这种差距显示出哪些环境更看重指令遵循,哪些更看重结构化推理。
  • “超出任务限制”是主导失败模式:67.9% 的知识图谱失败是在步骤预算耗尽时仍未解决任务。这是长程推理失败,而非知识不足。
  • 格式合规错误占数据库失败的 53.3%——智能体生成语法无效的 SQL,或者将查询包裹在评估器无法解析的散文中。
  • 无效动作选择驱动了 64.1% 的 House-Holding 失败——智能体选择了当前状态下不可用的动作。
  • 代码训练“在不同任务上产生矛盾的效果”:它有助于遵循流程的环境,但可能损害对话密集型任务中的通用推理。

哪些观点仍然成立——哪些已经过时

核心设计选择——多环境、多轮、交互式评估——是正确的,而且仍未被充分利用。大多数 LLM 基准仍然只衡量单轮生成质量;AgentBench 正确地坚持要求智能体持续做出决策,直到任务完成或预算耗尽。

话虽如此,这份快照在某些重要方面已经过时。GPT-4(4.01)与最佳开源模型(0.96)之间的差距在 2023 年中看起来令人震惊,但到 2025 年这一差距已基本弥合。像 Llama 3.1 70B 或 Qwen 2.5 72B 这样的模型现在能轻松跨越两年前还是全新障碍的指令遵循和格式合规门槛。把这篇论文读成“开源模型无法完成智能体任务”将是一个错误;读成“格式合规和长程一致性才是真正的难题”则仍然正确。

此外还存在广度与深度之间的权衡。八个环境听起来很全面,但每个都相对浅。WebArena(Zhou 等人,2024)仅针对网页浏览就覆盖了 812 个长程模板化任务;OSWorld(Xie 等人,2024)在 Ubuntu 和 Windows 上对 369 个真实桌面任务进行基准测试。AgentBench 可以提供跨环境信号,但一旦你明确了自己关心的环境,它并不能替代领域特定的基准。

表 4 中的失败模式分类可能是最有持久价值的贡献。作者将失败分为超出任务限制、格式错误、无效动作以及其他几种。这些不是实现 bug——它们是 LLM 在多轮压力下维护状态、跟踪可用动作和生成可解析输出时的结构性弱点。任何认真的智能体系统都必须解决这些问题。

为什么这对金融 AI 很重要

三大主导失败模式几乎直接映射到我预期会破坏 Beancount 写回智能体的地方。

超出任务限制是对账失败模式。跨多个账户结算期间意味着检查期初余额、匹配借方和贷方、识别差异并提出修正——这很容易构成 10–20 步的链条。一个在中途遇到上下文或步骤预算耗尽而放弃的智能体不仅仅是不优雅地失败;它还可能让账本处于部分修改的状态。

格式错误是交易录入失败模式。Beancount 有严格的语法:格式错误的记账条目(缺少货币、缩进错误、无效标记)是破坏文件的解析器错误。一个在 Beancount 输出周围生成散文、或生成格式不对但在语法上看起来正确的智能体毫无用处。这就是 CRITIC 论文的核心问题在更严格的领域中的体现。

无效动作是写回安全问题。一个在真实账本上操作的 Beancount 智能体有一组有限的安全操作:追加交易、更正标记、移动记账条目。幻觉出该集合之外的动作——例如删除一个仍有未平仓头寸的账户——是一种正确性失败,可能直到审计时才会暴露。

“代码训练产生矛盾效果”的发现也与此相关。Beancount 写回更接近代码生成而非知识检索,因此经过代码预训练的模型应该很合适。但如果在多轮环境中代码训练损害了对话遵循能力,就需要像 AgentBench 这样的混合评估在部署前揭示这些权衡。

接下来读什么

  • WebArena(Zhou 等人,2024;arXiv:2307.13854)——812 个在真实浏览器环境中的网页浏览任务;作为 AgentBench 网页层的更深层后续。
  • OSWorld(Xie 等人,2024;NeurIPS 2024)——涵盖文件系统和 GUI 任务的完整桌面环境基准;OSWorld 的 OS 环境是 AgentBench OS 层的直接且更深的继承者。
  • TAU-bench(Yao 等人,2024)——在零售和航空 API 环境中评估智能体,包含真实工具使用和用户模拟;这是最接近将 Beancount 账本视为环境的已发表基准。

分享这篇文章

来源:https://beancount.io/zh/bean-labs/research-logs/2026/05/06/agentbench-evaluating-llms-as-agents

发布日期: 2026年5月6日

最后更新: 2026年9月14日