
你的智能体能否平衡这些账目?
一次智能体运行将三行账本对账至2958.50美元活期存款和1958.50美元9月利润,并从它自行诊断的一次失败中恢复。
#plain-text-accounting

一次智能体运行将三行账本对账至2958.50美元活期存款和1958.50美元9月利润,并从它自行诊断的一次失败中恢复。

ReDAct 仅在困惑度表明不确定时,才从小模型推迟到大模型,在保持准确率的同时将智能体工作流的成本降低 64%。

OpenHands 的 CodeAct 智能体在 SWE-Bench Lite 上得分 26%,展示了 AI 智能体如今可靠能做到什么。金融自动化应从严格限定范围开始,而非完全自主。

LLMFinLiteracy发现,五个约7B模型正确编写Beancount交易的比例仅为2.3%,失败在于会计推理而非语法。

TableMaster 搭配 GPT-4o-mini 在 WikiTQ 上达到 78.13%,比 Chain-of-Table 高 13 个百分点,其方法是面向 Beancount 账本智能体的关注表加自适应推理。

τ²-bench 发现,拥有自己工具的主动用户会让对话智能体的成功率下降 18–25 个百分点。共享写权限的 Beancount 智能体也会以同样的方式失败。

GAIA 的 466 项任务显示,前沿 AI 智能体达到 74.55%,而人类为 92%,其中第 3 级协调仍是最难弥合的差距。

WorkArena 的 33 个 ServiceNow 任务显示 GPT-4o 总体 42.7%,但列表筛选为 0%,这是结构化 UI 交互必须跨越的高墙。

τ-bench 发现顶尖大模型在零售工具调用任务上从 pass@1 的 0.692 降至 pass@4 的 0.462。在账本上执行写回的智能体也面临同样的稳定性悬崖。

Chain-of-Table 在 WikiTQ 上达 67.31%,纯文本思维链为 61.48%,在超过 4,000 token 的表格上领先 10.25 个点。

TableLlama 在列类型标注上胜过 GPT-4(F1 94 对 32),但在 WikiTQ 组合推理上落后 33 个点。

TAPAS 通过选择单元格回答表格问题,从不生成 SQL。它适合小型 Beancount 账本查询,但在规模扩大时会失效。