
你的智能体能否平衡这些账目?
一次智能体运行将三行账本对账至2958.50美元活期存款和1958.50美元9月利润,并从它自行诊断的一次失败中恢复。
#reconciliation

一次智能体运行将三行账本对账至2958.50美元活期存款和1958.50美元9月利润,并从它自行诊断的一次失败中恢复。

FinRAGBench-V发现,顶级模型在金融页面上仅达到20–61%的块级引用召回率。多模态检索比纯文本高出近50个百分点。

只有Qwen3.5-9B在EnterpriseArena的132个月CFO运行中存活80%,而GPT-5.4和DeepSeek-V3.1均为0%。跳过账本对账导致失败。

FinMCP-Bench在613个真实MCP金融任务上,六个LLM中最佳者精确匹配率仅为3.08%,从单工具到多轮使用骤降20倍。

当证据位于上下文中部时,从LLM注意力权重中减去位置偏差可恢复高达15个百分点的RAG准确率,有助于金融智能体流水线。

Fin-RATE 显示 LLM 在纵向追踪上的准确率骤降 18.60%,真正的瓶颈是检索流程,而非模型本身。

Voyager的持久代码技能库无需微调即可发现3.3倍于先前SOTA的Minecraft物品——这是账本智能体需要的重用模式。

AutoGen 的双智能体对话把 MATH 准确率从 55% 提升到 69%,其 SafeGuard 智能体在不安全代码检测上最多提升 35 个 F1 点。

CodeAct 用可执行 Python 替代 JSON 工具调用,让 GPT-4 智能体成功率提升约 20 个点,轮次减少 30%。

CRITIC 通过外部工具而非模型自身来验证 LLM 修订,使开放域问答 F1 提升 7.7,毒性降低 79.2%。

ReAct 将推理与工具操作交错进行,在事实验证上比纯思维链高出 34 个百分点。其失败模式塑造了写入 Beancount 账本的代理。