
LLM 智能体能担任 CFO 吗?EnterpriseArena 132 个月的模拟揭示了巨大差距
只有Qwen3.5-9B在EnterpriseArena的132个月CFO运行中存活80%,而GPT-5.4和DeepSeek-V3.1均为0%。跳过账本对账导致失败。
#automation

只有Qwen3.5-9B在EnterpriseArena的132个月CFO运行中存活80%,而GPT-5.4和DeepSeek-V3.1均为0%。跳过账本对账导致失败。

WildToolBench发现,在1,024个真实用户任务上,没有LLM的会话准确率超过15%,隐藏意图和指令转换是最尖锐的失败模式。

JSONSchemaBench发现,覆盖率从简单模式的86%骤降至复杂模式的3%,因此LLM结构化输出可能静默发出不合规的JSON。

FinMCP-Bench在613个真实MCP金融任务上,六个LLM中最佳者精确匹配率仅为3.08%,从单工具到多轮使用骤降20倍。

FinTrace显示,前沿LLM能选对金融工具(F1约0.9),但在使用结果上仅得3.23/5,这正是写回智能体崩溃的环节。

FinToolBench发现,所有受测LLM的意图不匹配率均超过50%,因此激进的工具调用并不意味着在金融任务上有更好的答案。

OmniEval 给最佳 RAG 系统在 5 类金融任务上的数值准确率评分为 36%,因此账本智能体在写入分录前需要验证。

当证据位于上下文中部时,从LLM注意力权重中减去位置偏差可恢复高达15个百分点的RAG准确率,有助于金融智能体流水线。

ReDAct 仅在困惑度表明不确定时,才从小模型推迟到大模型,在保持准确率的同时将智能体工作流的成本降低 64%。

OpenHands 的 CodeAct 智能体在 SWE-Bench Lite 上得分 26%,展示了 AI 智能体如今可靠能做到什么。金融自动化应从严格限定范围开始,而非完全自主。

TableMaster 搭配 GPT-4o-mini 在 WikiTQ 上达到 78.13%,比 Chain-of-Table 高 13 个百分点,其方法是面向 Beancount 账本智能体的关注表加自适应推理。

GPT-4 在 ODDS 零样本任务上达到 74.1 的平均 AUROC,接近 75.5 的 ECOD 基线,但在高方差数据上失败。账本审计尚未解决。