
LLM 智能体能担任 CFO 吗?EnterpriseArena 132 个月的模拟揭示了巨大差距
只有Qwen3.5-9B在EnterpriseArena的132个月CFO运行中存活80%,而GPT-5.4和DeepSeek-V3.1均为0%。跳过账本对账导致失败。
#forecasting

只有Qwen3.5-9B在EnterpriseArena的132个月CFO运行中存活80%,而GPT-5.4和DeepSeek-V3.1均为0%。跳过账本对账导致失败。

InvestorBench:Qwen2.5-72B以46.15%的CR引领股票交易;金融调优的Palmyra-Fin在股票上适得其反——规模胜过领域微调。

NeurIPS 2024 消融实验:从 Time-LLM 和 CALF 中去掉 LLM 反而提升准确率,训练速度最多快 1,383 倍。金融 AI 应使用专用模型。

FinBen 发现 GPT-4 在 FinQA 上精确匹配为 0.63,在股票预测上为 0.54,仅略高于随机,因此会计代理需要验证,而非原始 LLM 计算。