
LLMエージェントはCFOになれるのか?EnterpriseArenaによる132ヶ月のシミュレーションで明らかになった大きな格差
EnterpriseArenaの132ヶ月CFO実行で80%生き残ったのはQwen3.5-9Bのみ。GPT-5.4とDeepSeek-V3.1は0%だった。台帳照合の省略が失敗の原因だ。
#automation

EnterpriseArenaの132ヶ月CFO実行で80%生き残ったのはQwen3.5-9Bのみ。GPT-5.4とDeepSeek-V3.1は0%だった。台帳照合の省略が失敗の原因だ。

WildToolBenchは、1,024件の実ユーザータスクでセッション精度15%を超えるLLMはなく、隠れた意図と指示の遷移が最も鋭い失敗モードと判明。

JSONSchemaBenchは、カバレッジが単純スキーマの86%から複雑なものでは3%へ崩壊し、LLMの構造化出力が非準拠JSONを静かに出力しうると判明。

FinMCP-Benchは6つのLLMの最高が613件の実MCP財務タスクで完全一致わずか3.08%と評価。単一ツールからマルチターンで20倍の崩壊だ。

FinTraceは、最先端LLMが正しい財務ツールを選ぶ(F1約0.9)一方、結果の利用は3.23/5にとどまり、書き戻しエージェントを破綻させる工程だと示す。

FinToolBenchは、テストされた全LLMで意図の不一致が50%超と判明。積極的なツール呼び出しは財務タスクでの良い回答を意味しない。

OmniEvalは5種類の財務タスクで最高のRAGシステムを数値精度36%と評価。台帳エージェントは記帳前に検証が必要だ。

LLMの注意重みから位置バイアスを差し引くと、根拠が文脈中間にある場合にRAG精度が最大15ポイント回復し、財務エージェントのパイプラインを支援する。

ReDActはパープレキシティが不確実性を示す場合のみ小モデルから大モデルへ延期し、エージェントワークフローで同等精度を保ちコストを64%削減する。

OpenHandsのCodeActエージェントはSWE-Bench Liteで26%を記録し、AIエージェントが今日確実にできることを示す。財務自動化は自律型ではなく、狭い範囲から始めるべきだ。

TableMasterはGPT-4o-miniでWikiTQの78.13%を達成し、Chain-of-Tableを13ポイント上回る。table-of-focusと適応的推論により、Beancount台帳上のエージェントを実現。

GPT-4はODDSゼロショットで平均AUROC 74.1に達し、75.5のECODベースラインに近づくが高分散データでは失敗。台帳監査は未解決だ。