Beancount書き戻しエージェントが実際に確実に実行する必要があるものを問うとき、答えは「テキストを生成する」ではなく、「構造化された環境で一連のアクションを脱線せずに実行する」です。AgentBench(Liuら、清華大学、ICLR 2024)は、その能力を大規模に測定しようとする最初の本格的な試みの1つであり、2023年のスナップショットは今でも抽出する価値のある教訓を含んでいます。
論文について
清華大学のXiao Liuと21人の共同執筆者によるAgentBenchは、LLMを受動的なテキスト生成器ではなく対話型エージェントとしてストレステストするように設計された8つの環境を定義しています。5つの環境はオリジナルです:OS(bash操作)、データベース(SQL生成とエラー回復)、ナレッジグラフ(ツールベースの構造化クエリ)、デジタルカードゲーム(多ラウンド戦略競争)、水平思考パズル(演繹的対話)。3つは既存のデータセットから適応されています:ALFWorldからのハウスホールディング、WebShopからのウェブショッピング、Mind2Webからのウェブブラウジング。論文は27のモデル — 商用APIモデルと70Bまでのオープンソースモデル — を、約4,000の開発分割と13,000のテスト分割の生成にわたって評価し、環境ごとの成功率と複合総合スコアの両方を報告しています。
主要なアイデア
- GPT-4が総合スコア4.01でリード。Claude-2は2.49、GPT-3.5-turboは2.32。提出時点で最強のオープンソースモデルであるCodeLlama-34Bはわずか0.96。APIモデルの平均は2.24、オープンソースモデルは0.42。
- GPT-4はOSで42.4%、データベースで32.0%、ハウスホールディングで78.0% — このばらつきは、どの環境が指示追従と構造化推論を報いるかを示しています。
- 「タスク上限超過」が支配的な障害モード:ナレッジグラフ障害の67.9%が、タスク解決前にステップ予算に達しています。これは知識不足ではなく、長期的推論の失敗です。
- フォーマット準拠エラーがデータベース障害の53.3%を占める — エージェントが構文的に無効なSQLを生成するか、評価者が解析できない散文でクエリを包み込みます。
- 無効なアクション選択がハウスホールディング障害の64.1%を引き起こす — エージェントが現在の状態で利用できないアクションを指定します。
- コード学習は「タスク間で相反する効果」を持つ:手順追従環境には役立つが、対話中心の環境での一般的な推論を損なう可能性があります。
有効なもの — そして無効なもの
コアな設計選択 — マルチ環境、マルチターン、対話型評価 — は正しく、まだ十分に活用されていません。ほとんどのLLMベンチマークは依然として単一ターンの生成品質を測定しています;AgentBenchは、タスクが完了するか予算が尽きるまでエージェントが意思決定を続けなければならないことを正しく主張しています。
とはいえ、このスナップショットは重要な点で時代遅れです。GPT-4(4.01)と最良のオープンソースモデル(0.96)の差は2023年半ばには憂慮すべきに見えましたが、2025年までにほぼ縮小しています。Llama 3.1 70BやQwen 2.5 72Bのようなモデルは、2年前には新しい障害だった指示追従とフォーマット準拠のハードルを現在はクリアしています。この論文を「オープンソースはエージェントタスクをできない」と読むのは間違いです;「フォーマット準拠と長期的な一貫性が難しい問題である」と読むのは依然として正しいです。
また、広さ対深さのトレードオフもあります。8つの環境は包括的に聞こえますが、それぞれ比較的浅いです。WebArena(Zhouら、2024)はウェブブラウジングだけで812の長期的テンプレートタスクをカバー;OSWorld(Xieら、2024)はUbuntuとWindows上の369の実際のデスクトップタスクをベンチマーク。AgentBenchは環境横断のシグナルを提供できますが、関心のある環境がわかったら、ドメイン固有のベンチマークを置き換えるものではありません。
表4の障害モード分類はおそらく最も永続的な貢献です。著者らは障害をタスク上限超過、フォーマットエラー、無効なアクション、およびその他いくつかに分類しています。これらは実装バグではなく、LLMが状態を維持し、利用可能なアクションを追跡し、マルチターン圧力下で解析可能な出力を生成する際の構造的な弱点です。真面目なエージェントシステムはこれらに対処する必要があります。
金融AIにとってこれが重要な理由
3つの支配的な障害モードは、Beancount書き戻しエージェントが壊れると私が予想する方法にほぼ直接対応します。
タスク上限超過は、台帳照合の障害モードです。複数の勘定科目にわたって期間を締めることは、期首残高の確認、借方と貸方の照合、差異の特定、修正案の提案を意味し、そのチェーンは簡単に10〜20ステップに及びます。チェーンの途中でコンテキストやステップ予算に達して諦めるエージェントは、優雅に失敗するだけでなく、台帳を部分的に変更された状態のまま残す可能性があります。
フォーマットエラーは、取引入力の障害モードです。Beancountには厳格な構文があります:不正な転記(通貨の欠落、誤ったインデント、無効なフラグ)はファイルを破損させるパーサーエラーです。Beancount出力の周りに散文を生成するエージェント、または正しく見える構文を間違った形式で生成するエージェントは役に立ちません。これはCRITIC論文の核心的な問題を、より厳格なドメインに適用したものです。
無効なアクションは、書き戻しの安全性の問題です。実台帳で動作するBeancountエージェントには限られた安全な操作セットがあります:取引の追加、フラグの修正、転記の移動。そのセット外のアクションを幻覚する — 例えば、未決済ポジションがある勘定科目を削除する — ことは、監査まで表面化しない可能性のある正確性の失敗です。
「コード学習が相反する効果を持つ」という発見も関連します。Beancount書き戻しは知識検索よりもコード生成に近いため、コード事前学習モデルは自然な適合のはずです。しかし、コード学習がマルチターン設定での対話追従を損なう場合、展開前にそれらのトレードオフを表面化するためにAgentBenchのようなハイブリッド評価が必要です。
次に読むべきもの
- WebArena(Zhouら、2024;arXiv:2307.13854)— ライブブラウザ環境での812のウェブブラウジングタスク;AgentBenchのウェブ層のより深いフォローアップ。
- OSWorld(Xieら、2024;NeurIPS 2024)— ファイルシステムとGUIタスクを含む完全なデスクトップ環境ベンチマーク;OSWorldのOS環境は、AgentBenchのOS層の直接の、より深い後継です。
- TAU-bench(Yaoら、2024)— 実際のツール使用とユーザーシミュレーションを用いて小売および航空API環境でエージェントを評価;Beancount台帳を環境として扱うことに最も近い公開ベンチマーク。





