
WildToolBench: なぜ現実世界のツール利用においてLLMのセッション精度は15%を超えないのか
WildToolBenchは、1,024件の実ユーザータスクでセッション精度15%を超えるLLMはなく、隠れた意図と指示の遷移が最も鋭い失敗モードと判明。
#technology

WildToolBenchは、1,024件の実ユーザータスクでセッション精度15%を超えるLLMはなく、隠れた意図と指示の遷移が最も鋭い失敗モードと判明。

LLMは答えが文脈の中間にあると最大20ポイント低くスコアリングするため、金融RAGパイプラインは最良の箇所を最初か最後に配置すべきだ。

OSWorldはデスクトップAIエージェントが実タスクの12.24%で成功、人間は72.36%。失敗の75%は推論ではなく視覚運動のグラウンディングに起因する。

StructRAGは各クエリをテーブル、グラフ、カタログ、アルゴリズム、またはチャンク構造にルーティングし、GraphRAGを28ポイント上回り、22倍高速に動作する。

等しい思考トークン予算の下では、シングルエージェントLLMはマルチホップ推論においてマルチエージェントシステムに匹敵するかそれを上回り、よりシンプルな金融エージェント設計が有利です。

Self-RAGはいつ検索するか、結果を自己採点するかをLLMに学習させ、PopQAで55.8%、FactScoreで80.2を達成し、5つのベンチマークでChatGPTを上回ります。

AgentBenchはGPT-4が4.01、最高のオープンソースLLMが0.96と採点。これらの失敗は、稼働中の台帳でBeancount書き戻しエージェントを壊すものそのものです。

MemGPTのOS型メモリ階層がGPT-4のマルチセッションチャット精度を32.1%の固定コンテキストから92.5%に向上—複数年台帳エージェントに必須。