
WildToolBench:为何在真实世界工具调用中没有 LLM 的会话准确率能超过 15%
WildToolBench发现,在1,024个真实用户任务上,没有LLM的会话准确率超过15%,隐藏意图和指令转换是最尖锐的失败模式。
#technology

WildToolBench发现,在1,024个真实用户任务上,没有LLM的会话准确率超过15%,隐藏意图和指令转换是最尖锐的失败模式。

当答案位于上下文中段时,LLM 得分最多会低 20 分,因此金融 RAG 流程应把最佳段落放在最前或最后。

OSWorld 发现桌面 AI 智能体在真实任务上的成功率为 12.24%,而人类为 72.36%,其中 75% 的失败源于视觉运动基础能力,而非推理。

StructRAG 将每个查询路由到表格、图、目录、算法或分块结构,比 GraphRAG 高 28 个点,速度还快 22 倍。

在相同的思考预算下,单代理LLM在多跳推理上等同于或超越多智能体系统——更倾向于简单的金融代理设计。

Self-RAG 训练 LLM 决定何时检索并自我评分,在 PopQA 上达到 55.8%,FactScore 达 80.2——在五项基准上超越 ChatGPT。

AgentBench 中 GPT-4 得分为 4.01,而最佳开源 LLM 仅为 0.96。这些失败正是让 Beancount 写回代理在真实账本上崩溃的原因。

MemGPT的类操作系统内存层级将GPT-4多会话聊天准确率提升至92.5%,而固定上下文仅为32.1%——这是多年账本代理所必需的。