
FinMCP-Bench:MCP 架构下真实世界金融工具使用的大语言模型代理基准测试
FinMCP-Bench在613个真实MCP金融任务上,六个LLM中最佳者精确匹配率仅为3.08%,从单工具到多轮使用骤降20倍。
#fintech

FinMCP-Bench在613个真实MCP金融任务上,六个LLM中最佳者精确匹配率仅为3.08%,从单工具到多轮使用骤降20倍。

FinTrace显示,前沿LLM能选对金融工具(F1约0.9),但在使用结果上仅得3.23/5,这正是写回智能体崩溃的环节。

FinToolBench发现,所有受测LLM的意图不匹配率均超过50%,因此激进的工具调用并不意味着在金融任务上有更好的答案。

BloombergGPT 在 569B 金融 token 上训练,但未经金融预训练的 GPT-4 也能匹敌。对会计代理而言,工具使用胜过模型内部能力。