
FinMCP-Bench: MCP下での実世界の金融ツール利用に向けたLLMエージェントのベンチマーク
FinMCP-Benchは6つのLLMの最高が613件の実MCP財務タスクで完全一致わずか3.08%と評価。単一ツールからマルチターンで20倍の崩壊だ。
#fintech

FinMCP-Benchは6つのLLMの最高が613件の実MCP財務タスクで完全一致わずか3.08%と評価。単一ツールからマルチターンで20倍の崩壊だ。

FinTraceは、最先端LLMが正しい財務ツールを選ぶ(F1約0.9)一方、結果の利用は3.23/5にとどまり、書き戻しエージェントを破綻させる工程だと示す。

FinToolBenchは、テストされた全LLMで意図の不一致が50%超と判明。積極的なツール呼び出しは財務タスクでの良い回答を意味しない。

BloombergGPTは569Bの金融トークンで訓練されましたが、金融事前訓練なしのGPT-4が同等でした。会計エージェントにはモデル内部よりツール利用が有効です。