
FinMCP-Bench: MCP 기반 실제 금융 도구 사용을 위한 LLM 에이전트 벤치마킹
FinMCP-Bench는 6개 LLM 중 최고가 실제 MCP 금융 과제 613건에서 정확 일치 3.08%에 그쳐, 단일 도구에서 다중 턴으로 20배 급락했다.
#fintech
현대 회계 시스템을 위한 금융 기술 연구, 플랫폼 및 인프라

FinMCP-Bench는 6개 LLM 중 최고가 실제 MCP 금융 과제 613건에서 정확 일치 3.08%에 그쳐, 단일 도구에서 다중 턴으로 20배 급락했다.

FinTrace는 최신 LLM이 올바른 금융 도구를 고르지만(F1 약 0.9) 결과 활용 점수는 3.23/5에 그쳐, 이 단계가 쓰기 에이전트를 무너뜨린다고 본다.

FinToolBench는 테스트한 모든 LLM에서 의도 불일치가 50%를 넘어, 공격적 도구 호출이 금융 과제에서 더 나은 답을 뜻하지 않음을 보여준다.

BloombergGPT는 569B 금융 토큰으로 학습했지만, 금융 사전 학습이 없는 GPT-4가 그에 필적했다. 회계 에이전트에는 모델 내부보다 도구 사용이 낫다.