
FinToolBench: 실제 금융 도구 사용에 대한 LLM 에이전트 평가
FinToolBench는 760개의 실제 금융 API 도구와 295개의 실행 가능한 쿼리를 결합하여 실제 금융 작업에서 LLM 에이전트를 벤치마킹합니다. GPT-4o의 보수적인 22.7% 호출률이 더 높은 답변 품질(CSS 0.670)을 제공하는 반면, Qwen3-8B의 공격적인 87.1% TIR은 낮은 정확도를 보이며, 모든 테스트 모델에서 의도 불일치율이 50%를 초과합니다.





