본문으로 건너뛰기

#fintech

Fintech

Financial technology research, platforms, and infrastructure for modern accounting systems

FinToolBench: 실제 금융 도구 사용에 대한 LLM 에이전트 평가

FinToolBench는 760개의 실제 금융 API 도구와 295개의 실행 가능한 쿼리를 결합하여 실제 금융 작업에서 LLM 에이전트를 벤치마킹합니다. GPT-4o의 보수적인 22.7% 호출률이 더 높은 답변 품질(CSS 0.670)을 제공하는 반면, Qwen3-8B의 공격적인 87.1% TIR은 낮은 정확도를 보이며, 모든 테스트 모델에서 의도 불일치율이 50%를 초과합니다.

BloombergGPT와 금융 도메인 특화 LLM의 한계

Bloomberg는 5,690억 개의 금융 데이터 토큰으로 500억 개의 파라미터를 가진 LLM을 학습시켜 감성 분석 및 표 추론 벤치마크에서 일반 모델을 압도했습니다. 그러나 이후 GPT-4가 금융 특화 사전 학습 없이도 이 성능을 따라잡았습니다. 1,000만 달러 규모의 이 실험이 도메인 사전 학습의 트레이드오프, 숫자의 토큰화, 그리고 왜 회계 에이전트에게 모델 내부 정보보다 도구 사용 기능이 더 신뢰할 수 있는지를 보여주는 바를 살펴봅니다.