
LLM 에이전트가 CFO가 될 수 있을까? EnterpriseArena의 132개월 시뮬레이션이 보여주는 거대한 격차
EnterpriseArena의 132개월 CFO 실행에서 Qwen3.5-9B만 80%를 통과했고 GPT-5.4와 DeepSeek-V3.1은 0%였다. 원장 대사 누락이 실패 원인이다.
#forecasting
AI 에이전트를 활용한 재무 예측 및 런웨이 모델링

EnterpriseArena의 132개월 CFO 실행에서 Qwen3.5-9B만 80%를 통과했고 GPT-5.4와 DeepSeek-V3.1은 0%였다. 원장 대사 누락이 실패 원인이다.

InvestorBench: Qwen2.5-72B가 46.15%의 CR로 주식 거래를 선도; 금융 특화 Palmyra-Fin은 주식에서 역효과—크기가 도메인 파인튜닝을 이긴다.

NeurIPS 2024 제거 실험: Time-LLM과 CALF에서 LLM을 제거하면 정확도가 향상되고 학습 속도는 최대 1,383배 빨라진다. 금융 AI에는 전용 모델을 사용하라.

FinBen은 GPT-4가 FinQA에서 정확 일치 0.63, 주가 예측에서 0.54로 무작위에 겨우 앞선다고 본다. 따라서 회계 에이전트는 순수 LLM 계산이 아닌 검증이 필요하다.