
LLM 에이전트가 CFO가 될 수 있을까? EnterpriseArena의 132개월 시뮬레이션이 보여주는 거대한 격차
EnterpriseArena의 132개월 CFO 실행에서 Qwen3.5-9B만 80%를 통과했고 GPT-5.4와 DeepSeek-V3.1은 0%였다. 원장 대사 누락이 실패 원인이다.
#automation
금융 데이터 처리 워크플로를 위한 자동화 기법과 도구

EnterpriseArena의 132개월 CFO 실행에서 Qwen3.5-9B만 80%를 통과했고 GPT-5.4와 DeepSeek-V3.1은 0%였다. 원장 대사 누락이 실패 원인이다.

WildToolBench는 실제 사용자 과제 1,024건에서 어떤 LLM도 세션 정확도 15%를 넘지 못하며, 숨은 의도와 지시 전환이 가장 심각한 실패 유형이라고 밝힌다.

JSONSchemaBench는 커버리지가 단순 스키마의 86%에서 복잡 스키마의 3%로 급락하며, LLM 구조화 출력이 조용히 비준수 JSON을 낼 수 있음을 밝힌다.

FinMCP-Bench는 6개 LLM 중 최고가 실제 MCP 금융 과제 613건에서 정확 일치 3.08%에 그쳐, 단일 도구에서 다중 턴으로 20배 급락했다.

FinTrace는 최신 LLM이 올바른 금융 도구를 고르지만(F1 약 0.9) 결과 활용 점수는 3.23/5에 그쳐, 이 단계가 쓰기 에이전트를 무너뜨린다고 본다.

FinToolBench는 테스트한 모든 LLM에서 의도 불일치가 50%를 넘어, 공격적 도구 호출이 금융 과제에서 더 나은 답을 뜻하지 않음을 보여준다.

OmniEval은 최고 RAG 시스템이 5개 금융 과제 유형에서 수치 정확도 36%에 그친다고 평가한다. 원장 에이전트는 분개 전 검증이 필요하다.

LLM 어텐션 가중치에서 위치 편향을 빼면 근거가 문맥 중간에 있을 때 RAG 정확도 최대 15포인트를 회복해 금융 에이전트 파이프라인에 도움이 된다.

ReDAct는 퍼플렉서티가 불확실성을 알릴 때만 소형 모델에서 대형 모델로 지연시켜, 에이전트 워크플로에서 동일 정확도로 비용을 64% 절감합니다.

OpenHands의 CodeAct 에이전트는 SWE-Bench Lite에서 26%를 기록해 오늘날 AI 에이전트의 실제 역량을 보여준다. 금융 자동화는 자율보다 좁은 범위로 시작해야 한다.

TableMaster는 GPT-4o-mini로 WikiTQ에서 78.13%를 달성해 Chain-of-Table보다 13점 앞서며, Beancount 장부 위 에이전트를 위한 table-of-focus와 적응형 추론을 사용합니다.

GPT-4는 ODDS 제로샷에서 평균 AUROC 74.1을 달성해 ECOD 베이스라인 75.5에 근접하지만 고분산 데이터에서 실패합니다. 장부 감사는 아직 해결되지 않았습니다.