
당신의 에이전트가 이 장부를 맞출 수 있나요?
한 에이전트 실행이 3행 원장을 2958.50 USD 당좌와 1958.50 USD 9월 이익으로 대사했고, 스스로 진단한 실패 하나에서 복구했다.
Bean Labs의 공개 실험과 연구 결과 — Beancount.io의 Finance AI Agent 연구 이니셔티브.

한 에이전트 실행이 3행 원장을 2958.50 USD 당좌와 1958.50 USD 9월 이익으로 대사했고, 스스로 진단한 실패 하나에서 복구했다.

FinRAGBench-V는 최고 모델도 금융 페이지에서 블록 수준 인용 리콜 20–61%에 그친다고 밝힌다. 멀티모달 검색이 텍스트 전용보다 약 50포인트 앞선다.

EnterpriseArena의 132개월 CFO 실행에서 Qwen3.5-9B만 80%를 통과했고 GPT-5.4와 DeepSeek-V3.1은 0%였다. 원장 대사 누락이 실패 원인이다.

WildToolBench는 실제 사용자 과제 1,024건에서 어떤 LLM도 세션 정확도 15%를 넘지 못하며, 숨은 의도와 지시 전환이 가장 심각한 실패 유형이라고 밝힌다.

GPT-4의 언어화 신뢰도는 AUROC 약 62.7%로 거의 무작위 수준이다. 불확실성을 다루는 금융 에이전트에는 더 나은 캘리브레이션이 필요하다.

JSONSchemaBench는 커버리지가 단순 스키마의 86%에서 복잡 스키마의 3%로 급락하며, LLM 구조화 출력이 조용히 비준수 JSON을 낼 수 있음을 밝힌다.

FinMCP-Bench는 6개 LLM 중 최고가 실제 MCP 금융 과제 613건에서 정확 일치 3.08%에 그쳐, 단일 도구에서 다중 턴으로 20배 급락했다.

FinTrace는 최신 LLM이 올바른 금융 도구를 고르지만(F1 약 0.9) 결과 활용 점수는 3.23/5에 그쳐, 이 단계가 쓰기 에이전트를 무너뜨린다고 본다.

FinToolBench는 테스트한 모든 LLM에서 의도 불일치가 50%를 넘어, 공격적 도구 호출이 금융 과제에서 더 나은 답을 뜻하지 않음을 보여준다.

OmniEval은 최고 RAG 시스템이 5개 금융 과제 유형에서 수치 정확도 36%에 그친다고 평가한다. 원장 에이전트는 분개 전 검증이 필요하다.

NAACL 2025 분류 체계는 유효하지만 표 데이터 커버리지가 없다. 금융 AI 팀은 비전 모델 기법을 직접 적용해야 한다.

LLM 어텐션 가중치에서 위치 편향을 빼면 근거가 문맥 중간에 있을 때 RAG 정확도 최대 15포인트를 회복해 금융 에이전트 파이프라인에 도움이 된다.