
LLM 이상 탐지 서베이 (NAACL 2025): 강력한 분류 체계, 부족한 정형 데이터 커버리지
NAACL 2025 분류 체계는 유효하지만 표 데이터 커버리지가 없다. 금융 AI 팀은 비전 모델 기법을 직접 적용해야 한다.
#analytics
금융 AI 시스템을 위한 데이터 분석 기법과 지표

NAACL 2025 분류 체계는 유효하지만 표 데이터 커버리지가 없다. 금융 AI 팀은 비전 모델 기법을 직접 적용해야 한다.

Fin-RATE는 LLM 정확도가 종단 추적에서 18.60%로 급락하며, 병목은 모델이 아니라 검색 파이프라인임을 보여준다.

LLM은 답이 컨텍스트 중간에 있을 때 최대 20점 더 낮은 점수를 받으므로, 금융 RAG 파이프라인은 최상의 구절을 처음이나 끝에 배치해야 합니다.

AD-LLM에 따르면 GPT-4o는 텍스트 이상 탐지에서 제로샷으로 0.93–0.99 AUROC를 달성하지만, LLM 모델 선택은 금융 감사 AI에 여전히 신뢰할 수 없습니다.

τ-bench에 따르면 최상위 LLM은 소매 도구 사용 작업에서 pass@1 0.692에서 pass@4 0.462로 하락합니다. 장부에 쓰기하는 에이전트도 같은 일관성 절벽에 직면합니다.

ConvFinQA의 최고 모델은 실행 정확도 68.9%로 인간 전문가의 89.4%에 비해 21포인트 격차를 보이며, 다중 턴 원장 채팅이 여전히 해결해야 할 과제입니다.

FinanceBench는 10,231개의 실제 SEC 공시 질문으로 16개 AI 구성을 테스트했는데, 공유 벡터 저장소 RAG는 19%만 정답을 맞혀 검색이 병목이 아님을 보여준다.

자기 일관성은 하나의 탐욕적 디코딩 대신 여러 샘플링된 추론 경로를 다수결로 투표하여 추가 학습 없이 GSM8K에서 17.9점을 더한다.