
LLM 이상 탐지 서베이 (NAACL 2025): 강력한 분류 체계, 부족한 정형 데이터 커버리지
NAACL 2025 분류 체계는 유효하지만 표 데이터 커버리지가 없다. 금융 AI 팀은 비전 모델 기법을 직접 적용해야 한다.
#fraud-detection
금융 데이터에서 이상 징후나 부정 항목 탐지

NAACL 2025 분류 체계는 유효하지만 표 데이터 커버리지가 없다. 금융 AI 팀은 비전 모델 기법을 직접 적용해야 한다.

AD-LLM에 따르면 GPT-4o는 텍스트 이상 탐지에서 제로샷으로 0.93–0.99 AUROC를 달성하지만, LLM 모델 선택은 금융 감사 AI에 여전히 신뢰할 수 없습니다.

CausalTAD는 LLM 직렬화 전에 인과 의존성에 따라 테이블 열을 재정렬해 AnoLLM 대비 평균 AUC-ROC를 0.803에서 0.834로 높입니다.

AnoLLM은 LLM 부정 로그우도로 행을 점수화해 혼합형 사기 데이터에서 고전 베이스라인을 능가하지만, 순수 수치 테이블에서는 우위를 더하지 못합니다.

GPT-4는 ODDS 제로샷에서 평균 AUROC 74.1을 달성해 ECOD 베이스라인 75.5에 근접하지만 고분산 데이터에서 실패합니다. 장부 감사는 아직 해결되지 않았습니다.

AuditCopilot은 분개장 사기 오탐을 942건에서 12건으로 줄이지만, 제거 실험은 LLM이 주로 Isolation Forest 점수를 종합함을 보여준다.

사고 연쇄 프롬프팅은 정밀도를 높이지만 희귀 금융 이벤트에서 재현율을 떨어뜨릴 수 있어, 사기 탐지 에이전트가 마땅히 표시해야 할 이상 징후를 놓칠 수 있다.