
FinRAGBench-V: 금융 도메인의 시각적 인용을 포함한 멀티모달 RAG
FinRAGBench-V는 최고 모델도 금융 페이지에서 블록 수준 인용 리콜 20–61%에 그친다고 밝힌다. 멀티모달 검색이 텍스트 전용보다 약 50포인트 앞선다.
#data-science
금융 데이터셋과 회계 워크플로에 적용된 데이터 과학 방법론

FinRAGBench-V는 최고 모델도 금융 페이지에서 블록 수준 인용 리콜 20–61%에 그친다고 밝힌다. 멀티모달 검색이 텍스트 전용보다 약 50포인트 앞선다.

WildToolBench는 실제 사용자 과제 1,024건에서 어떤 LLM도 세션 정확도 15%를 넘지 못하며, 숨은 의도와 지시 전환이 가장 심각한 실패 유형이라고 밝힌다.

GPT-4의 언어화 신뢰도는 AUROC 약 62.7%로 거의 무작위 수준이다. 불확실성을 다루는 금융 에이전트에는 더 나은 캘리브레이션이 필요하다.

FinToolBench는 테스트한 모든 LLM에서 의도 불일치가 50%를 넘어, 공격적 도구 호출이 금융 과제에서 더 나은 답을 뜻하지 않음을 보여준다.

OmniEval은 최고 RAG 시스템이 5개 금융 과제 유형에서 수치 정확도 36%에 그친다고 평가한다. 원장 에이전트는 분개 전 검증이 필요하다.

NAACL 2025 분류 체계는 유효하지만 표 데이터 커버리지가 없다. 금융 AI 팀은 비전 모델 기법을 직접 적용해야 한다.

LLM 어텐션 가중치에서 위치 편향을 빼면 근거가 문맥 중간에 있을 때 RAG 정확도 최대 15포인트를 회복해 금융 에이전트 파이프라인에 도움이 된다.

Fin-RATE는 LLM 정확도가 종단 추적에서 18.60%로 급락하며, 병목은 모델이 아니라 검색 파이프라인임을 보여준다.

FinDER의 실제 애널리스트 질의 5,703건에서 최고 RAG의 10-K 근거 리콜은 25.95%에 그친다. 임베딩 교체보다 약어 정규화가 먼저다.

LLM은 답이 컨텍스트 중간에 있을 때 최대 20점 더 낮은 점수를 받으므로, 금융 RAG 파이프라인은 최상의 구절을 처음이나 끝에 배치해야 합니다.

AD-LLM에 따르면 GPT-4o는 텍스트 이상 탐지에서 제로샷으로 0.93–0.99 AUROC를 달성하지만, LLM 모델 선택은 금융 감사 AI에 여전히 신뢰할 수 없습니다.

CausalTAD는 LLM 직렬화 전에 인과 의존성에 따라 테이블 열을 재정렬해 AnoLLM 대비 평균 AUC-ROC를 0.803에서 0.834로 높입니다.