
FinRAGBench-V: 금융 도메인의 시각적 인용을 포함한 멀티모달 RAG
FinRAGBench-V는 최고 모델도 금융 페이지에서 블록 수준 인용 리콜 20–61%에 그친다고 밝힌다. 멀티모달 검색이 텍스트 전용보다 약 50포인트 앞선다.
#financial-reporting
언어 모델을 활용한 재무 보고서 생성 및 감사

FinRAGBench-V는 최고 모델도 금융 페이지에서 블록 수준 인용 리콜 20–61%에 그친다고 밝힌다. 멀티모달 검색이 텍스트 전용보다 약 50포인트 앞선다.

Fin-RATE는 LLM 정확도가 종단 추적에서 18.60%로 급락하며, 병목은 모델이 아니라 검색 파이프라인임을 보여준다.

FinDER의 실제 애널리스트 질의 5,703건에서 최고 RAG의 10-K 근거 리콜은 25.95%에 그친다. 임베딩 교체보다 약어 정규화가 먼저다.

DocFinQA는 FinQA의 700단어 지문을 전체 SEC 공시로 교체해, 175배 긴 컨텍스트에서 GPT-4의 장문 정확도를 거의 절반으로 떨어뜨립니다.

FinAuditing은 최상위 LLM이 실제 SEC XBRL 공시의 재무 산술 검증에서 겨우 13.86%를 기록해, AI 회계 도구가 단독으로 자동화할 수 있는 범위를 제한함을 보여준다.

TAT-LLM은 LLaMA 2 7B를 FinQA에서 EM 64.60%로 파인튜닝해 GPT-4의 63.91%를 앞선다. 추출-추론-실행 파이프라인으로 소형 모델이 표 산술을 수행한다.

MultiHiertt는 10,440개 재무 QA 쌍에서 모델이 38% F1을 기록한 반면 인간은 87%였고, 교차 표 질문에서는 15포인트 하락함을 보여준다.

ConvFinQA의 최고 모델은 실행 정확도 68.9%로 인간 전문가의 89.4%에 비해 21포인트 격차를 보이며, 다중 턴 원장 채팅이 여전히 해결해야 할 과제입니다.

TAT-QA의 표-텍스트 혼합 질문은 금융 AI의 병목이 산술이 아니라 근거 접지임을 보여줬다. 파인튜닝된 7B LLM은 2024년까지 83% F1을 기록했다.

FinQA는 신경망 모델이 재무 보고서 산술에서 61%를 기록한 반면 인간 전문가는 91%였고, 3단계 이상 프로그램에서는 22%로 급락했음을 밝혔다.

FinanceBench는 10,231개의 실제 SEC 공시 질문으로 16개 AI 구성을 테스트했는데, 공유 벡터 저장소 RAG는 19%만 정답을 맞혀 검색이 병목이 아님을 보여준다.

PHANTOM(NeurIPS 2025)은 실제 SEC 공시에서 LLM 환각 탐지를 측정한다. Qwen3-30B는 F1=0.882로 앞서지만, 7B 모델은 거의 무작위로 추측한다.