
FinRAGBench-V: 금융 도메인의 시각적 인용을 포함한 멀티모달 RAG
FinRAGBench-V는 최고 모델도 금융 페이지에서 블록 수준 인용 리콜 20–61%에 그친다고 밝힌다. 멀티모달 검색이 텍스트 전용보다 약 50포인트 앞선다.
#finance
회계 AI를 위한 금융 연구, 분석 및 도메인 지식

FinRAGBench-V는 최고 모델도 금융 페이지에서 블록 수준 인용 리콜 20–61%에 그친다고 밝힌다. 멀티모달 검색이 텍스트 전용보다 약 50포인트 앞선다.

GPT-4의 언어화 신뢰도는 AUROC 약 62.7%로 거의 무작위 수준이다. 불확실성을 다루는 금융 에이전트에는 더 나은 캘리브레이션이 필요하다.

FinTrace는 최신 LLM이 올바른 금융 도구를 고르지만(F1 약 0.9) 결과 활용 점수는 3.23/5에 그쳐, 이 단계가 쓰기 에이전트를 무너뜨린다고 본다.

OmniEval은 최고 RAG 시스템이 5개 금융 과제 유형에서 수치 정확도 36%에 그친다고 평가한다. 원장 에이전트는 분개 전 검증이 필요하다.

FinDER의 실제 애널리스트 질의 5,703건에서 최고 RAG의 10-K 근거 리콜은 25.95%에 그친다. 임베딩 교체보다 약어 정규화가 먼저다.

LLM은 답이 컨텍스트 중간에 있을 때 최대 20점 더 낮은 점수를 받으므로, 금융 RAG 파이프라인은 최상의 구절을 처음이나 끝에 배치해야 합니다.

AnoLLM은 LLM 부정 로그우도로 행을 점수화해 혼합형 사기 데이터에서 고전 베이스라인을 능가하지만, 순수 수치 테이블에서는 우위를 더하지 못합니다.

DocFinQA는 FinQA의 700단어 지문을 전체 SEC 공시로 교체해, 175배 긴 컨텍스트에서 GPT-4의 장문 정확도를 거의 절반으로 떨어뜨립니다.

TheAgentCompany는 시뮬레이션 인트라넷에서 175개 기업 작업을 벤치마크하며, 최고 모델 Gemini-2.5-Pro는 건당 $4로 30%만 완료합니다.

InvestorBench: Qwen2.5-72B가 46.15%의 CR로 주식 거래를 선도; 금융 특화 Palmyra-Fin은 주식에서 역효과—크기가 도메인 파인튜닝을 이긴다.

동일한 추론 토큰 예산에서 싱글 에이전트 LLM은 멀티 홉 추론에서 멀티 에이전트 시스템과 동등하거나 더 나은 성능을 보입니다—더 간단한 금융 에이전트 설계를 선호합니다.

M3MAD-Bench는 집단 망상이 다중 에이전트 토론 실패의 65%를 유발하고, 적대적 토론이 정확도를 최대 12.8% 떨어뜨린다는 것을 밝혔다.