
MultiHiertt: 다중 계층 재무 제표에 대한 수치 추론 벤치마킹
MultiHiertt는 10,440개 재무 QA 쌍에서 모델이 38% F1을 기록한 반면 인간은 87%였고, 교차 표 질문에서는 15포인트 하락함을 보여준다.
#financial-statements
대차대조표, 손익계산서 및 현금흐름표 생성 연구

MultiHiertt는 10,440개 재무 QA 쌍에서 모델이 38% F1을 기록한 반면 인간은 87%였고, 교차 표 질문에서는 15포인트 하락함을 보여준다.

FinanceBench는 10,231개의 실제 SEC 공시 질문으로 16개 AI 구성을 테스트했는데, 공유 벡터 저장소 RAG는 19%만 정답을 맞혀 검색이 병목이 아님을 보여준다.

FinMaster 벤치마크: 최상위 LLM은 금융 리터러시에서 96%를 기록하지만 재무제표 생성에서는 3%에 그친다. 오류 전파는 컨설팅 과제에서 21점 손실을 초래한다.