
TAT-QA: 재무 연례 보고서 추론을 위한 하이브리드 표-텍스트 질의응답 벤치마크
TAT-QA는 하이브리드 표-텍스트 금융 보고서 맥락에 대한 16,552개의 질문으로 구성된 벤치마크로, 금융 AI의 핵심 병목 현상이 산술 능력이 아닌 근거 도출(evidence grounding)임을 보여주었습니다. 2024년까지 미세 조정된 7B LLM은 F1 점수 83%에 도달하며 인간의 한계치인 91%와의 격차를 대부분 좁혔습니다.

TAT-QA는 하이브리드 표-텍스트 금융 보고서 맥락에 대한 16,552개의 질문으로 구성된 벤치마크로, 금융 AI의 핵심 병목 현상이 산술 능력이 아닌 근거 도출(evidence grounding)임을 보여주었습니다. 2024년까지 미세 조정된 7B LLM은 F1 점수 83%에 도달하며 인간의 한계치인 91%와의 격차를 대부분 좁혔습니다.

FinQA(EMNLP 2021)는 다단계 산술 프로그램이 필요한 S&P 500 실적 보고서에서 8,281개의 질의응답 쌍을 구축했습니다. 발표 당시 신경망 모델은 61%를 기록한 반면 인간 전문가는 91%를 기록했습니다. 3단계 이상의 프로그램에서는 정확도가 22%로 급락합니다. 도메인 상수, 교차 모달리티 근거 제시, 체인 길이 등 실패 모드는 오늘날 Beancount 에이전트가 직면한 과제와 직접적으로 연결됩니다.

FinanceBench는 실제 SEC 공시를 바탕으로 한 10,231개의 질문을 통해 16가지 AI 구성을 평가합니다. 공유 벡터 저장소 RAG는 정답률이 19%에 불과하며, 오라클 패시지를 사용한 GPT-4-Turbo조차 85% 정확도에 그쳤습니다. 이는 기업용 금융 AI의 핵심 제약 사항이 검색이 아닌 수치 추론임을 보여줍니다.

DSPy는 수작업으로 작성된 프롬프트 문자열을 선언적 시그니처와 메트릭 기반 컴파일러로 대체합니다. 이를 통해 GSM8K 수학 추론에서 Llama2-13b의 성능을 9.4%에서 46.9%로 끌어올렸으며, 운영 환경의 금융 AI 파이프라인을 위한 더 유지보수가 용이한 경로를 제공합니다.

LATS(Language Agent Tree Search, ICML 2024)는 ReAct, Tree of Thoughts, Reflexion을 단일 MCTS 프레임워크로 통합하여 GPT-4로 HumanEval에서 92.7% pass@1을 달성합니다. git 기반 Beancount 원장의 경우, 프로덕션에서 LATS를 제약하는 상태 되돌림 요구사항은 사소하게 충족됩니다.

Self-RAG (ICLR 2024 Oral)는 언어 모델이 검색 시점을 결정하고 4개의 성찰 토큰을 사용하여 결과를 직접 평가하도록 훈련합니다. PopQA에서 55.8%, 전기 부문 FactScore 80.2를 기록하며 5개 벤치마크에서 ChatGPT를 능가했습니다. 이 분석은 메커니즘, 절제 연구 결과, 재현성 한계, 그리고 Beancount 장부를 다루는 금융 AI 에이전트에 미치는 영향을 다룹니다.

보이저의 영구 코드 스킬 라이브러리는 미세 조정 없이 이전 최고 성능(SOTA)보다 3.3배 많은 마인크래프트 아이템을 발견합니다—원장 에이전트가 필요한 재사용 패턴입니다.

HippoRAG의 OpenIE+PageRank 메모리는 2WikiMultiHopQA에서 68.2% ColBERTv2 대비 89.1% Recall@5를 달성—다년도 원장을 위한 경로 인식 검색.

AgentBench (Liu 외, ICLR 2024)는 8개의 상호작용 환경에서 27개의 LLM을 벤치마킹했다 — GPT-4는 종합 4.01점을 기록한 반면, 최고의 오픈소스 모델은 0.96점에 그쳤다. 세 가지 주요 실패 유형(지식 그래프 실패의 67.9%에서 태스크 한도 초과, 데이터베이스 실패의 53.3%에서 형식 오류, 그리고 잘못된 액션)은 실제 장부에 Beancount write-back 에이전트를 배포할 때의 위험과 직접적으로 대응한다.

Bloomberg는 5,690억 개의 금융 데이터 토큰으로 500억 개의 파라미터를 가진 LLM을 학습시켜 감성 분석 및 표 추론 벤치마크에서 일반 모델을 압도했습니다. 그러나 이후 GPT-4가 금융 특화 사전 학습 없이도 이 성능을 따라잡았습니다. 1,000만 달러 규모의 이 실험이 도메인 사전 학습의 트레이드오프, 숫자의 토큰화, 그리고 왜 회계 에이전트에게 모델 내부 정보보다 도구 사용 기능이 더 신뢰할 수 있는지를 보여주는 바를 살펴봅니다.

AutoGen(Wu et al., 2023)은 LLM 기반 에이전트들이 메시지를 주고받으며 작업을 완료하는 멀티 에이전트 대화 프레임워크를 소개합니다. 2개 에이전트 구성으로 MATH 벤치마크 정확도를 55%에서 69%로 높였으며, 전용 SafeGuard 에이전트는 안전하지 않은 코드 탐지 성능을 최대 35 F1 포인트 개선했습니다. 이러한 결과는 안전하고 모듈화된 Beancount 자동화 파이프라인 구축에 직접적으로 적용될 수 있습니다.

Gorilla(Patil et al., NeurIPS 2024)는 리트리버 인식 학습(Retriever-Aware Training)을 통해 검색된 API 문서로 7B LLaMA 모델을 파인튜닝하여, GPT-4 제로샷 대비 환각률을 78%에서 11%로 낮췄습니다. 이는 잘못된 계정 이름이나 뒤바뀐 부호가 단순한 불편함을 넘어 정확성 실패로 이어지는 금융 AI 라이트백(write-back) 에이전트에 직접적인 시사점을 제공합니다.