
LLM 에이전트를 위한 불확실성 기반 위임: 소형 모델에서 대형 모델로 전환하는 시점
ReDAct는 퍼플렉서티가 불확실성을 알릴 때만 소형 모델에서 대형 모델로 지연시켜, 에이전트 워크플로에서 동일 정확도로 비용을 64% 절감합니다.
Bean Labs의 공개 실험과 연구 결과 — Beancount.io의 Finance AI Agent 연구 이니셔티브.

ReDAct는 퍼플렉서티가 불확실성을 알릴 때만 소형 모델에서 대형 모델로 지연시켜, 에이전트 워크플로에서 동일 정확도로 비용을 64% 절감합니다.

OpenHands의 CodeAct 에이전트는 SWE-Bench Lite에서 26%를 기록해 오늘날 AI 에이전트의 실제 역량을 보여준다. 금융 자동화는 자율보다 좁은 범위로 시작해야 한다.

Fin-RATE는 LLM 정확도가 종단 추적에서 18.60%로 급락하며, 병목은 모델이 아니라 검색 파이프라인임을 보여준다.

FinDER의 실제 애널리스트 질의 5,703건에서 최고 RAG의 10-K 근거 리콜은 25.95%에 그친다. 임베딩 교체보다 약어 정규화가 먼저다.

LLM은 답이 컨텍스트 중간에 있을 때 최대 20점 더 낮은 점수를 받으므로, 금융 RAG 파이프라인은 최상의 구절을 처음이나 끝에 배치해야 합니다.

AD-LLM에 따르면 GPT-4o는 텍스트 이상 탐지에서 제로샷으로 0.93–0.99 AUROC를 달성하지만, LLM 모델 선택은 금융 감사 AI에 여전히 신뢰할 수 없습니다.

CausalTAD는 LLM 직렬화 전에 인과 의존성에 따라 테이블 열을 재정렬해 AnoLLM 대비 평균 AUC-ROC를 0.803에서 0.834로 높입니다.

AnoLLM은 LLM 부정 로그우도로 행을 점수화해 혼합형 사기 데이터에서 고전 베이스라인을 능가하지만, 순수 수치 테이블에서는 우위를 더하지 못합니다.

LLMFinLiteracy는 약 7B 모델 5종이 올바른 Beancount 분개를 작성한 비율이 2.3%에 그치며, 문법이 아닌 회계 추론에서 실패한다고 밝힌다.

TableMaster는 GPT-4o-mini로 WikiTQ에서 78.13%를 달성해 Chain-of-Table보다 13점 앞서며, Beancount 장부 위 에이전트를 위한 table-of-focus와 적응형 추론을 사용합니다.

GPT-4는 ODDS 제로샷에서 평균 AUROC 74.1을 달성해 ECOD 베이스라인 75.5에 근접하지만 고분산 데이터에서 실패합니다. 장부 감사는 아직 해결되지 않았습니다.

DocFinQA는 FinQA의 700단어 지문을 전체 SEC 공시로 교체해, 175배 긴 컨텍스트에서 GPT-4의 장문 정확도를 거의 절반으로 떨어뜨립니다.