
Beancount DSL 생성에서 LLM 점수 2.3%: LLMFinLiteracy 벤치마크
LLMFinLiteracy는 약 7B 모델 5종이 올바른 Beancount 분개를 작성한 비율이 2.3%에 그치며, 문법이 아닌 회계 추론에서 실패한다고 밝힌다.
#transaction-validation
언어 모델 에이전트를 활용한 금융 거래 검증 및 확인

LLMFinLiteracy는 약 7B 모델 5종이 올바른 Beancount 분개를 작성한 비율이 2.3%에 그치며, 문법이 아닌 회계 추론에서 실패한다고 밝힌다.

GuardAgent는 Python 코드를 실행해 LLM 에이전트 정책을 시행하여 작업 실패 없이 98.7% 정확도를 기록한 반면, 프롬프트 규칙은 81%에 최대 71% 실패율을 보였다.

다중 에이전트 토론은 산술에서 14.8포인트를 얻었지만 동일 예산의 단일 에이전트가 이에 맞먹는다. 이는 원장 커밋 전 안전 점검으로서의 토론을 제한한다.

CRITIC은 LLM 수정안을 자기 자신이 아닌 외부 도구로 검증하여 오픈 도메인 QA에서 7.7 F1을 높이고 유해성을 79.2% 줄인다.