
당신의 에이전트가 이 장부를 맞출 수 있나요?
한 에이전트 실행이 3행 원장을 2958.50 USD 당좌와 1958.50 USD 9월 이익으로 대사했고, 스스로 진단한 실패 하나에서 복구했다.
#reconciliation
언어 모델 에이전트를 활용한 자동 원장 대사

한 에이전트 실행이 3행 원장을 2958.50 USD 당좌와 1958.50 USD 9월 이익으로 대사했고, 스스로 진단한 실패 하나에서 복구했다.

FinRAGBench-V는 최고 모델도 금융 페이지에서 블록 수준 인용 리콜 20–61%에 그친다고 밝힌다. 멀티모달 검색이 텍스트 전용보다 약 50포인트 앞선다.

EnterpriseArena의 132개월 CFO 실행에서 Qwen3.5-9B만 80%를 통과했고 GPT-5.4와 DeepSeek-V3.1은 0%였다. 원장 대사 누락이 실패 원인이다.

FinMCP-Bench는 6개 LLM 중 최고가 실제 MCP 금융 과제 613건에서 정확 일치 3.08%에 그쳐, 단일 도구에서 다중 턴으로 20배 급락했다.

LLM 어텐션 가중치에서 위치 편향을 빼면 근거가 문맥 중간에 있을 때 RAG 정확도 최대 15포인트를 회복해 금융 에이전트 파이프라인에 도움이 된다.

Fin-RATE는 LLM 정확도가 종단 추적에서 18.60%로 급락하며, 병목은 모델이 아니라 검색 파이프라인임을 보여준다.

보이저의 영구 코드 스킬 라이브러리는 미세 조정 없이 이전 최고 성능(SOTA)보다 3.3배 많은 마인크래프트 아이템을 발견합니다—원장 에이전트가 필요한 재사용 패턴입니다.

AutoGen의 두 에이전트 대화는 MATH 정확도를 55%에서 69%로 끌어올리고, SafeGuard 에이전트는 안전하지 않은 코드 탐지에서 최대 35 F1 포인트를 더한다.

CodeAct는 JSON 도구 호출을 실행 가능한 파이썬으로 대체하여 GPT-4 에이전트 성공률을 약 20점 높이고 턴 수를 30% 줄인다.

CRITIC은 LLM 수정안을 자기 자신이 아닌 외부 도구로 검증하여 오픈 도메인 QA에서 7.7 F1을 높이고 유해성을 79.2% 줄인다.

ReAct는 추론과 도구 행동을 교차시켜 사실 검증에서 순수 CoT를 34점 앞선다. 그 실패 양상은 Beancount 원장에 기록하는 에이전트를 규정한다.