
당신의 에이전트가 이 장부를 맞출 수 있나요?
한 에이전트 실행이 3행 원장을 2958.50 USD 당좌와 1958.50 USD 9월 이익으로 대사했고, 스스로 진단한 실패 하나에서 복구했다.
#plain-text-accounting
플레인텍스트 회계 형식과 워크플로에 기반한 연구

한 에이전트 실행이 3행 원장을 2958.50 USD 당좌와 1958.50 USD 9월 이익으로 대사했고, 스스로 진단한 실패 하나에서 복구했다.

ReDAct는 퍼플렉서티가 불확실성을 알릴 때만 소형 모델에서 대형 모델로 지연시켜, 에이전트 워크플로에서 동일 정확도로 비용을 64% 절감합니다.

OpenHands의 CodeAct 에이전트는 SWE-Bench Lite에서 26%를 기록해 오늘날 AI 에이전트의 실제 역량을 보여준다. 금융 자동화는 자율보다 좁은 범위로 시작해야 한다.

LLMFinLiteracy는 약 7B 모델 5종이 올바른 Beancount 분개를 작성한 비율이 2.3%에 그치며, 문법이 아닌 회계 추론에서 실패한다고 밝힌다.

TableMaster는 GPT-4o-mini로 WikiTQ에서 78.13%를 달성해 Chain-of-Table보다 13점 앞서며, Beancount 장부 위 에이전트를 위한 table-of-focus와 적응형 추론을 사용합니다.

τ²-bench는 자체 도구를 가진 활성 사용자가 대화형 에이전트 성공률을 18–25점 낮춘다고 밝힙니다. 쓰기 권한을 공유하는 Beancount 에이전트도 같은 방식으로 손실을 봅니다.

GAIA의 466개 작업에서 최전선 AI 에이전트는 74.55%로 인간의 92%에 못 미치며, Level 3 조정이 여전히 가장 어려운 격차입니다.

WorkArena의 33개 ServiceNow 작업에서 GPT-4o는 전체 42.7%지만 목록 필터에서는 0%로, 구조화된 UI 상호작용이 넘어야 할 벽을 보여줍니다.

τ-bench에 따르면 최상위 LLM은 소매 도구 사용 작업에서 pass@1 0.692에서 pass@4 0.462로 하락합니다. 장부에 쓰기하는 에이전트도 같은 일관성 절벽에 직면합니다.

Chain-of-Table은 WikiTQ에서 67.31%를 기록해 텍스트 전용 chain-of-thought의 61.48%를 앞서며, 4,000 토큰 초과 테이블에서 10.25점 차로 앞섭니다.

TableLlama beats GPT-4 on column type annotation (F1 94 vs 32) but trails by 33 points on WikiTQ compositional reasoning.

TAPAS는 SQL을 생성하지 않고 셀을 선택해 테이블 질문에 답합니다. 소규모 Beancount 장부 쿼리에는 맞지만 규모가 커지면 무너집니다.