본문으로 건너뛰기

연구 로그

Bean Labs의 공개 실험과 연구 결과 — Beancount.io의 Finance AI Agent 연구 이니셔티브.

WorkArena++: 복합적 기업 업무에서 인간과 AI 에이전트 간의 93% 성능 격차

WorkArena++ (NeurIPS 2024)는 세 가지 난이도 수준에 걸쳐 682개의 복합적 기업 업무를 벤치마킹합니다. GPT-4o는 이 중 2.1%만 해결하는 반면 인간은 93.9%를 해결하여, 현재의 AI 에이전트가 암시적 목표 지식 노동에서 실패하는 이유와 그 격차가 자율 회계 자동화에 중요한 이유를 정확히 규명합니다.

OSWorld: 인간이 72% 성공하는 작업에서 데스크톱 AI 에이전트의 성공률은 12%에 불과함

OSWorld (NeurIPS 2024)는 Ubuntu, Windows, macOS 전반에 걸친 369개의 실제 데스크톱 작업에서 멀티모달 AI 에이전트를 벤치마킹했습니다. 그 결과, 최고 모델(12.24%)과 인간의 성과(72.36%) 사이에 60%포인트의 격차가 있음을 발견했으며, 실패의 75%는 추론 실패가 아닌 시각운동 접지(visuomotor grounding) 오류 때문인 것으로 나타났습니다.

WorkArena: LLM 웹 에이전트가 실제 기업 지식 업무에서 보여주는 성능

WorkArena는 33개의 실제 ServiceNow 작업을 통해 LLM 웹 에이전트를 벤치마킹합니다. GPT-4o는 전체 42.7%의 성공률을 기록했지만 리스트 필터링 작업에서는 0%를 기록하며, 폼 입력과 구조화된 UI 상호작용 사이의 명확한 한계를 드러냈습니다. 이는 Beancount 장부 자동화의 도전 과제와 직접적으로 연결되는 문제입니다.

TAPAS: SQL 없는 약지도 학습 기반 테이블 질의응답과 Beancount에 주는 의미

TAPAS(Google Research, ACL 2020)는 SQL 생성 없이 셀을 선택하고 스칼라 집계를 적용하여 테이블 관련 질문에 답합니다. 이 포스트에서는 TAPAS의 아키텍처, 12포인트의 SQA 정확도 향상, 그리고 셀 선택 패러다임이 소규모 Beancount 장부 쿼리에는 적합하지만 대규모에서는 한계를 보이는 이유를 분석합니다.

MAC-SQL: 다중 에이전트 협업 텍스트-SQL(Text-to-SQL)

MAC-SQL(COLING 2025)은 스키마 축소를 위한 Selector, 질문 분해를 위한 Decomposer, 실행 가이드 기반 SQL 수정을 위한 Refiner라는 세 가지 전문 에이전트를 사용하여 BIRD 벤치마크에서 59.59%의 실행 정확도를 달성했습니다. 절제 연구(ablation study)에 따르면 Refiner가 가장 큰 기여(+4.63점)를 했으며, 이는 Beancount 장부 쿼리 생성에 직접적인 시사점을 제공합니다.