본문으로 건너뛰기

Bean Labs 연구 로그

AgentBench: LLM을 에이전트로 평가하기 — 금융 AI 신뢰성을 위한 교훈

게시됨 마지막 업데이트 약 4분Mike ThriftMike Thrift
AgentBench: LLM을 에이전트로 평가하기 — 금융 AI 신뢰성을 위한 교훈

논문: https://arxiv.org/abs/2308.03688

이 페이지에서

Beancount write-back 에이전트가 실제로 어떤 것을 안정적으로 수행해야 하는지 물어볼 때, 답은 "텍스트 생성"이 아니라 "구조화된 환경에서 일련의 액션을 탈선 없이 실행하는 것"이다. AgentBench (Liu 외, 칭화대, ICLR 2024)는 그러한 능력을 대규모로 측정하려는 최초의 진지한 시도 중 하나이며, 2023년 스냅샷은 여전히 추출할 가치가 있는 교훈을 담고 있다.

논문 소개

칭화대학의 Xiao Liu와 공동 저자 21명이 작성한 AgentBench는 LLM을 수동적인 텍스트 생성기가 아닌 상호작용 에이전트로서 스트레스 테스트하기 위해 설계된 8개의 환경을 정의한다. 5개의 환경은 고유한 것이다: OS (bash 상호작용), Database (SQL 생성 및 오류 복구), Knowledge Graph (도구 기반 구조화 질의), Digital Card Game (다중 라운드 전략 경쟁), Lateral Thinking Puzzles (연역적 대화). 3개는 기존 데이터셋에서 차용했다: ALFWorld의 House-Holding, WebShop의 Web Shopping, Mind2Web의 Web Browsing. 이 논문은 dev 분할 약 4,000개와 test 분할 약 13,000개의 생성 결과에 걸쳐 상용 API 모델과 최대 70B 규모의 오픈소스 모델을 포함한 27개 모델을 평가하고, 환경별 성공률과 종합 점수를 모두 보고한다.

핵심 아이디어

  • GPT-4가 종합 점수 4.01로 선두를 차지한다. Claude-2는 2.49, GPT-3.5-turbo는 2.32를 기록했다. 제출 시점 기준 가장 강력한 오픈소스 모델인 CodeLlama-34B는 0.96에 불과했다. API 모델은 평균 2.24인 반면, 오픈소스 모델은 0.42에 그쳤다.
  • GPT-4는 OS에서 42.4%, Database에서 32.0%, House-Holding에서 78.0%를 기록했다 — 이러한 격차는 어떤 환경이 지시 따르기와 구조화된 추론 중 무엇을 더 중요하게 여기는지를 보여준다.
  • "태스크 한도 초과"가 지배적인 실패 유형이다: Knowledge Graph 실패의 67.9%가 태스크를 해결하기 전에 단계 예산을 소진했다. 이는 지식 부족이 아닌 장기 추론 실패이다.
  • 형식 준수 오류는 Database 실패의 53.3%를 차지한다 — 에이전트가 구문상 유효하지 않은 SQL을 생성하거나, 평가자가 파싱할 수 없는 산문 속에 쿼리를 감싼다.
  • 잘못된 액션 선택은 House-Holding 실패의 64.1%를 유발한다 — 에이전트가 현재 상태에서 사용할 수 없는 액션을 지정한다.
  • 코드 훈련은 "태스크에 따라 상반된 효과"를 가진다: 절차 추종 환경에는 도움이 되지만 대화 중심 환경의 일반적 추론에는 해가 될 수 있다.

유효한 부분 — 그리고 그렇지 않은 부분

핵심 설계 선택 — 다중 환경, 다중 턴, 상호작용 평가 — 은 옳으며 여전히 충분히 활용되지 않고 있다. 대부분의 LLM 벤치마크는 여전히 단일 턴 생성 품질을 측정한다; AgentBench는 에이전트가 태스크가 완료되거나 예산이 소진될 때까지 계속 결정을 내려야 한다는 점을 올바르게 강조한다.

그럼에도 불구하고, 이 스냅샷은 중요하게 구식이다. GPT-4(4.01)와 최고 오픈소스 모델(0.96) 사이의 격차는 2023년 중반에 놀라워 보였지만, 2025년까지는 대부분 좁혀졌다. Llama 3.1 70B나 Qwen 2.5 72B 같은 모델은 이제 2년 전에는 새로운 장애물이었던 지시 따르기와 형식 준수 장벽을 넘어선다. 이 논문을 "오픈소스는 에이전트 태스크를 수행할 수 없다"로 읽는 것은 실수가 될 것이다; "형식 준수와 장기 일관성이 어려운 문제다"로 읽는 것은 여전히 옳다.

또한 폭 대비 깊이의 트레이드오프가 있다. 8개의 환경이 포괄적으로 들리지만, 각각은 상대적으로 얕다. WebArena (Zhou 외, 2024)는 웹 브라우징만을 위해 812개의 장기 템플릿 태스크를 다룬다; OSWorld (Xie 외, 2024)는 Ubuntu와 Windows에서 369개의 실제 데스크톱 태스크를 벤치마킹한다. AgentBench는 환경 간 신호를 제공할 수 있지만, 어떤 환경을 중요하게 여기는지 알게 되면 도메인 특화 벤치마크를 대체하지는 않는다.

Table 4의 실패 유형 분류는 아마도 가장 오래 지속될 기여일 것이다. 저자들은 실패를 태스크 한도 초과, 형식 오류, 잘못된 액션 및 기타 몇 가지로 분류한다. 이는 구현 버그가 아니라 — 다중 턴 압박 하에서 LLM이 상태를 유지하고, 사용 가능한 액션을 추적하며, 파싱 가능한 출력을 생성하는 방식의 구조적 약점이다. 진지한 에이전트 시스템이라면 반드시 다루어야 할 문제들이다.

금융 AI에 중요한 이유

세 가지 주요 실패 유형은 Beancount write-back 에이전트를 깨뜨릴 것이라고 예상되는 것과 거의 직접적으로 대응한다.

태스크 한도 초과는 장부 조정 실패 유형이다. 여러 계정에 걸쳐 기간 마감을 한다는 것은 기초 잔액 확인, 차변과 대변 대조, 불일치 식별, 수정 제안을 의미한다 — 쉽게 10~20단계로 이어지는 체인이다. 중간에 문맥이나 단계 예산을 소진하고 포기하는 에이전트는 우아하게 실패하지 않을 뿐만 아니라, 장부를 부분적으로 수정된 상태로 남길 수 있다.

형식 오류는 거래 입력 실패 유형이다. Beancount는 엄격한 구문을 가진다: 잘못된 포스팅(통화 누락, 잘못된 들여쓰기, 유효하지 않은 플래그)은 파일을 손상시키는 파서 오류이다. Beancount 출력 주변에 산문을 생성하거나, 올바른 구문을 다른 형식으로 생성하는 에이전트는 쓸모가 없다. 이는 CRITIC 논문의 핵심 문제가 더 엄격한 도메인에 적용된 것이다.

잘못된 액션은 write-back 안전성 문제이다. 실제 장부에서 작동하는 Beancount 에이전트가 가질 수 있는 안전한 작업은 제한적이다: 거래 추가, 플래그 수정, 포스팅 이동. 그 범위를 벗어난 액션을 환각하는 것 — 예를 들어 여전히 공개 포지션이 있는 계정을 삭제하는 것 — 은 감사 전까지 표면화되지 않을 수 있는 정확성 실패이다.

"코드 훈련이 상반된 효과를 가진다"는 발견도 관련이 있다. Beancount write-back은 지식 검색보다 코드 생성에 더 가깝기 때문에, 코드 사전 훈련 모델이 자연스러운 적합이어야 한다. 그러나 코드 훈련이 다중 턴 설정에서 대화 추종 능력을 해친다면, 배포 전에 그러한 트레이드오프를 표면화하기 위해 AgentBench와 같은 혼합 평가가 필요하다.

다음에 읽을 것

  • WebArena (Zhou 외, 2024; arXiv:2307.13854) — 라이브 브라우저 환경에서 812개의 웹 브라우징 태스크; AgentBench 웹 계층의 더 깊은 후속 연구.
  • OSWorld (Xie 외, 2024; NeurIPS 2024) — 파일시스템과 GUI 태스크를 포함한 전체 데스크톱 환경 벤치마크; OSWorld의 OS 환경은 AgentBench OS 계층의 직접적이고 더 깊은 후속 연구.
  • TAU-bench (Yao 외, 2024) — 실제 도구 사용과 사용자 시뮬레이션을 통해 소매 및 항공 API 환경에서 에이전트를 평가; Beancount 장부를 환경으로 취급하는 것에 가장 가까운 출판된 벤치마크.

이 글 공유하기

출처: https://beancount.io/ko/bean-labs/research-logs/2026/05/06/agentbench-evaluating-llms-as-agents

게시됨: 2026년 5월 6일

마지막 업데이트: 2026년 9월 14일