본문으로 건너뛰기

Mike Thrift

마케팅 매니저

SWE-agent: 인터페이스 디자인이 자동화된 소프트웨어 엔지니어링을 구현하는 방법

SWE-agent(NeurIPS 2024)는 LLM과 소프트웨어 환경 사이의 전용 레이어인 에이전트-컴퓨터 인터페이스(ACI)를 도입하여, 원시 셸(raw shell) 접근 방식보다 10.7%포인트 향상된 성능을 보였으며 GPT-4 Turbo를 통해 SWE-bench에서 12.47%의 해결률을 기록했습니다. 자율 코딩 에이전트의 주요 병목 현상은 모델의 능력이 아니라 인터페이스 디자인입니다.

SWE-bench: 언어 모델이 실제 GitHub 문제를 해결할 수 있을까?

SWE-bench는 실행 기반 테스트를 사용하여 12개의 Python 저장소에 걸친 2,294개의 실제 GitHub 이슈에 대해 언어 모델을 평가합니다. 발표 당시 Claude 2는 현실적인 검색 환경에서 이슈의 1.96%만을 해결하며 코딩 에이전트의 사실상 표준 벤치마크로 자리 잡았습니다. 또한 Beancount 쓰기 자동화(write-back) 에이전트와 직접적으로 관련된 검색 및 패치 길이 실패 모드를 밝혀냈습니다.

생각의 나무(Tree of Thoughts): LLM 검색을 통한 신중한 문제 해결

생각의 나무(Tree of Thoughts, ToT)는 LLM 추론을 가지치기와 백트래킹이 가능한 분기형 검색 트리로 구조화하여, 24 게임(Game of 24)에서 표준 GPT-4 CoT의 4% 대비 74%의 성공률을 달성했습니다. 이는 Beancount 워크플로우의 다단계 금융 분류 및 세금 최적화에 직접적인 시사점을 제공합니다.

Reflexion: 재학습 없이 실수로부터 학습하는 언어 에이전트

Reflexion(NeurIPS 2023)은 LLM 에이전트가 에피소드 버퍼에 언어적 사후 분석을 저장함으로써 가중치 업데이트 없이 성능을 향상시킬 수 있게 합니다. GPT-4를 사용해 HumanEval에서 91%를 달성했지만 WebShop에서는 실패했는데, 이는 언어적 강화가 평가자가 명확하고 실행 가능한 신호를 생성할 때만 작동한다는 구조적 제약을 드러냅니다. 자가 수정 Beancount 장부 에이전트를 구축하는 데 있어 이것이 무엇을 의미하는지 알아봅니다.

LLM이 표 형식 데이터를 추론할 수 있을까? 금융 AI에 대해 4가지 벤치마크가 시사하는 바

2024~2025년의 4가지 벤치마크에 따르면, 실제 표 QA에서 GPT-4는 인간의 86%에 비해 42%의 점수를 기록했으며, 복잡한 집계 작업에서는 19.6%까지 하락했습니다. 또한 Beancount의 네이티브 구문은 LLM 입력을 위한 직렬화 계층 구조에서 가장 낮은 성능을 보이는 위치에 있습니다.

회계 에이전트를 위한 헌법적 AI: RLAIF, 정책 규칙 및 굿하트의 법칙 리스크

Anthropic의 헌법적 AI(Constitutional AI) 논문(Bai et al., 2022)은 인간의 유해성 레이블 대신 AI 생성 피드백을 사용하여 LLM이 규칙을 따르도록 훈련합니다. 이 연구 로그는 RLAIF의 비판-수정-선호도 파이프라인이 자율적인 Beancount 원장 에이전트의 쓰기 작업 안전성에 어떻게 매핑되는지, 그리고 "헌법"이 윤리 규칙 세트가 아닌 계정 과목표일 때 굿하트의 법칙(Goodharting), 보정 실패 및 이중 용도 리스크가 어떤 모습인지 살펴봅니다.