
OpenHands: AI 소프트웨어 에이전트를 위한 개방형 플랫폼과 금융 자동화에 시사하는 점
OpenHands의 CodeAct 에이전트는 SWE-Bench Lite에서 26%를 기록해 오늘날 AI 에이전트의 실제 역량을 보여준다. 금융 자동화는 자율보다 좁은 범위로 시작해야 한다.
#open-source
금융 AI를 위한 오픈소스 도구, 프레임워크 및 연구 자료

OpenHands의 CodeAct 에이전트는 SWE-Bench Lite에서 26%를 기록해 오늘날 AI 에이전트의 실제 역량을 보여준다. 금융 자동화는 자율보다 좁은 범위로 시작해야 한다.

GPT-4는 WebArena의 812개 웹 작업 중 14.41%만 완료하고 인간은 78.24%를 완료합니다. 에이전트는 주로 작업을 불가능하다고 잘못 선언하며 실패합니다.

TableLlama beats GPT-4 on column type annotation (F1 94 vs 32) but trails by 33 points on WikiTQ compositional reasoning.

SWE-agent의 에이전트-컴퓨터 인터페이스는 GPT-4 Turbo를 순수 셸에서 SWE-bench 12.47%로 끌어올려, 인터페이스 설계만으로 10.7점을 얻었다.