
OpenHands: AI 소프트웨어 에이전트를 위한 개방형 플랫폼과 금융 자동화에 시사하는 점
OpenHands의 CodeAct 에이전트는 SWE-Bench Lite에서 26%를 기록해 오늘날 AI 에이전트의 실제 역량을 보여준다. 금융 자동화는 자율보다 좁은 범위로 시작해야 한다.
#developers
금융 도구를 위한 개발자 리소스, API 및 통합 문서

OpenHands의 CodeAct 에이전트는 SWE-Bench Lite에서 26%를 기록해 오늘날 AI 에이전트의 실제 역량을 보여준다. 금융 자동화는 자율보다 좁은 범위로 시작해야 한다.

ShieldAgent는 LLM 가드레일 대신 확률적 규칙 회로를 사용해 API 호출을 64.7% 줄이면서 에이전트 공격에서 90.4% 정확도를 기록한다.

RAG는 컷오프 이후 사실에서 0.875 정확도를 달성하지만 파인튜닝은 0.504에서 정체됩니다. 잦은 장부 업데이트가 필요한 에이전트에는 검색이 파인튜닝을 능가합니다.

Gorilla의 검색 인식 학습(Retriever-Aware Training)은 LLM API 환각률을 78%에서 11%로 낮추어, 항목을 기록하는 금융 에이전트에 충분히 신뢰할 만한 도구 호출을 만든다.

SWE-agent의 에이전트-컴퓨터 인터페이스는 GPT-4 Turbo를 순수 셸에서 SWE-bench 12.47%로 끌어올려, 인터페이스 설계만으로 10.7점을 얻었다.

SWE-bench는 2,294개의 실제 GitHub 이슈로 언어 모델을 시험한다. 출판 당시 Claude 2는 1.96%만 해결했다. 검색과 패치 길이 제약이 코딩 에이전트를 규정한다.

Toolformer는 perplexity 필터링으로 6.7B 모델이 API를 호출하도록 학습시켜 산술에서 GPT-3 175B를 앞섰다. 하지만 단일 단계 설계로 연쇄 원장 호출은 막혀 있다.