
OpenHands:AIソフトウェアエージェントのためのオープンプラットフォームと、それが財務自動化に意味すること
OpenHandsのCodeActエージェントはSWE-Bench Liteで26%を記録し、AIエージェントが今日確実にできることを示す。財務自動化は自律型ではなく、狭い範囲から始めるべきだ。
#open-source

OpenHandsのCodeActエージェントはSWE-Bench Liteで26%を記録し、AIエージェントが今日確実にできることを示す。財務自動化は自律型ではなく、狭い範囲から始めるべきだ。

GPT-4はWebArenaの812ウェブタスクのわずか14.41%を完了、人間は78.24%。エージェントはタスクを不可能と誤って宣言して失敗することが多い。

TableLlamaは列型注釈でGPT-4に勝利(F1 94対32)するが、WikiTQの合成的推論では33ポイント劣る。

SWE-agentのAgent-Computer InterfacesはGPT-4 Turboを生のシェルからSWE-benchで12.47%に引き上げ、インターフェース設計だけで10.7ポイントの向上をもたらしました。