
OpenHands:AI 软件代理开放平台及其对财务自动化的意义
OpenHands 的 CodeAct 智能体在 SWE-Bench Lite 上得分 26%,展示了 AI 智能体如今可靠能做到什么。金融自动化应从严格限定范围开始,而非完全自主。
#open-source

OpenHands 的 CodeAct 智能体在 SWE-Bench Lite 上得分 26%,展示了 AI 智能体如今可靠能做到什么。金融自动化应从严格限定范围开始,而非完全自主。

GPT-4 仅完成 WebArena 的 812 项网页任务中的 14.41%,而人类为 78.24%;智能体大多因错误地宣称任务不可能而失败。

TableLlama 在列类型标注上胜过 GPT-4(F1 94 对 32),但在 WikiTQ 组合推理上落后 33 个点。

SWE-agent 的代理-计算机界面将 GPT-4 Turbo 从原始 shell 提升到 SWE-bench 上的 12.47%,仅凭界面设计就获得 10.7 个百分点的提升。