
OpenHands:AI 软件代理开放平台及其对财务自动化的意义
OpenHands 的 CodeAct 智能体在 SWE-Bench Lite 上得分 26%,展示了 AI 智能体如今可靠能做到什么。金融自动化应从严格限定范围开始,而非完全自主。
#developers

OpenHands 的 CodeAct 智能体在 SWE-Bench Lite 上得分 26%,展示了 AI 智能体如今可靠能做到什么。金融自动化应从严格限定范围开始,而非完全自主。

ShieldAgent 用概率规则电路替代 LLM 护栏,对智能体攻击达 90.4% 准确率,API 调用减少 64.7%。

RAG 对训练截止后的事实达 0.875 准确率,微调则停在 0.504。对需频繁更新账本的智能体,检索胜过微调。

Gorilla 的检索感知训练将 LLM API 幻觉率从 78% 降至 11%,让工具调用可靠到足以支撑录入分录的金融智能体。

SWE-agent 的代理-计算机界面将 GPT-4 Turbo 从原始 shell 提升到 SWE-bench 上的 12.47%,仅凭界面设计就获得 10.7 个百分点的提升。

SWE-bench 用 2,294 个真实 GitHub 问题测试语言模型;发布时 Claude 2 仅解决 1.96%。检索与补丁长度限制塑造了编码代理。

Toolformer 通过困惑度过滤教一个 6.7B 模型调用 API,在算术上击败了 GPT-3 175B。其单步设计阻碍了链式账本调用。