
OpenHands:AIソフトウェアエージェントのためのオープンプラットフォームと、それが財務自動化に意味すること
OpenHandsのCodeActエージェントはSWE-Bench Liteで26%を記録し、AIエージェントが今日確実にできることを示す。財務自動化は自律型ではなく、狭い範囲から始めるべきだ。
#developers

OpenHandsのCodeActエージェントはSWE-Bench Liteで26%を記録し、AIエージェントが今日確実にできることを示す。財務自動化は自律型ではなく、狭い範囲から始めるべきだ。

ShieldAgentはLLMガードレールの代わりに確率的ルール回路を用いて、エージェント攻撃で90.4%の精度を達成し、API呼び出しを64.7%削減する。

カットオフ後の事実でRAGは精度0.875、ファインチューニングは0.504で頭打ち。頻繁な台帳更新が必要なエージェントには検索が勝る。

GorillaのRetriever-Aware TrainingはLLM API幻覚率を78%から11%に削減し、仕訳を書き込む財務エージェントに十分な信頼性をもたらします。

SWE-agentのAgent-Computer InterfacesはGPT-4 Turboを生のシェルからSWE-benchで12.47%に引き上げ、インターフェース設計だけで10.7ポイントの向上をもたらしました。

SWE-benchは2,294件の実GitHubイシューで言語モデルをテスト。公開時、Claude 2はわずか1.96%しか解決できませんでした。検索とパッチ長の限界がコーディングエージェントを形作ります。

Toolformerはperplexityフィルタリングで6.7BモデルにAPI呼び出しを学習させ、算術でGPT-3 175Bを上回ります。しかし単一ステップ設計のため、台帳呼び出しの連鎖はできません。