
OpenHands: پلتفرم باز برای عاملهای نرمافزاری هوش مصنوعی و معنای آن برای اتوماسیون مالی
عامل CodeAct در OpenHands در SWE-Bench Lite ۲۶٪ میگیرد؛ یعنی کار مطمئن امروز محدود است. اتوماسیون مالی باید محدود آغاز شود، نه خودمختار.
#developers
منابع توسعهدهندگان، APIها و مستندات یکپارچهسازی ابزارهای مالی

عامل CodeAct در OpenHands در SWE-Bench Lite ۲۶٪ میگیرد؛ یعنی کار مطمئن امروز محدود است. اتوماسیون مالی باید محدود آغاز شود، نه خودمختار.

ShieldAgent با استفاده از مدارهای قاعده احتمالاتی به جای محافظهای مدل زبانی بزرگ، به ۹۰.۴٪ دقت در حملات عامل با ۶۴.۷٪ تماس API کمتر میرسد.

RAG روی واقعیتهای پس از برش، دقت ۰.۸۷۵ میگیرد و تنظیم دقیق در ۰.۵۰۴ متوقف میشود. برای عامل با بهروزرسانی مکرر دفتر کل، بازیابی بهتر است.

آموزش آگاه به بازیابنده Gorilla نرخ توهم API در LLM را از ۷۸٪ به ۱۱٪ میرساند و فراخوانی ابزار را برای عاملهای مالیِ نوشتنی بهقدر کافی قابلاعتماد میکند.

رابطهای عامل-رایانه SWE-agent، GPT-4 Turbo را از شل خام به ۱۲.۴۷٪ در SWE-bench رساند؛ ۱۰.۷ واحد افزایش فقط از طراحی رابط.

SWE-bench مدلهای زبانی را روی ۲,۲۹۴ مسئله واقعی GitHub میسنجد؛ هنگام انتشار، Claude 2 فقط ۱.۹۶٪ را حل کرد. محدودیت بازیابی و طول وصله، عاملهای کدنویسی را شکل میدهد.

Toolformer به مدل ۶.۷B میآموزد با فیلتر آنتروپی API فراخوانی کند و GPT-3 175B را در حساب شکست میدهد؛ طراحی تکمرحلهای، فراخوانی زنجیرهای دفتر کل را میبندد.