
MemGPT: ۹۲.۵٪ یادآوری چندنشستی در برابر ۳۲.۱٪ خط پایه
لایههای حافظه سبک OS در MemGPT دقت چت چندنشستی GPT-4 را به ۹۲.۵٪ در برابر ۳۲.۱٪ زمینه ثابت میرساند—برای عاملهای دفترکل چندساله ضروری است.

لایههای حافظه سبک OS در MemGPT دقت چت چندنشستی GPT-4 را به ۹۲.۵٪ در برابر ۳۲.۱٪ زمینه ثابت میرساند—برای عاملهای دفترکل چندساله ضروری است.

سیستم SWE-agent (NeurIPS 2024) رابطهای کاربری عامل-کامپیوتر (ACI) را معرفی میکند — لایههایی که به طور خاص برای تعامل بین مدلهای زبانی بزرگ (LLM) و محیطهای نرمافزاری ساخته شدهاند. این سیستم بهبود ۱۰.۷ واحد درصدی نسبت به دسترسی مستقیم به شل (Shell) و نرخ حل ۱۲.۴۷ درصدی در بنچمارک SWE-bench با GPT-4 Turbo را نشان میدهد. طراحی رابط کاربری، و نه توانایی مدل، گلوگاه اصلی برای عاملهای کدنویسی خودمختار است.

SWE-bench مدلهای زبانی را بر روی ۲,۲۹۴ مسئله واقعی گیتهاب در ۱۲ مخزن پایتون با استفاده از تستهای مبتنی بر اجرا ارزیابی میکند؛ در زمان انتشار، Claude 2 تنها ۱.۹۶٪ از مسائل را با بازیابی واقعگرایانه حل کرد که بنچمارک استاندارد برای عاملهای کدنویسی را ایجاد کرد و حالتهای شکست در بازیابی و طول وصله را که مستقیماً به عاملهای بازنویسی Beancount مربوط میشوند، آشکار ساخت.

CodeAct (ICML 2024) فراخوانی ابزار مبتنی بر JSON را با کدهای پایتون قابل اجرا جایگزین میکند که نرخ موفقیت عوامل GPT-4 را در وظایف چند-ابزاری حدود ۲۰ درصد بهبود بخشیده و گامهای تعاملی را ۳۰٪ کاهش میدهد — این موضوع پیامدهای مستقیمی برای ساخت عوامل مغایرتگیری قابل اعتماد در Beancount دارد.

Huang و همکاران (ICLR 2024): خوداصلاحی ذاتی GPT-4 را از 95.5٪ به 91.5٪ در GSM8K کاهش میدهد — عاملهای دفتر کل نیاز به تأییدکنندههای خارجی دارند، نه بازبینی خود.

درخت افکار (ToT) با سازماندهی استدلال مدل زبانی در یک درخت جستجوی شاخهای همراه با هرس و بازگشت به عقب، در بازی ۲۴ به دقت ۷۴٪ در مقابل ۴٪ برای CoT استاندارد GPT-4 دست مییابد؛ این موضوع پیامدهای مستقیمی برای طبقهبندی مالی چندمرحلهای و بهینهسازی مالیاتی در جریانهای کاری Beancount دارد.

سیستم CRITIC (کنفرانس ICLR 2024) با تکیه بر سیگنالهای ابزارهای خارجی برای بازنگری در مدلهای زبانی بزرگ، به بهبود ۷.۷ در شاخص F1 در پاسخگویی به سوالات دامنه آزاد و کاهش ۷۹.۲ درصدی سمیت محتوا دست یافت؛ یک حلقه «تایید و سپس اصلاح» که مستقیماً با امنیت ثبت اطلاعات در عاملهای مالی Beancount مطابقت دارد.

روش Reflexion (ارائه شده در NeurIPS 2023) به عاملهای LLM اجازه میدهد با ذخیره تحلیلهای کلامی پس از شکست در یک بافر اپیزودیک، بدون نیاز به بهروزرسانی وزنها، عملکرد خود را بهبود بخشند. این روش در بنچمارک HumanEval با GPT-4 به دقت ۹۱٪ میرسد اما در WebShop شکست میخورد که نشاندهنده یک محدودیت ساختاری است؛ یادگیری تقویتی کلامی تنها زمانی کار میکند که ارزیاب سیگنالی شفاف و قابل اجرا تولید کند. در ادامه خواهیم دید که این موضوع برای ساخت یک عامل دفترکل خود-اصلاحگر Beancount چه معنایی دارد.

خودسازگاری رمزگشایی حریصانهٔ زنجیرهٔ اندیشه را با رأی اکثریت بر N مسیر استدلال نمونهبرداریشده جایگزین میکند — دقت GPT-3 را در GSM8K با ۱۷/۹ واحد درصد بدون آموزش اضافه بالا میبرد — و مستقیماً برای محاسبات مالی چندمرحلهای کاربرد دارد، جایی که رمزگشایی واحد مدل غیرقابلاعتماد است.

PAL با اجرای پایتون برای محاسبات، در GSM-hard نسبت به زنجیره افکار +۳۸.۱ واحد درصد بهبود مییابد — تقسیم درست برای محاسبات دفتر Beancount قابل اعتماد.

چهار بنچمارک سالهای ۲۰۲۴-۲۰۲۵ نشان میدهند که GPT-4 در پاسخدهی به سوالات جداول واقعی امتیاز ۴۲٪ را در مقابل ۸۶٪ انسانها کسب کرده است، در حالی که در تجمیعهای پیچیده این عدد به ۱۹.۶٪ سقوط میکند — و نحو بومی Beancount در بدترین رتبه سلسلهمراتب سریالسازی برای ورودی مدلهای زبانی قرار دارد.

مقاله هوش مصنوعی قانونمند آنتروپیک (بای و همکاران، ۲۰۲۲) مدلهای زبانی بزرگ را آموزش میدهد تا با استفاده از بازخوردهای تولید شده توسط هوش مصنوعی به جای برچسبهای آسیب انسانی، از قوانین پیروی کنند. این گزارش تحقیقاتی بررسی میکند که چگونه خط لوله نقد-بازبینی-ترجیح RLAIF بر ایمنی بازنویسی برای عوامل خودکار دفترکل Beancount منطبق میشود — و زمانی که «قانون اساسی» به جای مجموعهای از قوانین اخلاقی، یک چارت حسابها باشد، گودهارتینگ، شکستهای کالیبراسیون و ریسکهای استفاده دوگانه چگونه به نظر میرسند.