
MemGPT: 92.5% багатосесійне пригадування проти 32.1% базового рівня
ОС-подібні рівні пам'яті MemGPT підвищують точність багатосесійного чату GPT-4 до 92.5% проти 32.1% фіксованого контексту — необхідно для багаторічних ledger-агентів.

ОС-подібні рівні пам'яті MemGPT підвищують точність багатосесійного чату GPT-4 до 92.5% проти 32.1% фіксованого контексту — необхідно для багаторічних ledger-агентів.

SWE-agent (NeurIPS 2024) представляє інтерфейси агент-комп'ютер (ACI) — спеціально розроблені рівні між LLM та програмними середовищами — демонструючи покращення на 10,7 відсоткових пунктів порівняно з прямим доступом до оболонки та 12,47% вирішення на SWE-bench з GPT-4 Turbo. Дизайн інтерфейсу, а не можливості моделі, є основним вузьким місцем для автономних агентів кодування.

SWE-bench оцінює мовні моделі на основі 2294 реальних проблем GitHub у 12 репозиторіях Python за допомогою тестів на основі виконання; на момент публікації Claude 2 вирішив лише 1,96% проблем за умови реалістичного пошуку, ставши бенчмарком де-факто для агентів кодування та виявивши недоліки в пошуку та довжині патчів, які мають безпосереднє значення для агентів запису Beancount.

CodeAct (ICML 2024) замінює JSON-виклики інструментів виконуваним кодом Python, що підвищує рівень успіху агентів GPT-4 приблизно на 20 відсоткових пунктів у завданнях із використанням кількох інструментів і скорочує кількість ітерацій на 30% — це має пряме значення для створення надійних агентів узгодження Beancount.

Huang et al. (ICLR 2024): внутрішня самокорекція знижує GPT-4 з 95.5% до 91.5% на GSM8K — бухгалтерським агентам потрібні зовнішні валідатори, а не самостійна перевірка.

Tree of Thoughts (ToT) досягає 74% у «Грі 24» проти 4% у стандартному GPT-4 CoT шляхом організації міркувань LLM у дерево пошуку з розгалуженням, відсіканням та поверненням назад — це має прямі наслідки для багатоетапної фінансової класифікації та оптимізації податків у робочих процесах Beancount.

CRITIC (ICLR 2024) досягає приросту F1 на 7,7 у завданнях QA з відкритим доменом та зниження токсичності на 79,2% шляхом заземлення перегляду LLM у сигналах зовнішніх інструментів — циклу «перевірка-корекція», який безпосередньо відповідає за безпеку зворотного запису для фінансових агентів Beancount.

Reflexion (NeurIPS 2023) дозволяє LLM-агентам удосконалюватися шляхом збереження вербального аналізу помилок в епізодичному буфері — без потреби в оновленні ваг. Метод досягає 91% на HumanEval з GPT-4, але зазнає невдачі в WebShop, виявляючи структурне обмеження — вербальне підкріплення працює лише тоді, коли оцінювач видає чіткий, дієвий сигнал. Ось що це означає для створення самокоригованого агента для книги Beancount.

Самоузгодженість замінює жадное декодування з ланцетом продумок на голосування більшості за N семплованих шляхів міркування – підвішую точність GPT-3 на GSM8K на 17,9 відсоткових пунктів без додаткового навчання – и безпосередно застосовується до багатокрокових фінансових розрахунків, где один декод моделі нестабільний.

PAL дає +38,1 п.п. перевершуючи chain-of-thought на GSM-hard, виконуючи арифметику в Python — правильний розподіл для надійних розрахунків у бухгалтерській книзі Beancount.

Чотири бенчмарки 2024–2025 років показують, що GPT-4 набирає 42% у відповідях на питання за реальними таблицями проти 86% у людей, причому складні агрегації падають до 19,6% — а власний синтаксис Beancount знаходиться в найменш продуктивній частині ієрархії серіалізації для вводу в LLM.

Стаття Anthropic про Конституційний ШІ (Bai et al., 2022) навчає великі мовні моделі (LLM) дотримуватися правил за допомогою зворотного зв'язку, створеного ШІ, а не міток людської шкоди. Цей дослідницький журнал розглядає, як конвеєр RLAIF «критика-перегляд-перевага» відображається на безпеці зворотного запису для автономних агентів реєстру Beancount — і як виглядають закон Ґудгарта, помилки калібрування та ризики подвійного призначення, коли «конституцією» є план рахунків, а не набір етичних правил.