Коли я питаю, що насправді має робити Beancount-агент зворотного запису надійно, відповідь — не «генерувати текст», а «виконувати послідовність дій у структурованому середовищі, не сходячи з рейок». AgentBench (Liu et al., Tsinghua, ICLR 2024) — одна з перших серйозних спроб виміряти цю здатність у масштабі, і зріз 2023 року досі містить уроки, які варто витягти.
Стаття
AgentBench, авторства Сяо Лю та 21 співавтора з Університету Цінхуа, визначає вісім середовищ, спроєктованих для стрес-тестування LLM як інтерактивних агентів, а не пасивних генераторів тексту. П'ять середовищ є оригінальними: ОС (взаємодія з bash), База даних (генерація SQL та відновлення після помилок), Граф знань (структуровані запити на основі інструментів), Цифрова карткова гра (багатораундова стратегічна конкуренція) та Загадки латерального мислення (дедуктивний діалог). Три адаптовані з попередніх наборів даних: House-Holding з ALFWorld, Web Shopping з WebShop та Web Browsing з Mind2Web. Стаття оцінює 27 моделей — комерційні API-моделі та моделі з відкритим кодом до 70B — на приблизно 4000 генераціях dev-розбиття та 13000 генераціях test-розбиття, і повідомляє як показники успіху в кожному середовищі, так і складовий загальний бал.
Ключові ідеї
- GPT-4 лідирує із загальним балом 4.01. Claude-2 отримує 2.49, GPT-3.5-turbo — 2.32. CodeLlama-34B, найсильніша модель з відкритим кодом на момент подання, отримує лише 0.96. API-моделі в середньому 2.24 проти 0.42 у моделей з відкритим кодом.
- GPT-4 отримує 42.4% на ОС, 32.0% на Базах даних і 78.0% на House-Holding — розкид показує, які середовища винагороджують слідування інструкціям проти структурованого міркування.
- «Перевищено ліміт завдань» — домінуючий тип збою: 67.9% збоїв Графа знань досягають ліміту кроків до розв'язання завдання. Це збій довготривалого міркування, а не дефіцит знань.
- Помилки відповідності формату становлять 53.3% збоїв Баз даних — агент створює синтаксично недійсний SQL або обгортає запити в прозу, яку оцінювач не може розпарсити.
- Вибір недійсної дії спричиняє 64.1% збоїв House-Holding — агент називає дію, недоступну в поточному стані.
- Навчання на коді має «суперечливі ефекти на різні завдання»: воно допомагає середовищам з процедурним слідуванням, але може зашкодити загальному міркуванню в насичених діалогом.
Що витримує перевірку — а що ні
Основне дизайнерське рішення — багатосередовищне, багатоетапне, інтерактивне оцінювання — правильне і досі недостатньо використовуване. Більшість LLM-бенчмарків досі вимірюють якість генерації за один крок; AgentBench слушно наполягає, що агенти мають продовжувати приймати рішення, поки завдання не виконане або бюджет не вичерпано.
Тим не менш, зріз застарів у важливих аспектах. Розрив між GPT-4 (4.01) і найкращою моделлю з відкритим кодом (0.96) виглядав тривожним у середині 2023 року, але до 2025 року він значною мірою скоротився. Такі моделі, як Llama 3.1 70B або Qwen 2.5 72B, тепер долають перешкоди слідування інструкціям і відповідності формату, які два роки тому були новими викликами. Читати статтю як «моделі з відкритим кодом не здатні на агентні завдання» було б помилкою; читати її як «відповідність формату та довготривала узгодженість — це складні проблеми» залишається правильним.
Також існує компроміс між широтою та глибиною. Вісім середовищ звучать комплексно, але кожне відносно поверхневе. WebArena (Zhou et al., 2024) покриває 812 довготривалих шаблонних завдань лише для веб-браузингу; OSWorld (Xie et al., 2024) оцінює 369 реальних десктопних завдань на Ubuntu та Windows. AgentBench може дати міжсередовищний сигнал, але не замінює доменно-специфічний бенчмарк, коли ви точно знаєте, яке середовище вас цікавить.
Таксономія збоїв у Таблиці 4 — ймовірно, найбільш довговічний внесок. Автори розбивають збої на перевищення ліміту завдань, помилку формату, недійсну дію та кілька інших. Це не помилки реалізації — це структурні слабкості в тому, як LLM підтримують стан, відстежують доступні дії та продукують парсувальний вивід під багатоетапним тиском. Будь-яка серйозна агентна система має їх враховувати.
Чому це важливо для фінансового ШІ
Три домінуючі типи збоїв майже безпосередньо відображаються на тому, що, на мою думку, зламало б Beancount-агента зворотного запису.
Перевищення ліміту завдань — це тип збою звірки книги. Закриття періоду через кілька рахунків означає перевірку початкових залишків, зіставлення дебетів і кредитів, виявлення розбіжностей та пропозицію виправлень — ланцюг, який легко розтягується на 10–20 кроків. Агент, який досягає ліміту контексту або кроків у середині ланцюга й здається, не просто виходить з ладу витончено; він може залишити книгу в частково зміненому стані.
Помилка формату — це тип збою введення транзакцій. Beancount має суворий синтаксис: неправильно оформлена проводка (відсутня валюта, неправильний відступ, недійсний прапорець) — це помилка парсера, яка пошкоджує файл. Агент, який генерує прозу навколо свого Beancount-виводу або створює правильно виглядаючий синтаксис у неправильному форматі, марний. Це основна проблема статті CRITIC, застосована до суворішої доменної області.
Недійсна дія — це проблема безпеки зворотного запису. Beancount-агент, що працює на реальній книзі, має обмежений набір безпечних операцій: додати транзакцію, виправити прапорець, перемістити проводку. Галюцинація дії поза цим набором — наприклад, видалення рахунку, який ще має відкриті позиції — це помилка коректності, яка може не проявитися до аудиту.
Висновок про те, що «навчання на коді має суперечливі ефекти», також актуальний. Beancount зворотний запис ближчий до генерації коду, ніж до витягу знань, тому модель, попередньо навчена на коді, мала б природно пасувати. Але якщо навчання на коді шкодить слідуванню діалогу в багатоетапних налаштуваннях, потрібне гібридне оцінювання, як у AgentBench, щоб виявити ці компроміси перед розгортанням.
Що читати далі
- WebArena (Zhou et al., 2024; arXiv:2307.13854) — 812 завдань веб-браузингу в живих умовах браузера; глибше продовження веб-рівня AgentBench.
- OSWorld (Xie et al., 2024; NeurIPS 2024) — повноцінний бенчмарк десктопного середовища, включно із завданнями файлової системи та GUI; середовище ОС в OSWorld — прямий, глибший наступник рівня ОС в AgentBench.
- TAU-bench (Yao et al., 2024) — оцінює агентів у API-середовищах роздрібної торгівлі та авіаліній із реальним використанням інструментів і симуляцією користувачів; найближчий опублікований бенчмарк до трактування книги Beancount як середовища.





