Когда я спрашиваю, что именно должен надежно делать агент записи в Beancount, ответ — не «генерировать текст», а «выполнять последовательность действий в структурированной среде, не сбиваясь с пути». AgentBench (Liu и др., Университет Цинхуа, ICLR 2024) — одна из первых серьезных попыток измерить эту способность в масштабе, и срез данных 2023 года все еще содержит уроки, которые стоит извлечь.
Статья
AgentBench, авторы которого — Сяо Лю и 21 соавтор из Университета Цинхуа, определяет восемь сред, предназначенных для стресс-тестирования LLM как интерактивных агентов, а не пассивных генераторов текста. Пять сред являются оригинальными: ОС (взаимодействие с bash), База данных (генерация SQL и восстановление после ошибок), Граф знаний (структурированные запросы на основе инструментов), Цифровая карточная игра (многораундовая стратегическая конкуренция) и Загадки на латеральное мышление (дедуктивный диалог). Три адаптированы из предыдущих наборов данных: House-Holding из ALFWorld, Web Shopping из WebShop и Web Browsing из Mind2Web. В статье оценивается 27 моделей — коммерческие API-модели и модели с открытым исходным кодом размером до 70B — на примерно 4 000 генераций dev-разбиения и 13 000 генераций test-разбиения, и сообщается как о показателях успеха в каждой среде, так и о комплексном общем балле.
Ключевые идеи
- GPT-4 лидирует с общим баллом 4.01. Claude-2 набирает 2.49, GPT-3.5-turbo — 2.32. CodeLlama-34B, самая сильная модель с открытым исходным кодом на момент подачи, набирает лишь 0.96. API-модели в среднем набирают 2.24 против 0.42 у моделей с открытым исходным кодом.
- GPT-4 набирает 42.4% в ОС, 32.0% в Базах данных и 78.0% в House-Holding — разброс показывает, какие среды вознаграждают следование инструкциям, а какие — структурированное рассуждение.
- «Превышение лимита задач» — доминирующий тип сбоев: 67.9% сбоев в Графе знаний достигают лимита шагов, не решив задачу. Это сбой долгосрочного рассуждения, а не нехватка знаний.
- Ошибки соответствия формату составляют 53.3% сбоев в Базах данных — агент генерирует синтаксически недопустимый SQL или оборачивает запросы в прозу, которую оценщик не может распарсить.
- Выбор недопустимых действий определяет 64.1% сбоев в House-Holding — агент называет действие, недоступное в текущем состоянии.
- Обучение на коде имеет «противоречивые эффекты в разных задачах»: оно помогает средам, требующим следования процедурам, но может навредить общему рассуждению в средах, насыщенных диалогами.
Что выдерживает проверку — а что нет
Основное дизайнерское решение — многосредовая, многоходовая, интерактивная оценка — правильное и до сих пор недоиспользуемое. Большинство LLM-бенчмарков по-прежнему измеряют качество одноходовой генерации; AgentBench справедливо настаивает на том, что агенты должны продолжать принимать решения, пока задача не выполнена или бюджет не исчерпан.
Тем не менее, срез данных устарел в важных аспектах. Разрыв между GPT-4 (4.01) и лучшей моделью с открытым исходным кодом (0.96) выглядел тревожным в середине 2023 года, но к 2025 году он в значительной степени сократился. Такие модели, как Llama 3.1 70B или Qwen 2.5 72B, теперь легко преодолевают барьеры следования инструкциям и соответствия формату, которые два года назад были новыми препятствиями. Читать статью как «модели с открытым исходным кодом не способны на агентские задачи» было бы ошибкой; читать ее как «соответствие формату и долгосрочная согласованность — вот сложные проблемы» остается верным.
Также существует компромисс между широтой и глубиной. Восемь сред звучат всесторонне, но каждая относительно неглубокая. WebArena (Zhou и др., 2024) охватывает 812 долгосрочных шаблонных задач только для веб-браузинга; OSWorld (Xie и др., 2024) тестирует 369 реальных задач на рабочем столе в Ubuntu и Windows. AgentBench может дать сигнал по нескольким средам, но он не заменяет доменно-специфичный бенчмарк, как только вы знаете, какая среда вас интересует.
Таксономия сбоев в Таблице 4, вероятно, самый долговечный вклад. Авторы разбивают сбои на превышение лимита задач, ошибки формата, недопустимые действия и несколько других. Это не баги реализации — это структурные слабости в том, как LLM поддерживают состояние, отслеживают доступные действия и производят разбираемый вывод под многоходовым давлением. Любая серьезная агентская система должна их решать.
Почему это важно для финансового ИИ
Три доминирующих типа сбоев почти напрямую отражают то, что, по моим ожиданиям, сломало бы агента записи в Beancount.
Превышение лимита задач — это режим сбоя при сверке реестра. Закрытие периода по нескольким счетам означает проверку начальных остатков, сопоставление дебетов и кредитов, выявление расхождений и предложение исправлений — цепочка, которая легко занимает 10–20 шагов. Агент, который упирается в лимит контекста или шагов в середине цепочки и сдается, не просто аккуратно сбоит; он может оставить реестр в частично измененном состоянии.
Ошибка формата — это режим сбоя при вводе транзакций. Beancount имеет строгий синтаксис: некорректная проводка (отсутствующая валюта, неправильный отступ, недопустимый флаг) — это ошибка парсера, которая повреждает файл. Агент, который генерирует прозу вокруг своего вывода Beancount или создает синтаксически правильный вид, но в неверном формате, бесполезен. Это основная проблема статьи CRITIC, примененная к более строгой области.
Недопустимое действие — это проблема безопасности записи. Агент Beancount, работающий с реальным реестром, имеет ограниченный набор безопасных операций: добавить транзакцию, исправить флаг, переместить проводку. Галлюцинирование действия вне этого набора — например, удаление счета, на котором еще есть открытые позиции — это ошибка корректности, которая может не всплыть до аудита.
Вывод о том, что «обучение на коде имеет противоречивые эффекты», также релевантен. Запись в Beancount ближе к генерации кода, чем к извлечению знаний, поэтому модель, предобученная на коде, должна быть естественным выбором. Но если обучение на коде вредит следованию диалогам в многоходовых настройках, необходима гибридная оценка, подобная AgentBench, чтобы выявить эти компромиссы до развертывания.
Что читать дальше
- WebArena (Zhou и др., 2024; arXiv:2307.13854) — 812 задач веб-браузинга в живой среде браузера; более глубокое продолжение веб-уровня AgentBench.
- OSWorld (Xie и др., 2024; NeurIPS 2024) — полный бенчмарк среды рабочего стола, включая файловую систему и задачи с GUI; среда ОС в OSWorld — прямой, более глубокий преемник уровня ОС в AgentBench.
- TAU-bench (Yao и др., 2024) — оценивает агентов в средах API розничной торговли и авиакомпаний с реальным использованием инструментов и симуляцией пользователей; ближайший опубликованный бенчмарк к рассмотрению реестра Beancount как среды.





