Перейти к основному содержимому

Журнал исследований Bean Labs

AgentBench: Оценка LLM как агентов — уроки для надежности финансового ИИ

Опубликовано Обновлено 5 мин чтенияMike ThriftMike Thrift
AgentBench: Оценка LLM как агентов — уроки для надежности финансового ИИ

Статья: https://arxiv.org/abs/2308.03688

Содержание страницы

Когда я спрашиваю, что именно должен надежно делать агент записи в Beancount, ответ — не «генерировать текст», а «выполнять последовательность действий в структурированной среде, не сбиваясь с пути». AgentBench (Liu и др., Университет Цинхуа, ICLR 2024) — одна из первых серьезных попыток измерить эту способность в масштабе, и срез данных 2023 года все еще содержит уроки, которые стоит извлечь.

Статья​

AgentBench, авторы которого — Сяо Лю и 21 соавтор из Университета Цинхуа, определяет восемь сред, предназначенных для стресс-тестирования LLM как интерактивных агентов, а не пассивных генераторов текста. Пять сред являются оригинальными: ОС (взаимодействие с bash), База данных (генерация SQL и восстановление после ошибок), Граф знаний (структурированные запросы на основе инструментов), Цифровая карточная игра (многораундовая стратегическая конкуренция) и Загадки на латеральное мышление (дедуктивный диалог). Три адаптированы из предыдущих наборов данных: House-Holding из ALFWorld, Web Shopping из WebShop и Web Browsing из Mind2Web. В статье оценивается 27 моделей — коммерческие API-модели и модели с открытым исходным кодом размером до 70B — на примерно 4 000 генераций dev-разбиения и 13 000 генераций test-разбиения, и сообщается как о показателях успеха в каждой среде, так и о комплексном общем балле.

Ключевые идеи​

  • GPT-4 лидирует с общим баллом 4.01. Claude-2 набирает 2.49, GPT-3.5-turbo — 2.32. CodeLlama-34B, самая сильная модель с открытым исходным кодом на момент подачи, набирает лишь 0.96. API-модели в среднем набирают 2.24 против 0.42 у моделей с открытым исходным кодом.
  • GPT-4 набирает 42.4% в ОС, 32.0% в Базах данных и 78.0% в House-Holding — разброс показывает, какие среды вознаграждают следование инструкциям, а какие — структурированное рассуждение.
  • «Превышение лимита задач» — доминирующий тип сбоев: 67.9% сбоев в Графе знаний достигают лимита шагов, не решив задачу. Это сбой долгосрочного рассуждения, а не нехватка знаний.
  • Ошибки соответствия формату составляют 53.3% сбоев в Базах данных — агент генерирует синтаксически недопустимый SQL или оборачивает запросы в прозу, которую оценщик не может распарсить.
  • Выбор недопустимых действий определяет 64.1% сбоев в House-Holding — агент называет действие, недоступное в текущем состоянии.
  • Обучение на коде имеет «противоречивые эффекты в разных задачах»: оно помогает средам, требующим следования процедурам, но может навредить общему рассуждению в средах, насыщенных диалогами.

Что выдерживает проверку — а что нет​

Основное дизайнерское решение — многосредовая, многоходовая, интерактивная оценка — правильное и до сих пор недоиспользуемое. Большинство LLM-бенчмарков по-прежнему измеряют качество одноходовой генерации; AgentBench справедливо настаивает на том, что агенты должны продолжать принимать решения, пока задача не выполнена или бюджет не исчерпан.

Тем не менее, срез данных устарел в важных аспектах. Разрыв между GPT-4 (4.01) и лучшей моделью с открытым исходным кодом (0.96) выглядел тревожным в середине 2023 года, но к 2025 году он в значительной степени сократился. Такие модели, как Llama 3.1 70B или Qwen 2.5 72B, теперь легко преодолевают барьеры следования инструкциям и соответствия формату, которые два года назад были новыми препятствиями. Читать статью как «модели с открытым исходным кодом не способны на агентские задачи» было бы ошибкой; читать ее как «соответствие формату и долгосрочная согласованность — вот сложные проблемы» остается верным.

Также существует компромисс между широтой и глубиной. Восемь сред звучат всесторонне, но каждая относительно неглубокая. WebArena (Zhou и др., 2024) охватывает 812 долгосрочных шаблонных задач только для веб-браузинга; OSWorld (Xie и др., 2024) тестирует 369 реальных задач на рабочем столе в Ubuntu и Windows. AgentBench может дать сигнал по нескольким средам, но он не заменяет доменно-специфичный бенчмарк, как только вы знаете, какая среда вас интересует.

Таксономия сбоев в Таблице 4, вероятно, самый долговечный вклад. Авторы разбивают сбои на превышение лимита задач, ошибки формата, недопустимые действия и несколько других. Это не баги реализации — это структурные слабости в том, как LLM поддерживают состояние, отслеживают доступные действия и производят разбираемый вывод под многоходовым давлением. Любая серьезная агентская система должна их решать.

Почему это важно для финансового ИИ​

Три доминирующих типа сбоев почти напрямую отражают то, что, по моим ожиданиям, сломало бы агента записи в Beancount.

Превышение лимита задач — это режим сбоя при сверке реестра. Закрытие периода по нескольким счетам означает проверку начальных остатков, сопоставление дебетов и кредитов, выявление расхождений и предложение исправлений — цепочка, которая легко занимает 10–20 шагов. Агент, который упирается в лимит контекста или шагов в середине цепочки и сдается, не просто аккуратно сбоит; он может оставить реестр в частично измененном состоянии.

Ошибка формата — это режим сбоя при вводе транзакций. Beancount имеет строгий синтаксис: некорректная проводка (отсутствующая валюта, неправильный отступ, недопустимый флаг) — это ошибка парсера, которая повреждает файл. Агент, который генерирует прозу вокруг своего вывода Beancount или создает синтаксически правильный вид, но в неверном формате, бесполезен. Это основная проблема статьи CRITIC, примененная к более строгой области.

Недопустимое действие — это проблема безопасности записи. Агент Beancount, работающий с реальным реестром, имеет ограниченный набор безопасных операций: добавить транзакцию, исправить флаг, переместить проводку. Галлюцинирование действия вне этого набора — например, удаление счета, на котором еще есть открытые позиции — это ошибка корректности, которая может не всплыть до аудита.

Вывод о том, что «обучение на коде имеет противоречивые эффекты», также релевантен. Запись в Beancount ближе к генерации кода, чем к извлечению знаний, поэтому модель, предобученная на коде, должна быть естественным выбором. Но если обучение на коде вредит следованию диалогам в многоходовых настройках, необходима гибридная оценка, подобная AgentBench, чтобы выявить эти компромиссы до развертывания.

Что читать дальше​

  • WebArena (Zhou и др., 2024; arXiv:2307.13854) — 812 задач веб-браузинга в живой среде браузера; более глубокое продолжение веб-уровня AgentBench.
  • OSWorld (Xie и др., 2024; NeurIPS 2024) — полный бенчмарк среды рабочего стола, включая файловую систему и задачи с GUI; среда ОС в OSWorld — прямой, более глубокий преемник уровня ОС в AgentBench.
  • TAU-bench (Yao и др., 2024) — оценивает агентов в средах API розничной торговли и авиакомпаний с реальным использованием инструментов и симуляцией пользователей; ближайший опубликованный бенчмарк к рассмотрению реестра Beancount как среды.

Источник: https://beancount.io/ru/bean-labs/research-logs/2026/05/06/agentbench-evaluating-llms-as-agents

Опубликовано: 6 мая 2026 г.

Обновлено: 14 сентября 2026 г.

6 мин чтения

τ-bench: Измерение надежности ИИ-агентов в реальных сценариях использования инструментов

τ-bench показывает, что лучшие LLM падают с pass@1 0,692 до pass@4 0,462 на…

ai
llm
5 мин чтения

FinToolBench: Оценка LLM-агентов на реальном использовании финансовых инструментов

FinToolBench обнаруживает несоответствие намерений выше 50% у всех…

ai
llm
6 мин чтения

Затерянные посередине: позиционное смещение в LLM и его влияние на финансовый ИИ

LLM показывают до 20 баллов хуже, когда ответ стоит в середине контекста,…

llm
ai
5 мин чтения

OSWorld: настольные ИИ-агенты справляются с 12% задач, в то время как люди — с 72%

OSWorld обнаруживает, что настольные ИИ-агенты справляются с 12,24% реальных…

ai
machine-learning
6 мин чтения

WildToolBench: Почему ни одна LLM не превышает 15% точности сессии в реальных сценариях использования инструментов

WildToolBench обнаруживает, что ни одна LLM не превышает 15% точности сессий на…

ai
llm