Когато попитам какво всъщност трябва да прави надеждно един Beancount агент за запис, отговорът не е „генериране на текст“ — а „изпълнение на последователност от действия в структурирана среда, без да излезе извън релсите“. AgentBench (Liu et al., Tsinghua, ICLR 2024) е едно от първите сериозни усилия да се измери тази способност в мащаб, и моментната снимка от 2023 г. все още съдържа уроци, които си струва да бъдат извлечени.
Статията
AgentBench, от Xiao Liu и 21 съавтори от университета Tsinghua, дефинира осем среди, предназначени да тестват LLM като интерактивни агенти, а не като пасивни генератори на текст. Пет от средите са оригинални: OS (bash взаимодействие), Database (SQL генериране и възстановяване от грешки), Knowledge Graph (структурирани заявки на база инструменти), Digital Card Game (многоетапна стратегическа конкуренция) и Lateral Thinking Puzzles (дедуктивен диалог). Три са адаптирани от предишни набори от данни: House-Holding от ALFWorld, Web Shopping от WebShop и Web Browsing от Mind2Web. Статията оценява 27 модела — търговски API модели и модели с отворен код до 70B — върху приблизително 4 000 генерации от dev-разделянето и 13 000 от test-разделянето, и докладва както нива на успех за всяка среда, така и обобщен общ резултат.
Ключови идеи
- GPT-4 води с общ резултат 4.01. Claude-2 постига 2.49, GPT-3.5-turbo 2.32. CodeLlama-34B, най-силният модел с отворен код към момента на подаване, постига само 0.96. API моделите средно постигат 2.24, докато моделите с отворен код — 0.42.
- GPT-4 постига 42.4% на OS, 32.0% на Database и 78.0% на House-Holding — разликата показва кои среди възнаграждават следване на инструкции, за разлика от структурирано разсъждение.
- „Превишен лимит на задачите“ е доминиращият режим на отказ: 67.9% от отказите при Knowledge Graph достигат бюджетния лимит за стъпки, преди да решат задачата. Това е отказ в дългосрочното разсъждение, а не липса на знания.
- Грешките в съответствието с формата представляват 53.3% от отказите при Database — агентът произвежда синтактично невалиден SQL или обвива заявките в проза, която оценителят не може да разбере.
- Невалидният избор на действие движи 64.1% от отказите при House-Holding — агентът назовава действие, което не е налично в текущото състояние.
- Обучението върху код има „противоречиви ефекти върху различните задачи“: помага на среди, изискващи следване на процедури, но може да навреди на общото разсъждение в диалогово-ориентираните.
Какво издържа — и какво не
Основният дизайнерски избор — многосредова, многоетапна, интерактивна оценка — е правилен и все още недостатъчно използван. Повечето LLM бенчмаркове все още измерват качеството на едноетапна генерация; AgentBench правилно настоява, че агентите трябва да продължават да вземат решения, докато задачата не е изпълнена или бюджетът не е изчерпан.
Това казано, моментната снимка е остаряла по начини, които имат значение. Разликата между GPT-4 (4.01) и най-добрия модел с отворен код (0.96) изглеждаше тревожна в средата на 2023 г., но до 2025 г. тя до голяма степен се е затворила. Модели като Llama 3.1 70B или Qwen 2.5 72B вече преодоляват пречките за следване на инструкции и съответствие с формата, които преди две години бяха нови препятствия. Четенето на статията като „моделите с отворен код не могат да изпълняват агентни задачи“ би било грешка; четенето ѝ като „съответствието с формата и дългосрочната последователност са трудните проблеми“ остава правилно.
Съществува и компромис между широчина и дълбочина. Осем среди звучат изчерпателно, но всяка е относително плитка. WebArena (Zhou et al., 2024) покрива 812 дългосрочни задачи по шаблон само за уеб сърфиране; OSWorld (Xie et al., 2024) оценява 369 реални десктоп задачи на Ubuntu и Windows. AgentBench може да даде сигнал за различни среди, но не замества домейн-специфичен бенчмарк, след като знаете коя среда ви интересува.
Таксономията на режимите на отказ в Таблица 4 е вероятно най-трайният принос. Авторите разделят отказите на превишен лимит на задачите, грешка във формата, невалидно действие и няколко други. Това не са грешки в имплементацията — те са структурни слабости в начина, по който LLM поддържат състояние, проследяват наличните действия и произвеждат разбираем изход под многоетапен натиск. Всяка сериозна агентна система трябва да се справи с тях.
Защо това е важно за финансовия ИИ
Трите доминиращи режима на отказ се пренасят почти директно върху това, което очаквам да счупи един Beancount агент за запис.
Превишен лимит на задачите е режимът на отказ при съгласуване на сметки. Затварянето на период през множество сметки означава проверка на начални салда, съпоставяне на дебити и кредити, идентифициране на разминавания и предлагане на корекции — верига, която лесно достига 10–20 стъпки. Агент, който достигне контекстния или бюджетния лимит в средата на веригата и се откаже, не просто се проваля грациозно; той може да остави сметководната книга в частично променено състояние.
Грешка във формата е режимът на отказ при въвеждане на транзакции. Beancount има строг синтаксис: неправилно форматирана позиция (липсваща валута, грешен отстъп, невалиден флаг) е грешка в парсера, която уврежда файла. Агент, който генерира проза около своя Beancount изход, или произвежда синтаксис, който изглежда правилен, но е в грешен формат, е безполезен. Това е основният проблем на статията CRITIC, приложен към по-строг домейн.
Невалидно действие е проблемът с безопасността при запис. Един Beancount агент, работещ върху реална сметководна книга, има ограничен набор от безопасни операции: добавяне на транзакция, коригиране на флаг, преместване на позиция. Халюцинирането на действие извън този набор — например изтриване на сметка, която все още има отворени позиции — е грешка в коректността, която може да не излезе наяве до одит.
Откритието, че „обучението върху код има противоречиви ефекти“, също е от значение. Beancount записът е по-близо до генериране на код, отколкото до извличане на знания, така че модел, предварително обучен върху код, би трябвало да е естествен избор. Но ако обучението върху код вреди на следването на диалог в многоетапни среди, хибридна оценка като AgentBench е необходима, за да се разкрият тези компромиси преди внедряване.
Какво да прочетете след това
- WebArena (Zhou et al., 2024; arXiv:2307.13854) — 812 задачи за уеб сърфиране в жива браузърна среда; по-задълбоченото продължение на уеб нивото на AgentBench.
- OSWorld (Xie et al., 2024; NeurIPS 2024) — пълен бенчмарк за десктоп среда, включващ файлова система и GUI задачи; OS средата на OSWorld е директен, по-задълбочен наследник на OS нивото на AgentBench.
- TAU-bench (Yao et al., 2024) — оценява агенти в среди с API за търговия на дребно и авиолинии, с реално използване на инструменти и симулация на потребители; най-близкият публикуван бенчмарк до третиране на Beancount сметководна книга като среда.





