
Сможет ли ваш агент свести эти книги?
Один прогон агента свёл регистр из трёх строк к 2958.50 USD на расчётном счёте и 1958.50 USD сентябрьской прибыли, восстановившись после сбоя, который он сам диагностировал.
#plain-text-accounting
Исследования на основе текстовых форматов и процессов бухгалтерского учёта

Один прогон агента свёл регистр из трёх строк к 2958.50 USD на расчётном счёте и 1958.50 USD сентябрьской прибыли, восстановившись после сбоя, который он сам диагностировал.

ReDAct переходит от малой модели к большой только когда перплексия сигнализирует о неопределённости, снижая затраты на 64% при той же точности для рабочих процессов агентов.

Агент CodeAct от OpenHands набирает 26% на SWE-Bench Lite, показывая, что ИИ-агенты умеют надёжно сегодня. Автоматизацию финансов стоит начинать узко, а не автономно.

LLMFinLiteracy выясняет, что пять моделей ~7B корректно пишут транзакции Beancount лишь в 2,3% случаев, ошибаясь в бухгалтерских рассуждениях, а не в синтаксисе.

TableMaster достигает 78,13% на WikiTQ с GPT-4o-mini, на 13 пунктов выше Chain-of-Table, через table-of-focus плюс адаптивные рассуждения для агентов над регистрами Beancount.

τ²-bench показывает, что активные пользователи со своими инструментами снижают успех разговорных агентов на 18–25 баллов. Агенты Beancount с общей записью теряют так же.

466 задач GAIA показывают передовых ИИ-агентов на уровне 74,55% против 92% у людей, а координация уровня 3 остаётся самым сложным разрывом.

33 задачи ServiceNow в WorkArena показывают GPT-4o на уровне 42.7% в целом, но 0% на фильтрах списков — стена, которую должно преодолеть структурированное взаимодействие с UI.

τ-bench показывает, что лучшие LLM падают с pass@1 0,692 до pass@4 0,462 на розничных задачах. Агенты, пишущие в леджер, ждут тот же обрыв согласованности.

Chain-of-Table достигает 67,31% на WikiTQ против 61,48% для текстовой цепочки рассуждений и лидирует на 10,25 пункта на таблицах свыше 4 000 токенов.

TableLlama превосходит GPT-4 в аннотации типов столбцов (F1 94 против 32), но отстаёт на 33 балла в композиционных рассуждениях на WikiTQ.

TAPAS отвечает на вопросы к таблицам, выбирая ячейки, а не генерируя SQL. Он подходит для небольших запросов к регистру Beancount, но не справляется в масштабе.