
Чи збалансує ваш агент ці книги?
Один запуск агента звірив леджер із трьох рядків до 2958.50 USD на рахунку checking і 1958.50 USD вересневого прибутку, відновившись після збою, який він сам діагностував.
#plain-text-accounting
Дослідження на основі форматів і процесів текстової бухгалтерії

Один запуск агента звірив леджер із трьох рядків до 2958.50 USD на рахунку checking і 1958.50 USD вересневого прибутку, відновившись після збою, який він сам діагностував.

ReDAct делегує від малої моделі до великої лише коли перплексія сигналізує про невизначеність, скорочуючи витрати на 64% за тієї ж точності для агентних робочих процесів.

Агент CodeAct від OpenHands набирає 26% на SWE-Bench Lite, показуючи, що AI-агенти надійно роблять сьогодні. Фінансову автоматизацію варто починати вузько, не з автономії.

LLMFinLiteracy: п'ять моделей ~7B пишуть правильні проводки Beancount лише у 2,3% випадків, помиляючись у бухгалтерських міркуваннях, а не в синтаксисі.

TableMaster досягає 78,13% на WikiTQ з GPT-4o-mini, на 13 балів більше за Chain-of-Table, через table-of-focus та адаптивне міркування для агентів над журналами Beancount.

τ²-bench показує: активні користувачі з власними інструментами знижують успішність розмовних агентів на 18–25 пунктів. Агенти Beancount зі спільним записом втрачають так само.

466 завдань GAIA показують найкращі AI-агенти на рівні 74,55% проти 92% у людей, а координація Level 3 залишається найскладнішою прогалиною.

33 завдання WorkArena у ServiceNow показують GPT-4o на рівні 42,7% загалом, але 0% на фільтрах списків — стіна, яку має подолати структурована взаємодія з UI.

τ-bench показує, що найкращі LLM падають з pass@1 0,692 до pass@4 0,462 на задачах роздрібних інструментів. Агенти із записом у реєстр мають ту саму прірву.

Chain-of-Table hits 67.31% on WikiTQ versus 61.48% for text-only chain-of-thought, and leads by 10.25 points on tables over 4,000 tokens.

TableLlama перемагає GPT-4 в анотації типів стовпців (F1 94 проти 32), але відстає на 33 пункти в композиційних міркуваннях на WikiTQ.

TAPAS відповідає на запитання до таблиць, вибираючи комірки, а не генеруючи SQL. Він підходить для невеликих запитів до журналу Beancount, але не витримує масштабу.