Перейти к основному содержимому
Beancount.io Logo

#plain-text-accounting

Plain-Text Accounting

Research grounded in plain-text accounting formats and workflows

Учёт неопределенности при делегировании задач LLM-агентами: когда переходить от малых моделей к большим
·mike

Учёт неопределенности при делегировании задач LLM-агентами: когда переходить от малых моделей к большим

ReDAct по умолчанию запускает малую модель и переходит к дорогостоящей модели только тогда, когда перплексия на уровне токенов сигнализирует о неопределенности. Это позволяет сэкономить 64% затрат по сравнению с использованием только GPT-5.2, сохраняя или превосходя её точность — паттерн, напрямую применимый для агентов категоризации транзакций Beancount.

ai
llm
automation
OpenHands: открытая платформа для ИИ-агентов-разработчиков и её значение для автоматизации финансов
·mike

OpenHands: открытая платформа для ИИ-агентов-разработчиков и её значение для автоматизации финансов

OpenHands — это платформа для агентов с лицензией MIT и песочницей Docker, где CodeAct достигает 26% на SWE-Bench Lite. Это отрезвляющий бенчмарк, который показывает реальные возможности ИИ-агентов на сегодня и объясняет, почему первые эффективные внедрения в финансах должны иметь четкие границы, а не быть полностью автономными.

ai
open-source
automation
LLM набирают 2,3% при генерации Beancount DSL: бенчмарк LLMFinLiteracy
·mike

LLM набирают 2,3% при генерации Beancount DSL: бенчмарк LLMFinLiteracy

Бенчмарк LLMFinLiteracy показывает, что пять моделей с открытыми весами (~7B) генерируют полностью корректные транзакции Beancount лишь в 2,3% случаев. Ошибки сосредоточены в области бухгалтерской логики, а не синтаксиса, что указывает на необходимость использования обратной связи от компилятора как критического компонента для создания надежных агентов записи.

llm
beancount
plain-text-accounting
TableMaster: адаптивное рассуждение для понимания таблиц с помощью LLM
·mike

TableMaster: адаптивное рассуждение для понимания таблиц с помощью LLM

TableMaster — это конвейер, основанный исключительно на промптах, который достигает 78,13% на WikiTQ с GPT-4o-mini — на 13 пунктов выше, чем Chain-of-Table — благодаря сочетанию извлечения таблицы фокуса, семантической вербализации и адаптивного переключения между текстовым и символьным рассуждением. Вот что эта архитектура значит для ИИ-агентов, работающих с финансовыми гроссбухами, такими как Beancount.

ai
llm
machine-learning
τ²-bench: Оценка стоимости двойного управления в разговорных ИИ-агентах
·mike

τ²-bench: Оценка стоимости двойного управления в разговорных ИИ-агентах

τ²-bench расширяет бенчмаркинг агентов на условия двойного управления, где и ИИ, и пользователь вызывают инструменты для работы с общим состоянием. Исследование показало, что активные пользователи снижают вероятность успеха на 18–25 процентных пунктов, что имеет прямое значение для агентов Beancount, разделяющих доступ на запись с пользователями.

ai
llm
automation
Бенчмарк GAIA: оценка реальных возможностей передовых ИИ-агентов
·mike

Бенчмарк GAIA: оценка реальных возможностей передовых ИИ-агентов

Бенчмарк GAIA оценивает 466 реальных задач на трех уровнях сложности; к середине 2026 года передовые агенты достигли 74,55% против 92% у людей, а оставшийся разрыв на 3-м уровне напрямую соотносится с проблемами многошаговой координации в автоматизированных рабочих процессах Beancount.

ai
llm
machine-learning
WorkArena: Как LLM веб-агенты справляются с реальными задачами по обработке корпоративных знаний
·mike

WorkArena: Как LLM веб-агенты справляются с реальными задачами по обработке корпоративных знаний

WorkArena тестирует LLM веб-агентов на 33 реальных задачах ServiceNow — GPT-4o достигает 42,7% в целом, но 0% в задачах с фильтрацией списков, выявляя непреодолимую стену между заполнением форм и структурированным взаимодействием с UI, что напрямую коррелирует с проблемами автоматизации журналов Beancount.

ai
llm
automation
τ-bench: Измерение надежности ИИ-агентов в реальных сценариях использования инструментов
·mike

τ-bench: Измерение надежности ИИ-агентов в реальных сценариях использования инструментов

τ-bench показывает, что топовые LLM, такие как Claude 3.5 Sonnet, демонстрируют падение показателя pass@1 с 0,692 до 0,462 для pass@4 в задачах обслуживания розничных клиентов — «обрыв согласованности», имеющий прямое значение для любого агента с правом записи в журнале Beancount.

ai
llm
machine-learning
Chain-of-Table: Эволюция таблиц в цепочке рассуждений LLM
·mike

Chain-of-Table: Эволюция таблиц в цепочке рассуждений LLM

Chain-of-Table (ICLR 2024) улучшает табличные рассуждения LLM, превращая саму таблицу в промежуточное состояние — достигая точности 67,31% на WikiTQ против 61,48% у предыдущих базовых моделей, с преимуществом в +10,25 пункта на таблицах объемом более 4 000 токенов и прямой применимостью к агентам запросов в книгах Beancount.

ai
llm
machine-learning
TableLlama: Может ли открытая модель 7B сравниться с GPT-4 в понимании таблиц?
·mike

TableLlama: Может ли открытая модель 7B сравниться с GPT-4 в понимании таблиц?

TableLlama дообучает Llama 2 (7B) на 2,6 млн примеров задач с таблицами и превосходит GPT-4 в структурных задачах, таких как аннотирование типов столбцов (F1 94 против 32), но отстает на 33 пункта в композиционном рассуждении WikiTQ — выверенный бенчмарк возможностей и ограничений открытых моделей 7B в финансовом ИИ сегодня.

llm
ai
machine-learning
TAPAS: слабо контролируемое табличное QA без SQL и что это значит для Beancount
·mike

TAPAS: слабо контролируемое табличное QA без SQL и что это значит для Beancount

TAPAS (Google Research, ACL 2020) отвечает на вопросы по таблицам, выбирая ячейки и применяя скалярные агрегации без генерации SQL. В этом посте анализируется архитектура, прирост точности SQA на 12 пунктов и причины, по которым парадигма выбора ячеек подходит для небольших запросов к реестру Beancount, но не масштабируется.

ai
machine-learning
llm
DIN-SQL: декомпозированное обучение в контексте для преобразования текста в SQL
·mike

DIN-SQL: декомпозированное обучение в контексте для преобразования текста в SQL

DIN-SQL (NeurIPS 2023) разделяет процесс преобразования текста в SQL на этапы связывания схемы, классификации сложности и генерации SQL, повышая точность выполнения GPT-4 на Spider с 67,4% до 85,3% без дообучения — и та же стратегия декомпозиции напрямую применима к интерфейсам на естественном языке для языка запросов Beancount (BQL).

ai
llm
database
Показано 1–12 из 33 записей
1 / 3След.