
TableMaster: адаптивное рассуждение для понимания таблиц с помощью LLM
TableMaster достигает 78,13% на WikiTQ с GPT-4o-mini, на 13 пунктов выше Chain-of-Table, через table-of-focus плюс адаптивные рассуждения для агентов над регистрами Beancount.
#queries
Генерация запросов, работа с таблицами и извлечение структурированных данных

TableMaster достигает 78,13% на WikiTQ с GPT-4o-mini, на 13 пунктов выше Chain-of-Table, через table-of-focus плюс адаптивные рассуждения для агентов над регистрами Beancount.

Chain-of-Table достигает 67,31% на WikiTQ против 61,48% для текстовой цепочки рассуждений и лидирует на 10,25 пункта на таблицах свыше 4 000 токенов.

TableLlama превосходит GPT-4 в аннотации типов столбцов (F1 94 против 32), но отстаёт на 33 балла в композиционных рассуждениях на WikiTQ.

TAPAS отвечает на вопросы к таблицам, выбирая ячейки, а не генерируя SQL. Он подходит для небольших запросов к регистру Beancount, но не справляется в масштабе.

Трёхагентная архитектура MAC-SQL достигает 59,59% точности выполнения на BIRD, а Refiner добавляет +4,63 пункта — шаблон для генерации запросов к регистру Beancount.

DIN-SQL повышает точность выполнения GPT-4 на Spider с 67,4% до 85,3% за счет этапов связывания схемы и самокоррекции — та же декомпозиция применима к BQL в Beancount.

На BIRD GPT-4 достигает 54,89% точности выполнения с подсказками по домену и 34,88% без них — разрыв в 20 пунктов, который должен закрыть любой интерфейс Beancount NL→BQL.

GraphRAG от Microsoft показывает 72–83% преимуществ в осмыслении над векторным RAG; аудит 2025 года их устраняет после исправления смещения судьи — осторожность для QA в многодокументных бухгалтерских книгах.