
TableMaster: адаптивне міркування для розуміння таблиць за допомогою LLM
TableMaster досягає 78,13% на WikiTQ з GPT-4o-mini, на 13 балів більше за Chain-of-Table, через table-of-focus та адаптивне міркування для агентів над журналами Beancount.
#queries
Генерація запитів, міркування над таблицями та структурований пошук даних

TableMaster досягає 78,13% на WikiTQ з GPT-4o-mini, на 13 балів більше за Chain-of-Table, через table-of-focus та адаптивне міркування для агентів над журналами Beancount.

Chain-of-Table hits 67.31% on WikiTQ versus 61.48% for text-only chain-of-thought, and leads by 10.25 points on tables over 4,000 tokens.

TableLlama перемагає GPT-4 в анотації типів стовпців (F1 94 проти 32), але відстає на 33 пункти в композиційних міркуваннях на WikiTQ.

TAPAS відповідає на запитання до таблиць, вибираючи комірки, а не генеруючи SQL. Він підходить для невеликих запитів до журналу Beancount, але не витримує масштабу.

Триагентна архітектура MAC-SQL досягає 59,59% точності виконання на BIRD, а Refiner додає +4,63 бала — шаблон для генерації запитів до журналу Beancount.

DIN-SQL підвищує точність виконання GPT-4 на Spider з 67,4% до 85,3% через етапи зв'язування схеми та самокорекції — таке ж розкладання підходить для BQL у Beancount.

На BIRD, GPT-4 досягає 54,89% точності виконання з підказками домену та 34,88% без них — розрив у 20 пунктів, який будь-який інтерфейс Beancount NL→BQL має подолати.

GraphRAG від Microsoft фіксує 72–83% переваг у sensemaking над векторним RAG; аудит 2025 року зводить їх нанівець після виправлення упередженості судді — застереження для QA в багатодокументних бухгалтерських книгах.