
TableMaster: Adaptívne uvažovanie pre porozumenie tabuľkám pomocou LLM
TableMaster dosahuje 78,13 % na WikiTQ s GPT-4o-mini, o 13 bodov viac než Chain-of-Table, vďaka table-of-focus a adaptívnemu uvažovaniu pre agentov nad Beancount ledgermi.
#queries
Generovanie dotazov, tabuľkové uvažovanie a retrieval štruktúrovaných dát pre finančnú AI

TableMaster dosahuje 78,13 % na WikiTQ s GPT-4o-mini, o 13 bodov viac než Chain-of-Table, vďaka table-of-focus a adaptívnemu uvažovaniu pre agentov nad Beancount ledgermi.

Chain-of-Table hits 67.31% on WikiTQ versus 61.48% for text-only chain-of-thought, and leads by 10.25 points on tables over 4,000 tokens.

TableLlama prekonáva GPT-4 v anotácii typu stĺpca (F1 94 vs 32), no zaostáva o 33 bodov v kompozičnom uvažovaní na WikiTQ.

TAPAS odpovedá na otázky o tabuľkách výberom buniek, nikdy negeneruje SQL. Hodí sa na malé dotazy nad Beancount ledgerom, ale pri väčšom rozsahu zlyháva.

Trojagentový dizajn MAC-SQL dosahuje 59,59 % presnosti vykonania na BIRD, pričom Refiner pridáva +4,63 bodu — šablóna na generovanie dotazov nad Beancount ledgerom.

DIN-SQL posúva GPT-4 z 67,4% na 85,3% presnosti vykonávania na Spideri cez fázy schema-link a self-correct — rovnaký rozklad sa hodí aj na Beancount BQL.

Na BIRD dosahuje GPT-4 presnosť vykonávania 54,89 % s doménovými nápoveďami a 34,88 % bez nich – rozdiel 20 bodov, ktorý musí každé rozhranie NL→BQL v Beancount preklenúť.

GraphRAG od Microsoftu hlási 72–83% výhier v porozumení nad vektorovým RAG; audit z roku 2025 ich po oprave zaujatosti sudcu znižuje – varovanie pre QA vo viacdokumentových účtovných knihách.