
TableMaster: Adaptief redeneren voor tabelbegrip met LLM's
TableMaster behaalt 78,13% op WikiTQ met GPT-4o-mini, 13 punten boven Chain-of-Table, via table-of-focus plus adaptief redeneren voor agents op Beancount-grootboeken.
#queries
Querygeneratie, tabelredenering en gestructureerde dataretrieval voor financiële AI

TableMaster behaalt 78,13% op WikiTQ met GPT-4o-mini, 13 punten boven Chain-of-Table, via table-of-focus plus adaptief redeneren voor agents op Beancount-grootboeken.

Chain-of-Table haalt 67,31% op WikiTQ tegen 61,48% voor tekstuele chain-of-thought, en leidt met 10,25 punten op tabellen boven 4.000 tokens.

TableLlama verslaat GPT-4 bij kolomtype-annotatie (F1 94 versus 32), maar blijft 33 punten achter bij WikiTQ compositioneel redeneren.

TAPAS beantwoordt tabelvragen door cellen te selecteren, nooit door SQL te genereren. Het past bij kleine Beancount-grootboekquery's maar bezwijkt op schaal.

MAC-SQL's drie-agent-ontwerp haalt 59,59% uitvoeringsnauwkeurigheid op BIRD, met de Refiner die +4,63 punten toevoegt — een template voor Beancount-grootboekquery's.

DIN-SQL tilt GPT-4 van 67,4% naar 85,3% Spider-uitvoeringsnauwkeurigheid via schema-link en zelfcorrectiefasen—dezelfde decompositie past op Beancount BQL.

Op BIRD bereikt GPT-4 54,89% uitvoeringsnauwkeurigheid met domeinhints en 34,88% zonder—een kloof van 20 punten die elke Beancount NL→BQL-interface moet dichten.

Microsofts GraphRAG boekt 72–83% winst in begripsvorming ten opzichte van vector-RAG; een audit uit 2025 doet die in elkaar storten na correctie van beoordelaarsbias—een waarschuwing voor multi-document grootboek-QA.