
TableMaster: Adaptives Denken für das Tabellenverständnis mit LLMs
TableMaster erreicht 78,13 % bei WikiTQ mit GPT-4o-mini, 13 Punkte über Chain-of-Table, mittels Table-of-Focus plus adaptivem Reasoning für Agenten über Beancount-Hauptbüchern.
#queries
Abfragegenerierung, Tabellenreasoning und strukturierter Datenabruf für Finanz-KI

TableMaster erreicht 78,13 % bei WikiTQ mit GPT-4o-mini, 13 Punkte über Chain-of-Table, mittels Table-of-Focus plus adaptivem Reasoning für Agenten über Beancount-Hauptbüchern.

Chain-of-Table erreicht 67,31 % in WikiTQ gegenüber 61,48 % für rein textbasiertes Chain-of-Thought und führt bei Tabellen über 4.000 Token um 10,25 Punkte.

TableLlama schlägt GPT-4 bei der Spaltentypannotation (F1 94 vs. 32), liegt aber beim kompositionellen Denken in WikiTQ um 33 Punkte zurück.

TAPAS beantwortet Tabellenfragen durch Auswahl von Zellen, ohne SQL zu generieren. Es eignet sich für kleine Beancount-Ledger-Abfragen, versagt aber bei Skalierung.

MAC-SQLs Drei-Agenten-Design erreicht 59,59% Ausführungsgenauigkeit auf BIRD, der Refiner trägt +4,63 Punkte bei – eine Vorlage für Beancount-Ledger-Abfragen.

DIN-SQL hebt GPT-4 von 67,4% auf 85,3% Spider-Ausführungsgenauigkeit durch Schema-Link- und Selbstkorrektur-Phasen – dieselbe Zerlegung passt zu Beancount BQL.

Auf BIRD erreicht GPT-4 54,89 % Ausführungsgenauigkeit mit Domain-Hinweisen und 34,88 % ohne – eine Lücke von 20 Punkten, die jede Beancount-NL→BQL-Schnittstelle schließen muss.

Microsofts GraphRAG erzielt 72–83% Sensemaking-Siege gegenüber Vektor-RAG; eine 2025-Audit lässt diese nach Korrektur der Richter-Verzerrung kollabieren—Vorsicht bei Multi-Dokument-Hauptbuch-QA.