
TableMaster: Raonament adaptatiu per a la comprensió de taules amb LLM
TableMaster assoleix un 78,13% a WikiTQ amb GPT-4o-mini, 13 punts més que Chain-of-Table, via table-of-focus i raonament adaptatiu per a agents sobre llibres Beancount.
#queries
Generació de consultes, raonament sobre taules i recuperació de dades estructurades per a IA financera

TableMaster assoleix un 78,13% a WikiTQ amb GPT-4o-mini, 13 punts més que Chain-of-Table, via table-of-focus i raonament adaptatiu per a agents sobre llibres Beancount.

Chain-of-Table hits 67.31% on WikiTQ versus 61.48% for text-only chain-of-thought, and leads by 10.25 points on tables over 4,000 tokens.

TableLlama supera GPT-4 en anotació de tipus de columna (F1 94 vs 32), però queda 33 punts enrere en raonament composicional a WikiTQ.

TAPAS answers table questions by selecting cells, never generating SQL. It fits small Beancount ledger queries but breaks down at scale.

El disseny de tres agents de MAC-SQL assoleix 59,59% de precisió d'execució a BIRD, amb el Refiner afegint +4,63 punts: una plantilla per generar consultes de llibre Beancount.

DIN-SQL eleva GPT-4 de 67,4% a 85,3% d'exactitud d'execució Spider mitjançant etapes d'enllaç d'esquema i auto-correcció—la mateixa descomposició s'aplica a Beancount BQL.

A BIRD, GPT-4 arriba al 54,89% de precisió d'execució amb pistes de domini i al 34,88% sense—una diferència de 20 punts que qualsevol interfície NL→BQL de Beancount ha de tancar.

El GraphRAG de Microsoft publica guanys de comprensió del 72–83% sobre el RAG vectorial; una auditoria del 2025 els esfondra després de corregir el biaix del jutge—advertència per a la QA de llibres multi-doc.