
TableMaster: Raciocínio Adaptativo para Compreensão de Tabelas com LLMs
O TableMaster atinge 78,13% no WikiTQ com o GPT-4o-mini, 13 pontos acima do Chain-of-Table, via table-of-focus e raciocínio adaptativo para agentes sobre livros Beancount.
#queries
Geração de consultas, raciocínio sobre tabelas e recuperação de dados estruturados para IA financeira

O TableMaster atinge 78,13% no WikiTQ com o GPT-4o-mini, 13 pontos acima do Chain-of-Table, via table-of-focus e raciocínio adaptativo para agentes sobre livros Beancount.

O Chain-of-Table atinge 67,31% no WikiTQ contra 61,48% do chain-of-thought puramente textual, e lidera por 10,25 pontos em tabelas com mais de 4.000 tokens.

O TableLlama supera o GPT-4 na anotação de tipos de coluna (F1 94 vs 32), mas fica 33 pontos atrás no raciocínio composicional do WikiTQ.

O TAPAS responde perguntas sobre tabelas selecionando células, nunca gerando SQL. Ele se adequa a consultas pequenas de ledger Beancount, mas quebra em escala.

O design de três agentes do MAC-SQL atinge 59,59% de acurácia de execução no BIRD, com o Refiner somando +4,63 pontos — um modelo para gerar consultas de ledger Beancount.

O DIN-SQL eleva o GPT-4 de 67,4% para 85,3% de precisão de execução no Spider por meio de etapas de schema-link e autocorreção — a mesma decomposição se aplica ao BQL do Beancount.

No BIRD, o GPT-4 atinge 54.89% de precisão de execução com dicas de domínio e 34.88% sem—uma diferença de 20 pontos que qualquer interface Beancount NL→BQL precisa superar.

O GraphRAG da Microsoft registra vitórias de 72–83% em sensemaking sobre RAG vetorial; uma auditoria de 2025 as derruba após corrigir o viés do juiz—cautela para QA em livros-razão multi-documento.