
TableMaster:基于大语言模型的表格理解自适应推理
TableMaster 搭配 GPT-4o-mini 在 WikiTQ 上达到 78.13%,比 Chain-of-Table 高 13 个百分点,其方法是面向 Beancount 账本智能体的关注表加自适应推理。
#queries

TableMaster 搭配 GPT-4o-mini 在 WikiTQ 上达到 78.13%,比 Chain-of-Table 高 13 个百分点,其方法是面向 Beancount 账本智能体的关注表加自适应推理。

Chain-of-Table 在 WikiTQ 上达 67.31%,纯文本思维链为 61.48%,在超过 4,000 token 的表格上领先 10.25 个点。

TableLlama 在列类型标注上胜过 GPT-4(F1 94 对 32),但在 WikiTQ 组合推理上落后 33 个点。

TAPAS 通过选择单元格回答表格问题,从不生成 SQL。它适合小型 Beancount 账本查询,但在规模扩大时会失效。

MAC-SQL 的三智能体设计在 BIRD 上达到 59.59% 的执行准确率,其中 Refiner 额外贡献 +4.63 个百分点——这正是生成 Beancount 账本查询的模板。

DIN-SQL 通过 schema-link 和自校正阶段,将 GPT-4 在 Spider 上的执行准确率从 67.4% 提升至 85.3%——这种分解同样适用于 Beancount BQL。

在BIRD上,GPT-4在领域提示下达到54.89%的执行准确率,无提示时为34.88%——这是任何Beancount NL→BQL界面必须缩小的20个百分点的差距。

微软的GraphRAG在多文档账查询中声称比向量RAG有72–83%的理解优势;2025年审计在修正裁判偏差后,这些优势消失——多文档账查询需谨慎。