
TableMaster:LLMを用いたテーブル理解のための適応的推論
TableMasterはGPT-4o-miniでWikiTQの78.13%を達成し、Chain-of-Tableを13ポイント上回る。table-of-focusと適応的推論により、Beancount台帳上のエージェントを実現。
#queries

TableMasterはGPT-4o-miniでWikiTQの78.13%を達成し、Chain-of-Tableを13ポイント上回る。table-of-focusと適応的推論により、Beancount台帳上のエージェントを実現。

Chain-of-TableはWikiTQで67.31%、テキストのみのchain-of-thoughtは61.48%。4,000トークン超の表では10.25ポイントリードする。

TableLlamaは列型注釈でGPT-4に勝利(F1 94対32)するが、WikiTQの合成的推論では33ポイント劣る。

TAPASはSQLを生成せずセルを選択して表の質問に答える。小規模なBeancount台帳クエリには適するが規模拡大で破綻する。

MAC-SQLの3エージェント設計はBIRDで実行精度59.59%を達成、Refinerが+4.63ポイント貢献。Beancount台帳クエリ生成のテンプレートだ。

DIN-SQLはスキーマリンクと自己補正ステージにより、Spiderの実行精度をGPT-4で67.4%から85.3%に引き上げます。同じ分解がBeancount BQLにも適用できます。

BIRDにおいて、GPT-4はドメインヒントありで54.89%の実行精度、なしで34.88%—BeancountのNL→BQLインターフェースが埋めなければならない20ポイントの差。

MicrosoftのGraphRAGはベクターRAGに対して72〜83%の理解向上をもたらすと発表されたが、2025年の監査で判定バイアスを修正するとその勝率は消滅——複数文書の台帳QAへの警鐘。