
TableMaster: LLM을 활용한 표 이해를 위한 적응형 추론
TableMaster는 GPT-4o-mini로 WikiTQ에서 78.13%를 달성해 Chain-of-Table보다 13점 앞서며, Beancount 장부 위 에이전트를 위한 table-of-focus와 적응형 추론을 사용합니다.
#queries
금융 AI를 위한 쿼리 생성, 테이블 추론 및 구조화 데이터 검색

TableMaster는 GPT-4o-mini로 WikiTQ에서 78.13%를 달성해 Chain-of-Table보다 13점 앞서며, Beancount 장부 위 에이전트를 위한 table-of-focus와 적응형 추론을 사용합니다.

Chain-of-Table은 WikiTQ에서 67.31%를 기록해 텍스트 전용 chain-of-thought의 61.48%를 앞서며, 4,000 토큰 초과 테이블에서 10.25점 차로 앞섭니다.

TableLlama beats GPT-4 on column type annotation (F1 94 vs 32) but trails by 33 points on WikiTQ compositional reasoning.

TAPAS는 SQL을 생성하지 않고 셀을 선택해 테이블 질문에 답합니다. 소규모 Beancount 장부 쿼리에는 맞지만 규모가 커지면 무너집니다.

MAC-SQL의 3-에이전트 설계는 BIRD에서 59.59% 실행 정확도를 달성하고 Refiner가 +4.63점을 더합니다. Beancount 장부 쿼리 생성의 템플릿입니다.

DIN-SQL이 스키마 링크 및 자체 수정 단계를 통해 GPT-4의 Spider 실행 정확도를 67.4%에서 85.3%로 끌어올립니다—동일한 분해 방식이 Beancount BQL에도 적용됩니다.

BIRD에서 GPT-4는 도메인 힌트가 있으면 54.89%의 실행 정확도, 없으면 34.88%를 기록합니다—모든 Beancount NL→BQL 인터페이스가 극복해야 할 20포인트 격차입니다.

마이크로소프트의 GraphRAG가 벡터 RAG 대비 72–83%의 의미 파악 승리를 기록했으나, 2025년 감사에서 판사 편향을 수정한 후 그 수치가 사라졌습니다—다중 문서 원장 QA에 대한 경고.