
TableMaster: استدلال تطبیقی برای درک جداول با مدلهای زبانی بزرگ (LLMs)
TableMaster با GPT-4o-mini به 78.13% در WikiTQ میرسد، 13 واحد بالاتر از Chain-of-Table، از طریق جدول تمرکز بهعلاوه استدلال تطبیقی برای عاملها روی دفترهای کل Beancount.
#queries
تولید پرسوجو، استدلال جدولی و بازیابی دادههای ساختاریافته برای هوش مصنوعی مالی

TableMaster با GPT-4o-mini به 78.13% در WikiTQ میرسد، 13 واحد بالاتر از Chain-of-Table، از طریق جدول تمرکز بهعلاوه استدلال تطبیقی برای عاملها روی دفترهای کل Beancount.

Chain-of-Table به 67.31% در WikiTQ میرسد در برابر 61.48% برای زنجیره تفکر فقط متنی، و با 10.25 واحد در جداول بالای 4,000 توکن پیشتاز است.

TableLlama در حاشیهنویسی نوع ستون GPT-4 را شکست میدهد (F1 ۹۴ در برابر ۳۲) اما در استدلال ترکیبی WikiTQ ۳۳ امتیاز عقب است.

TAPAS به سؤالات جدولی با انتخاب سلولها پاسخ میدهد، هرگز SQL تولید نمیکند. برای پرسوجوهای کوچک دفتر کل Beancount مناسب است اما در مقیاس بزرگ شکست میخورد.

طراحی سهعاملی MAC-SQL به دقت اجرای 59.59% در BIRD میرسد، با Refiner که 4.63+ واحد اضافه میکند — الگویی برای تولید پرسوجوهای دفتر کل Beancount.

DIN-SQL با مراحل اتصال اسکیما و خوداصلاحی، دقت اجرای GPT-4 را در Spider از ۶۷.۴٪ به ۸۵.۳٪ میرساند—همان تجزیه برای Beancount BQL نیز适用 است.

در BIRD، GPT-4 با راهنماییهای دامنه به 54.89% دقت اجرا میرسد و بدون آن 34.88%—شکافی 20 واحدی که هر رابط Beancount NL→BQL باید آن را پر کند.

GraphRAG مایکروسافت ۷۲–۸۳٪ پیروزیهای درک مطلب نسبت به RAG برداری ثبت میکند؛ یک ممیزی ۲۰۲۵ پس از اصلاح سوگیری قاضی، این نتایج را فرو میریزد — هشداری برای QA دفتر کل چندسندی.