
DIN-SQL: GPT-4 جهش ۶۷.۴٪→۸۵.۳٪ EX در Spider
DIN-SQL با مراحل اتصال اسکیما و خوداصلاحی، دقت اجرای GPT-4 را در Spider از ۶۷.۴٪ به ۸۵.۳٪ میرساند—همان تجزیه برای Beancount BQL نیز适用 است.

DIN-SQL با مراحل اتصال اسکیما و خوداصلاحی، دقت اجرای GPT-4 را در Spider از ۶۷.۴٪ به ۸۵.۳٪ میرساند—همان تجزیه برای Beancount BQL نیز适用 است.

در BIRD، GPT-4 با راهنماییهای دامنه به 54.89% دقت اجرا میرسد و بدون آن 34.88%—شکافی 20 واحدی که هر رابط Beancount NL→BQL باید آن را پر کند.

پژوهشگران دانشگاه CMU و NC State با استفاده از آنالیز فرآیند تئوری سیستم (STPA) و نسخه ارتقا یافته پروتکل کانتکست مدل (MCP)، روشی را برای استخراج مشخصات ایمنی رسمی جهت استفاده عاملهای LLM از ابزارها پیشنهاد دادهاند. تایید مبتنی بر Alloy در یک مطالعه موردی زمانبندی تقویم، عدم وجود جریانهای ناامن را اثبات میکند.

GraphRAG مایکروسافت ۷۲–۸۳٪ پیروزیهای درک مطلب نسبت به RAG برداری ثبت میکند؛ یک ممیزی ۲۰۲۵ پس از اصلاح سوگیری قاضی، این نتایج را فرو میریزد — هشداری برای QA دفتر کل چندسندی.

FinAuditing تعداد ۱۳ مدل زبانی بزرگ را در حالت صفر-نمونه روی ۱,۱۰۲ نمونه واقعی از گزارشهای SEC XBRL آزمایش میکند؛ بالاترین نمرات ۱۳.۸۶٪ در تأیید ریاضیات مالی و ۱۲.۴۲٪ در بازیابی مفاهیم است—نتایجی که مستقیماً مرزهای اعتماد به ابزارهای حسابداری هوش مصنوعی را برای خودکارسازی بدون ابزارهای خارجی مشخص میکند.

InvestorBench: Qwen2.5-72B با نرخ موفقیت ۴۶.۱۵٪ پیشتاز معاملات سهام است؛ Palmyra-Fin تنظیمشده برای مالی در سهام نتیجه معکوس میدهد—اندازه بر تنظیمدقیق دامنه برتری دارد.

StructRAG (ICLR 2025) هر پرسش را قبل از استدلال، به یک نوع ساختار مناسب وظیفه — جدول، گراف، کاتالوگ، الگوریتم یا تکه متن — هدایت میکند. این روش در بنچمارک Loong ۲۸ امتیاز بالاتر از GraphRAG کسب کرده و ۲۲ برابر سریعتر اجرا میشود، در حالی که مسیریاب آموزشدیده با DPO به تنهایی مسئول ۱۵ امتیاز از بهبود دقت است.

در بودجههای برابر توکن تفکر، مدلهای زبانی تکعاملی در استدلال چندمرحلهای با سیستمهای چندعاملی برابری یا برتری دارند—طراحیهای سادهتر عامل مالی را ترجیح دهید.

M3MAD-Bench مباحثه چند-عاملی را در ۹ مدل، ۵ حوزه و تنظیمات بینایی-زبانی مورد آزمایش فشار قرار میدهد و نشان میدهد که توهم جمعی عامل ۶۵٪ شکستها است، مباحثه خصمانه دقت را تا ۱۲.۸٪ کاهش میدهد و خود-سازگاری معمولاً با هزینه توکن کمتر، دقتی مشابه مباحثه دارد.

AGrail (ACL 2025) یک سیستم نرده حفاظتی مشارکتی دو-LLM را معرفی میکند که بررسیهای امنیتی را در زمان استنتاج از طریق تطبیق در زمان تست (TTA) تنظیم میکند. این سیستم به نرخ موفقیت ۰٪ در حملات تزریق دستور و حفظ ۹۵.۶٪ اقدامات مجاز در Safe-OS دست یافته است — در حالی که GuardAgent و LLaMA-Guard تا ۴۹.۲٪ از اقدامات قانونی را مسدود میکنند.

سیستم ShieldAgent (ICML 2025) با جایگزینی گاردریلهای مبتنی بر LLM با مدارهای قانون احتمالی ساخته شده بر روی شبکههای منطق مارکوف، به دقت ۹۰.۴٪ در برابر حملات عاملی با ۶۴.۷٪ فراخوانی API کمتر دست یافته است — و بررسی معنای آن برای امنیت قابل تایید در سیستمهای هوش مصنوعی مالی.

اطلس (JMLR 2023) با استفاده از تنها ۶۴ نمونه آموزشی به دقت ۴۲.۴٪ در Natural Questions دست مییابد و مدل PaLM 540B را با ۳ واحد اختلاف و تنها با ۱۱ میلیارد پارامتر شکست میدهد. این کار از طریق پیشآموزش مشترک یک بازیاب متراکم مبتنی بر Contriever با یک خوانشگر Fusion-in-Decoder مبتنی بر T5 انجام شده است. این تحلیل محدودیتهای دقت بازیابی، هزینههای زیرساختی شاخص ۵۸۷ گیگابایتی و پیامدهای آن برای سیستمهای پرسش و پاسخ دفتر کل Beancount را پوشش میدهد.