
اعتماد و کالیبراسیون LLM: مروری بر آنچه تحقیقات واقعاً نشان میدهند
اطمینان کلامیشده GPT-4 تنها به ~۶۲.۷٪ AUROC میرسد، اندکی بالاتر از تصادف. عاملهای مالی آگاه به عدمقطعیت به کالیبراسیون بهتری نیاز دارند.
#trust
قابلیت اطمینان، کالیبراسیون و توهم در سیستمهای هوش مصنوعی مالی

اطمینان کلامیشده GPT-4 تنها به ~۶۲.۷٪ AUROC میرسد، اندکی بالاتر از تصادف. عاملهای مالی آگاه به عدمقطعیت به کالیبراسیون بهتری نیاز دارند.

ReDAct تنها زمانی از یک مدل کوچک به بزرگ تعویق میاندازد که پرپلکسیتی عدم قطعیت را نشان دهد، هزینه را 64% با دقت مطابق برای جریانهای کاری عامل کاهش میدهد.

STPA بههمراه MCP تقویتشده با قابلیت، مشخصات ایمنی رسمی برای استفاده از ابزار مدل زبانی بزرگ تولید میکند و Alloy در مطالعه موردی تقویم اثبات میکند جریان ناایمنی وجود ندارد.

محافظ دو مدل زبانی بزرگ AGrail موفقیت حمله تزریق پرامپت را به ۰٪ کاهش میدهد و در عین حال ۹۵.۶٪ اقدامات بیخطر عامل را در Safe-OS حفظ میکند.

ShieldAgent با استفاده از مدارهای قاعده احتمالاتی به جای محافظهای مدل زبانی بزرگ، به ۹۰.۴٪ دقت در حملات عامل با ۶۴.۷٪ تماس API کمتر میرسد.

GuardAgent با اجرای کد پایتون خطمشیهای عوامل مدل زبانی بزرگ را اجرا میکند و به ۹۸.۷٪ دقت بدون شکست وظیفه میرسد، در برابر ۸۱٪ و تا ۷۱٪ شکست برای قواعد مبتنی بر پرامپت.

Huang و همکاران (ICLR 2024): خوداصلاحی ذاتی GPT-4 را از 95.5٪ به 91.5٪ در GSM8K کاهش میدهد — عاملهای دفتر کل نیاز به تأییدکنندههای خارجی دارند، نه بازبینی خود.

PHANTOM (NeurIPS 2025) تشخیص توهم LLM را روی پروندههای واقعی SEC میسنجد. Qwen3-30B با F1=0.882 پیشتاز است، اما مدلهای 7B تقریباً تصادفی حدس میزنند.