
Впевненість та калібрування LLM: Огляд того, що насправді показують дослідження
Вербалізована впевненість GPT-4 сягає лише ~62,7% AUROC — ледь вище за випадковість. Фінансовим агентам з урахуванням невизначеності потрібне краще калібрування.
#trust
Надійність, калібрування та галюцинації у фінансових ШІ-системах

Вербалізована впевненість GPT-4 сягає лише ~62,7% AUROC — ледь вище за випадковість. Фінансовим агентам з урахуванням невизначеності потрібне краще калібрування.

ReDAct делегує від малої моделі до великої лише коли перплексія сигналізує про невизначеність, скорочуючи витрати на 64% за тієї ж точності для агентних робочих процесів.

STPA разом із розширеним MCP дає формальні специфікації безпеки для інструментів LLM, а Alloy доводить відсутність небезпечних потоків у кейсі з календарем.

Охорона AGrail з двох LLM знижує успішність атак через ін'єкцію підказок до 0%, зберігаючи 95.6% доброякісних дій агента на Safe-OS.

ShieldAgent дає 90,4% точності на атаках агентів і на 64,7% менше викликів API завдяки ймовірнісним схемам правил замість LLM-огорож.

GuardAgent enforces LLM agent policies by running Python code, hitting 98.7% accuracy with no task failures, versus 81% and up to 71% failure for prompt rules.

Huang et al. (ICLR 2024): внутрішня самокорекція знижує GPT-4 з 95.5% до 91.5% на GSM8K — бухгалтерським агентам потрібні зовнішні валідатори, а не самостійна перевірка.

PHANTOM (NeurIPS 2025) вимірює виявлення галюцинацій LLM на реальних звітах SEC. Qwen3-30B лідирує з F1=0.882, але моделі 7B вгадують майже випадково.