
Уверенность и калибровка LLM: обзор того, что на самом деле показывают исследования
Вербализованная уверенность GPT-4 даёт лишь ~62,7% AUROC — едва выше случайности. Финансовым агентам нужна лучшая калибровка.
#trust
Надёжность, калибровка и галлюцинации в финансовых ИИ-системах

Вербализованная уверенность GPT-4 даёт лишь ~62,7% AUROC — едва выше случайности. Финансовым агентам нужна лучшая калибровка.

ReDAct переходит от малой модели к большой только когда перплексия сигнализирует о неопределённости, снижая затраты на 64% при той же точности для рабочих процессов агентов.

STPA вместе с расширенным MCP даёт формальные спецификации безопасности для инструментов LLM, а Alloy доказывает отсутствие небезопасных потоков в примере с календарём.

Ограждение AGrail на двух LLM снижает успех атак через промпт-инъекции до 0%, сохраняя 95.6% доброкачественных действий агента на Safe-OS.

ShieldAgent достигает 90.4% точности на атаках агентов при 64.7% меньшем числе вызовов API, используя вероятностные схемы правил вместо LLM-ограждений.

GuardAgent обеспечивает соблюдение политик LLM-агентов, исполняя код на Python, достигая 98.7% точности без сбоев задач, против 81% и до 71% сбоев у правил в промптах.

Huang et al. (ICLR 2024): внутренняя самокоррекция снижает результат GPT-4 с 95,5% до 91,5% на GSM8K — агентам для учёта нужны внешние валидаторы, а не саморецензирование.

PHANTOM (NeurIPS 2025) измеряет обнаружение галлюцинаций LLM на реальных отчётах SEC. Qwen3-30B лидирует с F1=0,882, но модели на 7B угадывают почти случайно.