
Уверенность и калибровка LLM: обзор того, что на самом деле показывают исследования
Вербализованная уверенность GPT-4 даёт лишь ~62,7% AUROC — едва выше случайности. Финансовым агентам нужна лучшая калибровка.
#hallucination-detection
Методы обнаружения фактических ошибок и галлюцинаций в выводах LLM