
LLM Confidence and Calibration: A Survey of What the Research Actually Shows
Verbalized GPT-4 confidence hits only ~62.7% AUROC, barely above chance. Uncertainty-aware finance agents need better calibration than that.
#hallucination-detection
Методи и техники за откриване на фактически грешки и халюцинации в изходите на големи езикови модели