
LLM-Konfidenz und Kalibrierung: Ein Überblick über den tatsächlichen Stand der Forschung
Verbalisierte GPT-4-Konfidenz erreicht nur ~62,7 % AUROC, kaum über Zufall. Unsicherheitsbewusste Finanzagenten brauchen bessere Kalibrierung.
#hallucination-detection
Methoden zur Erkennung faktischer Fehler und Halluzinationen in LLM-Ausgaben