
LLM-betrouwbaarheid en -kalibratie: Een overzicht van wat het onderzoek daadwerkelijk aantoont
Verbalized GPT-4-vertrouwen haalt slechts ~62,7% AUROC, nauwelijks boven toeval. Onzekerheidsbewuste finance-agenten hebben betere kalibratie nodig dan dat.






