2026년 7월 9일약 5분LLM의 신뢰도와 캘리브레이션: 연구 결과가 실제로 보여주는 것에 대한 서베이GPT-4의 언어화 신뢰도는 AUROC 약 62.7%로 거의 무작위 수준이다. 불확실성을 다루는 금융 에이전트에는 더 나은 캘리브레이션이 필요하다.Mike Thriftllmaimachine-learning