
Впевненість та калібрування LLM: Огляд того, що насправді показують дослідження
Вербалізована впевненість GPT-4 сягає лише ~62,7% AUROC — ледь вище за випадковість. Фінансовим агентам з урахуванням невизначеності потрібне краще калібрування.
#hallucination-detection
Методи виявлення фактичних помилок і галюцинацій у виводі LLM