
Confiança i calibratge en LLM: una enquesta sobre el que realment mostra la recerca
La confiança verbalitzada de GPT-4 només arriba a ~62,7% d'AUROC, poc per sobre de l'atzar. Els agents financers necessiten un millor calibratge.
#hallucination-detection
Mètodes i tècniques per detectar errors factuals i al·lucinacions en sortides de LLM