
Confiança e Calibração em LLM: Um Levantamento do que a Pesquisa Realmente Mostra
A confiança verbalizada do GPT-4 atinge apenas ~62,7% de AUROC, pouco acima do acaso. Agentes financeiros cientes da incerteza precisam de melhor calibração.
#hallucination-detection
Métodos para detetar erros factuais e alucinações em resultados de LLMs