
Confianza y calibración de LLM: Un estudio de lo que la investigación muestra realmente
La confianza verbalizada de GPT-4 solo alcanza ~62,7% de AUROC, apenas por encima del azar. Los agentes financieros necesitan mejor calibración.
#hallucination-detection
Métodos y técnicas para detectar errores factuales y alucinaciones en salidas de LLM