
Confianza y calibración de LLM: Un estudio de lo que la investigación muestra realmente
La confianza verbalizada de GPT-4 solo alcanza ~62,7% de AUROC, apenas por encima del azar. Los agentes financieros necesitan mejor calibración.
#trust
Fiabilidad, calibración y alucinación en sistemas de IA financiera

La confianza verbalizada de GPT-4 solo alcanza ~62,7% de AUROC, apenas por encima del azar. Los agentes financieros necesitan mejor calibración.

ReDAct difiere de un modelo pequeño a uno grande solo cuando la perplejidad indica incertidumbre, recortando el costo 64% con igual precisión en flujos de trabajo de agentes.

STPA más MCP con capacidades mejoradas da especificaciones formales de seguridad para herramientas LLM, con Alloy probando flujos seguros.

El guardarraíl de dos LLM de AGrail reduce el éxito de ataques de inyección de prompts a 0% y conserva el 95.6% de acciones benignas en Safe-OS.

ShieldAgent alcanza 90.4% de precisión en ataques a agentes con 64.7% menos llamadas a API usando circuitos de reglas probabilísticos en vez de guardarraíles LLM.

GuardAgent aplica políticas de agentes LLM ejecutando código Python, con 98.7% de exactitud y sin fallos de tarea, frente a 81% y hasta 71% de fallos con reglas en el prompt.

Huang et al. (ICLR 2024): la autocorrección intrínseca reduce el rendimiento de GPT-4 del 95,5% al 91,5% en GSM8K—los agentes contables necesitan validadores externos, no autoevaluación.

PHANTOM (NeurIPS 2025) mide la detección de alucinaciones LLM en informes SEC reales. Qwen3-30B lidera con F1=0.882, pero los modelos de 7B aciertan casi al azar.