
Confiança i calibratge en LLM: una enquesta sobre el que realment mostra la recerca
La confiança verbalitzada de GPT-4 només arriba a ~62,7% d'AUROC, poc per sobre de l'atzar. Els agents financers necessiten un millor calibratge.
#trust
Fiabilitat, calibratge i al·lucinació en sistemes d'IA financera

La confiança verbalitzada de GPT-4 només arriba a ~62,7% d'AUROC, poc per sobre de l'atzar. Els agents financers necessiten un millor calibratge.

ReDAct delega d'un model petit a un de gran només quan la perplexitat indica incertesa, retallant el cost un 64% amb precisió equivalent per a fluxos d'agents.

STPA més un MCP amb capacitats ampliades dona especificacions formals de seguretat per a eines LLM, i Alloy prova que no hi ha fluxos insegurs en un cas de calendari.

La barrera de dos LLM d'AGrail redueix l'èxit dels atacs d'injecció de prompts a un 0%, tot preservant el 95,6% d'accions benignes d'agents a Safe-OS.

ShieldAgent assoleix un 90,4% de precisió en atacs d'agents amb un 64,7% menys de crides a l'API gràcies a circuits de regles probabilístics en lloc de guardrails LLM.

GuardAgent aplica polítiques d'agents LLM executant codi Python: 98.7% de precisió sense fallades de tasca, davant el 81% i fins al 71% de fallades amb regles de prompt.

Huang et al. (ICLR 2024): l'auto-correcció intrínseca redueix GPT-4 del 95,5% al 91,5% en GSM8K—els agents de llibre major necessiten validadors externs, no auto-revisió.

PHANTOM (NeurIPS 2025) mesura la detecció d'al·lucinacions d'LLM en informes SEC reals. Qwen3-30B lidera amb F1=0,882, però els models de 7B encerten gairebé a l'atzar.