
Confiance et calibration des LLM : une étude de ce que montre réellement la recherche
La confiance verbalisée de GPT-4 n'atteint qu'environ 62,7 % d'AUROC, à peine mieux que le hasard. Les agents financiers ont besoin de mieux.
#trust
Fiabilité, calibration et hallucination dans les systèmes d'IA financière

La confiance verbalisée de GPT-4 n'atteint qu'environ 62,7 % d'AUROC, à peine mieux que le hasard. Les agents financiers ont besoin de mieux.

ReDAct ne passe d'un petit modèle à un grand que lorsque la perplexité signale une incertitude, réduisant le coût de 64 % à précision égale pour les workflows d'agents.

STPA avec MCP enrichi en capacités produit des spécifications de sûreté formelles pour l'usage d'outils LLM ; Alloy prouve l'absence de flux dangereux dans un cas d'agenda.

Le garde-fou à deux LLM d'AGrail réduit à 0 % la réussite des attaques par injection de prompt tout en préservant 95,6 % des actions d'agent bénignes sur Safe-OS.

ShieldAgent atteint 90,4 % de précision face aux attaques d'agents avec 64,7 % d'appels API en moins, via des circuits de règles probabilistes au lieu de garde-fous LLM.

GuardAgent applique les politiques des agents LLM via du code Python : 98,7 % de précision sans échec de tâche, contre 81 % et jusqu'à 71 % d'échecs pour les règles en prompt.

Huang et al. (ICLR 2024) : l'auto-correction intrinsèque fait chuter GPT-4 de 95,5 % à 91,5 % sur GSM8K—les agents comptables ont besoin de validateurs externes, pas d'auto-relecture.

PHANTOM (NeurIPS 2025) mesure la détection d'hallucinations LLM sur de vrais dépôts SEC. Qwen3-30B mène à F1=0,882, mais les modèles 7B devinent au hasard.