
Confiance et calibration des LLM : une étude de ce que montre réellement la recherche
La confiance verbalisée de GPT-4 n'atteint qu'environ 62,7 % d'AUROC, à peine mieux que le hasard. Les agents financiers ont besoin de mieux.
#hallucination-detection
Méthodes et techniques pour détecter les erreurs factuelles et les hallucinations dans les sorties des LLM