
LLMの信頼度とキャリブレーション:研究が実際に示していることの調査
言語化されたGPT-4の確信度はAUROC約62.7%にとどまり、偶然をわずかに上回る程度。不確実性を意識する財務エージェントにはより良い較正が必要だ。
#trust

言語化されたGPT-4の確信度はAUROC約62.7%にとどまり、偶然をわずかに上回る程度。不確実性を意識する財務エージェントにはより良い較正が必要だ。

ReDActはパープレキシティが不確実性を示す場合のみ小モデルから大モデルへ延期し、エージェントワークフローで同等精度を保ちコストを64%削減する。

STPAと能力強化されたMCPはLLMツール利用の形式的な安全性仕様を生み出し、カレンダーのケーススタディでAlloyが安全でないフローがないことを証明する。

AGrailの2-LLMガードレールはSafe-OS上でプロンプトインジェクション攻撃成功率を0%に削減しつつ、良性のエージェント行動を95.6%維持する。

ShieldAgentはLLMガードレールの代わりに確率的ルール回路を用いて、エージェント攻撃で90.4%の精度を達成し、API呼び出しを64.7%削減する。

GuardAgentはPythonコードを実行してLLMエージェントのポリシーを施行し、タスク失敗なしで98.7%の精度を達成する。プロンプトルールでは81%で最大71%が失敗する。

Huang et al.(ICLR 2024):内在的自己修正により、GPT-4のGSM8Kスコアが95.5%から91.5%に低下—台帳エージェントには自己レビューではなく外部バリデータが必要。

PHANTOM(NeurIPS 2025)は実際のSEC提出書類でLLM幻覚検出を測定。Qwen3-30BがF1=0.882で首位、しかし7Bモデルはほぼランダム推測です。