
LLM 置信度与校准:研究现状深度综述
GPT-4语言化置信度的AUROC仅为约62.7%,勉强高于随机。不确定性感知的金融智能体需要比这更好的校准。
#trust

GPT-4语言化置信度的AUROC仅为约62.7%,勉强高于随机。不确定性感知的金融智能体需要比这更好的校准。

ReDAct 仅在困惑度表明不确定时,才从小模型推迟到大模型,在保持准确率的同时将智能体工作流的成本降低 64%。

STPA 加上能力增强的 MCP 为 LLM 工具使用产出形式化安全规范,并用 Alloy 在一个日历案例中证明不存在不安全流程。

AGrail 的双 LLM 护栏将提示注入攻击成功率降至 0%,同时在 Safe-OS 上保留 95.6% 的正常智能体操作。

ShieldAgent 用概率规则电路替代 LLM 护栏,对智能体攻击达 90.4% 准确率,API 调用减少 64.7%。

GuardAgent enforces LLM agent policies by running Python code, hitting 98.7% accuracy with no task failures, versus 81% and up to 71% failure for prompt rules.

Huang等(ICLR 2024):内在自我纠正使GPT-4在GSM8K上从95.5%降至91.5%——账本代理需要外部验证器,而非自我审查。

PHANTOM(NeurIPS 2025)衡量 LLM 在真实数据上的幻觉检测。Qwen3-30B 以 F1=0.882 领先,但 7B 模型近乎随机猜测。