
LLM의 신뢰도와 캘리브레이션: 연구 결과가 실제로 보여주는 것에 대한 서베이
GPT-4의 언어화 신뢰도는 AUROC 약 62.7%로 거의 무작위 수준이다. 불확실성을 다루는 금융 에이전트에는 더 나은 캘리브레이션이 필요하다.
#trust
금융 AI 시스템의 신뢰성, 보정 및 환각

GPT-4의 언어화 신뢰도는 AUROC 약 62.7%로 거의 무작위 수준이다. 불확실성을 다루는 금융 에이전트에는 더 나은 캘리브레이션이 필요하다.

ReDAct는 퍼플렉서티가 불확실성을 알릴 때만 소형 모델에서 대형 모델로 지연시켜, 에이전트 워크플로에서 동일 정확도로 비용을 64% 절감합니다.

STPA와 역량 강화 MCP는 LLM 도구 사용에 대한 형식적 안전 명세를 산출하며, Alloy는 캘린더 사례 연구에서 안전하지 않은 흐름이 없음을 증명한다.

AGrail의 두 LLM 가드레일은 Safe-OS에서 프롬프트 주입 공격 성공률을 0%로 낮추면서 정상 에이전트 행동의 95.6%를 보존한다.

ShieldAgent는 LLM 가드레일 대신 확률적 규칙 회로를 사용해 API 호출을 64.7% 줄이면서 에이전트 공격에서 90.4% 정확도를 기록한다.

GuardAgent는 Python 코드를 실행해 LLM 에이전트 정책을 시행하여 작업 실패 없이 98.7% 정확도를 기록한 반면, 프롬프트 규칙은 81%에 최대 71% 실패율을 보였다.

Huang et al. (ICLR 2024): 내재적 자기 수정은 GSM8K에서 GPT-4를 95.5%에서 91.5%로 떨어뜨림—원장 에이전트는 자체 검토가 아닌 외부 검증자가 필요함.

PHANTOM(NeurIPS 2025)은 실제 SEC 공시에서 LLM 환각 탐지를 측정한다. Qwen3-30B는 F1=0.882로 앞서지만, 7B 모델은 거의 무작위로 추측한다.