
LLM-Konfidenz und Kalibrierung: Ein Überblick über den tatsächlichen Stand der Forschung
Verbalisierte GPT-4-Konfidenz erreicht nur ~62,7 % AUROC, kaum über Zufall. Unsicherheitsbewusste Finanzagenten brauchen bessere Kalibrierung.
#trust
Zuverlässigkeit, Kalibrierung und Halluzination in finanziellen KI-Systemen

Verbalisierte GPT-4-Konfidenz erreicht nur ~62,7 % AUROC, kaum über Zufall. Unsicherheitsbewusste Finanzagenten brauchen bessere Kalibrierung.

ReDAct wechselt vom kleinen zum großen Modell nur, wenn Perplexität Unsicherheit signalisiert – 64% Kostenersparnis bei gleicher Genauigkeit für Agenten-Workflows.

STPA plus fähigkeitserweitertes MCP liefert formale Sicherheitsspezifikationen für LLM-Tool-Nutzung, mit Alloy-Beweis für keine unsicheren Flüsse in einer Kalender-Fallstudie.

AGrails Zwei-LLM-Guardrail senkt den Erfolg von Prompt-Injection-Angriffen auf 0% und bewahrt 95,6% gutartiger Agentenaktionen auf Safe-OS.

ShieldAgent erreicht 90,4 % Genauigkeit bei Agenten-Angriffen mit 64,7 % weniger API-Aufrufen durch probabilistische Regelkreise statt LLM-Guardrails.

GuardAgent erzwingt LLM-Agenten-Richtlinien per Python-Code und erreicht 98,7 % Genauigkeit ohne Aufgabenfehler, gegenüber 81 % und bis zu 71 % Fehlern bei Prompt-Regeln.

Huang et al. (ICLR 2024): intrinsische Selbstkorrektur senkt GPT-4 von 95,5% auf 91,5% bei GSM8K – Ledger-Agenten benötigen externe Validatoren, keine Selbstprüfung.

PHANTOM (NeurIPS 2025) misst die LLM-Halluzinationserkennung an echten SEC-Filings. Qwen3-30B führt mit F1=0.882, doch 7B-Modelle raten nahezu zufällig.