
Istota a kalibrácia LLM: Prehľad toho, čo výskum v skutočnosti ukazuje
Verbalizovaná dôvera GPT-4 dosahuje len ~62,7 % AUROC, sotva nad úrovňou náhody. Finanční agenti vnímajúci neistotu potrebujú lepšiu kalibráciu.
#trust
Spoľahlivosť, kalibrácia a halucinácie vo finančných AI systémoch

Verbalizovaná dôvera GPT-4 dosahuje len ~62,7 % AUROC, sotva nad úrovňou náhody. Finanční agenti vnímajúci neistotu potrebujú lepšiu kalibráciu.

ReDAct presúva úlohu z malého modelu na veľký len vtedy, keď perplexita signalizuje neistotu, čím znižuje náklady o 64 % pri rovnakej presnosti pre agentové workflowy.

STPA a MCP s rozšírenými schopnosťami prinášajú formálne bezpečnostné špecifikácie pre nástroje LLM; Alloy v štúdii kalendára dokazuje, že neexistujú nebezpečné toky.

Dvoj-LLM ochranný mantinel AGrail znižuje úspešnosť útokov prompt injection na 0 % a zároveň zachováva 95,6 % neškodných akcií agenta na Safe-OS.

ShieldAgent dosahuje 90,4 % presnosť pri útokoch na agentov s o 64,7 % menším počtom volaní API vďaka pravdepodobnostným pravidlovým obvodom namiesto LLM ochranných mantinelov.

GuardAgent presadzuje pravidlá LLM agentov spúšťaním kódu v Pythone, dosahuje 98,7 % presnosť bez zlyhaní úloh, oproti 81 % a až 71 % zlyhaní pri pravidlách v prompte.

Huang et al. (ICLR 2024): intrinsická samokorekcia znižuje GPT-4 z 95,5 % na 91,5 % v GSM8K — účtovné agenty potrebujú externé validátory, nie vlastnú revíziu.

PHANTOM (NeurIPS 2025) meria detekciu halucinácií LLM na reálnych SEC podaniach. Qwen3-30B vedie s F1=0,882, no modely s 7B hádajú takmer náhodne.