
Confiança e Calibração em LLM: Um Levantamento do que a Pesquisa Realmente Mostra
A confiança verbalizada do GPT-4 atinge apenas ~62,7% de AUROC, pouco acima do acaso. Agentes financeiros cientes da incerteza precisam de melhor calibração.
#trust
Fiabilidade, calibração e alucinações em sistemas de IA financeira

A confiança verbalizada do GPT-4 atinge apenas ~62,7% de AUROC, pouco acima do acaso. Agentes financeiros cientes da incerteza precisam de melhor calibração.

O ReDAct transfere de um modelo pequeno para um grande só quando a perplexidade sinaliza incerteza, cortando o custo em 64% com acurácia equivalente em fluxos de agentes.

STPA mais MCP aprimorado gera especificações formais de segurança para uso de ferramentas por LLMs, com o Alloy provando ausência de fluxos inseguros em um estudo de caso.

O guardrail de dois LLMs do AGrail reduz o sucesso de ataques de injeção de prompt a 0%, preservando 95,6% das ações benignas do agente no Safe-OS.

O ShieldAgent atinge 90,4% de precisão em ataques a agentes com 64,7% menos chamadas de API ao usar circuitos de regras probabilísticos em vez de guardrails de LLM.

O GuardAgent aplica políticas de agentes LLM executando código Python, atingindo 98,7% de precisão sem falhas de tarefa, contra 81% e até 71% de falha para regras em prompt.

Huang et al. (ICLR 2024): a autocorreção intrínseca reduz o GPT-4 de 95,5% para 91,5% no GSM8K—agentes contábeis precisam de validadores externos, não de auto-revisão.

O PHANTOM (NeurIPS 2025) mede a detecção de alucinação em LLMs em documentos reais da SEC. O Qwen3-30B lidera com F1=0,882, mas modelos de 7B chutam quase aleatoriamente.