
FinToolBench: Avaliando Agentes de LLM no Uso Real de Ferramentas Financeiras
O FinToolBench encontra incompatibilidade de intenção acima de 50% em todo LLM testado, então chamadas agressivas não geram melhores respostas.
#compliance
Conformidade regulatória, políticas e trilhas de auditoria para IA financeira

O FinToolBench encontra incompatibilidade de intenção acima de 50% em todo LLM testado, então chamadas agressivas não geram melhores respostas.

STPA mais MCP aprimorado gera especificações formais de segurança para uso de ferramentas por LLMs, com o Alloy provando ausência de fluxos inseguros em um estudo de caso.

O FinAuditing mostra que os melhores LLMs atingem só 13,86% na verificação matemática de arquivos XBRL reais da SEC, limitando o que a contabilidade com IA automatiza sozinha.

O guardrail de dois LLMs do AGrail reduz o sucesso de ataques de injeção de prompt a 0%, preservando 95,6% das ações benignas do agente no Safe-OS.

O ShieldAgent atinge 90,4% de precisão em ataques a agentes com 64,7% menos chamadas de API ao usar circuitos de regras probabilísticos em vez de guardrails de LLM.

O AuditCopilot reduz falsos positivos de fraude em lançamentos de 942 para 12, mas a ablação mostra que o LLM só sintetiza pontuações do Isolation Forest.

A IA Constitucional substitui dados de dano rotulados manualmente por feedback de IA, permitindo que agentes contábeis apliquem regras de ledger sem um revisor por transação.