
FinToolBench: Avaliando Agentes de LLM no Uso Real de Ferramentas Financeiras
O FinToolBench combina 760 ferramentas de API financeiras ao vivo com 295 consultas executáveis para avaliar agentes de LLM em tarefas financeiras reais — revelando que a taxa de invocação conservadora de 22,7% do GPT-4o produz maior qualidade de resposta (CSS 0,670) do que o TIR agressivo de 87,1% do Qwen3-8B, enquanto a incompatibilidade de intenção excede 50% em todos os modelos testados.





