Pular para o conteúdo principal

#fintech

Fintech

Financial technology research, platforms, and infrastructure for modern accounting systems

FinToolBench: Avaliando Agentes de LLM no Uso Real de Ferramentas Financeiras

O FinToolBench combina 760 ferramentas de API financeiras ao vivo com 295 consultas executáveis para avaliar agentes de LLM em tarefas financeiras reais — revelando que a taxa de invocação conservadora de 22,7% do GPT-4o produz maior qualidade de resposta (CSS 0,670) do que o TIR agressivo de 87,1% do Qwen3-8B, enquanto a incompatibilidade de intenção excede 50% em todos os modelos testados.

BloombergGPT e os Limites de LLMs de Domínio Específico em Finanças

A Bloomberg treinou um LLM de 50 bilhões de parâmetros em 569 bilhões de tokens de dados financeiros e superou modelos gerais em benchmarks de sentimento e raciocínio de tabelas — então o GPT-4 o igualou sem qualquer pré-treinamento específico para finanças. O que o experimento de US$ 10 milhões revela sobre os trade-offs de pré-treinamento de domínio, a tokenização de números e por que o uso de ferramentas é mais confiável do que os componentes internos do modelo para agentes de contabilidade.