
FinMCP-Bench: Benchmarking de Agentes de LLM para Uso de Ferramentas Financeiras no Mundo Real sob MCP
O FinMCP-Bench pontua o melhor de seis LLMs em apenas 3,08% de correspondência exata em 613 tarefas reais de MCP, colapso de 20× no multiturno.
#fintech
Investigação em tecnologia financeira, plataformas e infraestrutura para contabilidade moderna

O FinMCP-Bench pontua o melhor de seis LLMs em apenas 3,08% de correspondência exata em 613 tarefas reais de MCP, colapso de 20× no multiturno.

FinTrace: LLMs de ponta escolhem as ferramentas financeiras certas (F1 ~0,9), mas tiram só 3,23/5 ao usar os resultados, etapa que quebra agentes de write-back.

O FinToolBench encontra incompatibilidade de intenção acima de 50% em todo LLM testado, então chamadas agressivas não geram melhores respostas.

O BloombergGPT treinou em 569B tokens financeiros, mas o GPT-4 o igualou sem pré-treinamento financeiro. Para agentes contábeis, ferramentas superam os internos do modelo.