
WildToolBench: Por que nenhum LLM excede 15% de acurácia de sessão no uso de ferramentas no mundo real
O WildToolBench não encontra LLM acima de 15% de acurácia por sessão em 1.024 tarefas de usuários reais, com intenção oculta e transições de instrução como falhas mais agudas.






