
WildToolBench: Por qué ningún LLM supera el 15% de precisión de sesión en el uso de herramientas en el mundo real
WildToolBench halla que ningún LLM supera el 15% de precisión por sesión en 1.024 tareas reales, con intención oculta y cambios de instrucción como peores fallos.






