
WildToolBench: Per què cap LLM supera el 15% de precisió de sessió en l'ús d'eines en el món real
WildToolBench troba que cap LLM supera el 15% de precisió de sessió en 1.024 tasques reals, amb la intenció oculta i les transicions d'instruccions com a fallades més agudes.






