
WildToolBench : Pourquoi aucun LLM ne dépasse 15 % de précision par session dans l'utilisation d'outils en conditions réelles
WildToolBench : aucun LLM ne dépasse 15 % de précision par session sur 1 024 tâches réelles, l'intention cachée étant le pire échec.






