
WildToolBench: Warum kein LLM eine Sitzungsgenauigkeit von 15 % bei der realen Tool-Nutzung überschreitet
WildToolBench findet kein LLM über 15 % Sitzungsgenauigkeit bei 1.024 Echtnutzer-Aufgaben, verborgene Intention und Instruktionswechsel sind die schärfsten Fehlermodi.






