
WildToolBench: Почему ни одна LLM не превышает 15% точности сессии в реальных сценариях использования инструментов
WildToolBench обнаруживает, что ни одна LLM не превышает 15% точности сессий на 1 024 задачах реальных пользователей; скрытые намерения и смена инструкций — худшие сбои.






