
WildToolBench: Чому жодна LLM не перевищує 15% точності сесії при реальному використанні інструментів
WildToolBench: жодна LLM не перевищує 15% сесійної точності на 1 024 завданнях реальних користувачів, а найгостріші збої — прихований намір і переходи інструкцій.






