WildToolBench: Perché nessun LLM supera il 15% di accuratezza di sessione nell'uso di strumenti reali
WildToolBench (ICLR 2026) valuta 57 LLM su 1.024 attività derivate dal comportamento reale degli utenti — nessun modello supera il 15% di accuratezza di sessione, con orchestrazione compositiva, intento nascosto e transizioni di istruzione come le tre modalità di fallimento più marcate.