
WebArena : le benchmark de 812 tâches qui mesure ce que les agents web peuvent et ne peuvent pas réellement faire
GPT-4 ne termine que 14,41 % des 812 tâches web de WebArena contre 78,24 % pour les humains ; les agents échouent surtout en déclarant à tort une tâche impossible.