
WebArena: El benchmark de 812 tareas que mide lo que los agentes web realmente pueden y no pueden hacer
GPT-4 completa solo 14.41% de las 812 tareas web de WebArena frente a 78.24% de los humanos; los agentes fallan sobre todo al declarar falsamente imposible una tarea.