
WebArena: Der Benchmark mit 812 Aufgaben, der misst, was Web-Agenten tatsächlich können und was nicht
GPT-4 erledigt nur 14,41 % von WebArenas 812 Web-Aufgaben gegenüber 78,24 % bei Menschen; Agenten scheitern meist daran, eine Aufgabe fälschlich für unmöglich zu erklären.