
WebArena: O Benchmark de 812 Tarefas que Mede o que Agentes Web Realmente Podem e Não Podem Fazer
O GPT-4 conclui apenas 14,41% das 812 tarefas web do WebArena contra 78,24% dos humanos; os agentes falham principalmente ao declarar falsamente que uma tarefa é impossível.