WebArena: Il benchmark di 812 compiti che misura cosa gli agenti web possono e non possono effettivamente fare
GPT-4 completa solo il 14,41% degli 812 compiti web realistici di WebArena mentre gli umani raggiungono il 78,24%; la modalità di fallimento dominante è la falsa impossibilità — un rifiuto conservativo di agire — con implicazioni dirette per qualsiasi agente che operi su Fava o interfacce web finanziarie.