OSWorld: Agenti AI Desktop riescono nel 12% dei compiti dove gli umani riescono nel 72%
OSWorld (NeurIPS 2024) valuta gli agenti AI multimodali su 369 compiti desktop reali in Ubuntu, Windows e macOS — rilevando un divario di 60 punti percentuali tra il miglior modello (12,24%) e la performance umana (72,36%), con il 75% degli insuccessi attribuiti a errori di ancoraggio visuomotorio piuttosto che a fallimenti di ragionamento.
ai
machine-learning
automation