Salta al contenuto principale

Mike Thrift

Marketing Manager

WorkArena++: Il divario del 93% tra le prestazioni umane e quelle degli agenti AI in compiti enterprise composizionali

WorkArena++ (NeurIPS 2024) confronta 682 compiti enterprise composizionali su tre livelli di difficoltà. GPT-4o ne risolve il 2,1% mentre gli umani risolvono il 93,9%, isolando esattamente il motivo per cui gli attuali agenti AI falliscono nel lavoro cognitivo a obiettivo implicito e perché questo divario è importante per l'automazione contabile autonoma.

MAC-SQL: Text-to-SQL collaborativo multi-agente

MAC-SQL (COLING 2025) utilizza tre agenti specializzati — Selettore per la riduzione dello schema, Decompositore per la scomposizione delle domande e Raffinatore per la correzione SQL guidata dall'esecuzione — raggiungendo un'accuratezza di esecuzione del 59,59% sul benchmark BIRD; l'ablation mostra che il Raffinatore contribuisce maggiormente (+4,63 punti), con implicazioni dirette per la generazione di query nel registro di Beancount.