Salta al contenuto principale

Mike Thrift

Responsabile marketing

WorkArena++: Il divario del 93% tra le prestazioni umane e quelle degli agenti AI in compiti enterprise composizionali

WorkArena++ (NeurIPS 2024) confronta 682 compiti enterprise composizionali su tre livelli di difficoltà. GPT-4o ne risolve il 2,1% mentre gli umani risolvono il 93,9%, isolando esattamente il motivo per cui gli attuali agenti AI falliscono nel lavoro cognitivo a obiettivo implicito e perché questo divario è importante per l'automazione contabile autonoma.

OSWorld: Agenti AI Desktop riescono nel 12% dei compiti dove gli umani riescono nel 72%

OSWorld (NeurIPS 2024) valuta gli agenti AI multimodali su 369 compiti desktop reali in Ubuntu, Windows e macOS — rilevando un divario di 60 punti percentuali tra il miglior modello (12,24%) e la performance umana (72,36%), con il 75% degli insuccessi attribuiti a errori di ancoraggio visuomotorio piuttosto che a fallimenti di ragionamento.

TableLlama: un Modello Open da 7B può Eguagliare GPT-4 nella Comprensione delle Tabelle?

TableLlama ottimizza Llama 2 (7B) su 2,6 milioni di esempi di attività relative a tabelle e supera GPT-4 in compiti strutturali come l'annotazione del tipo di colonna (F1 94 vs 32), ma è inferiore di 33 punti nel ragionamento compositivo di WikiTQ — un benchmark calibrato per ciò che i modelli open da 7B possono e non possono fare nell'AI finanziaria odierna.

TAPAS: Risposta a Domande su Tabelle con Supervisione Debole Senza SQL, e Cosa Significa per Beancount

TAPAS (Google Research, ACL 2020) risponde a domande su tabelle selezionando celle e applicando aggregazioni scalari — senza generare SQL. Questo post analizza l'architettura, il suo guadagno di accuratezza di 12 punti su SQA, e perché il paradigma di selezione delle celle si adatta a piccole interrogazioni di ledger Beancount ma fallisce su larga scala.

MAC-SQL: Text-to-SQL collaborativo multi-agente

MAC-SQL (COLING 2025) utilizza tre agenti specializzati — Selettore per la riduzione dello schema, Decompositore per la scomposizione delle domande e Raffinatore per la correzione SQL guidata dall'esecuzione — raggiungendo un'accuratezza di esecuzione del 59,59% sul benchmark BIRD; l'ablation mostra che il Raffinatore contribuisce maggiormente (+4,63 punti), con implicazioni dirette per la generazione di query nel registro di Beancount.