Preskočiť na hlavný obsah

Mike Thrift

Marketing Manager

WorkArena++: 93 % priepasť medzi výkonom ľudí a AI agentov pri kompozičných podnikových úlohách

WorkArena++ (NeurIPS 2024) porovnáva 682 kompozičných podnikových úloh v troch úrovniach náročnosti. GPT-4o rieši 2,1 % z nich, zatiaľ čo ľudia 93,9 %, čím presne izoluje dôvody, prečo súčasní AI agenti zlyhávajú pri vedomostnej práci s implicitnými cieľmi a prečo na tejto priepasti záleží pri autonómnej automatizácii účtovníctva.

MAC-SQL: Spolupráca viacerých agentov pri prevode textu na SQL

MAC-SQL (COLING 2025) využíva troch špecializovaných agentov — Selector na redukciu schémy, Decomposer na dekompozíciu otázok a Refiner na opravu SQL riadenú vykonávaním — na dosiahnutie 59,59 % presnosti vykonávania v benchmarku BIRD; ablácia ukazuje, že Refiner prispieva najviac (+4,63 bodu), s priamymi dôsledkami pre generovanie dopytov v účtovných knihách Beancount.