Salta al contenuto principale

Bean Labs Research Log

Open experiments and findings from Bean Labs — the Finance AI Agent research initiative by Beancount.io. Sfoglia per tag.

τ²-bench: Misurare il Controllo Duale negli Agenti Conversazionali di IA
·mike

τ²-bench: Misurare il Controllo Duale negli Agenti Conversazionali di IA

τ²-bench estende il benchmarking degli agenti a contesti di controllo duale in cui sia l'IA che l'utente invocano strumenti su uno stato condiviso — scoprendo che gli utenti attivi riducono i tassi di successo di 18–25 punti percentuali, con implicazioni dirette per gli agenti Beancount che condividono l'accesso in scrittura con utenti umani.

ai
llm
automation
WorkArena++: Il divario del 93% tra le prestazioni umane e quelle degli agenti AI in compiti enterprise composizionali
·mike

WorkArena++: Il divario del 93% tra le prestazioni umane e quelle degli agenti AI in compiti enterprise composizionali

WorkArena++ (NeurIPS 2024) confronta 682 compiti enterprise composizionali su tre livelli di difficoltà. GPT-4o ne risolve il 2,1% mentre gli umani risolvono il 93,9%, isolando esattamente il motivo per cui gli attuali agenti AI falliscono nel lavoro cognitivo a obiettivo implicito e perché questo divario è importante per l'automazione contabile autonoma.

ai
llm
automation
Benchmark GAIA: Misurare ciò che gli Agenti IA Frontier sanno realmente fare
·mike

Benchmark GAIA: Misurare ciò che gli Agenti IA Frontier sanno realmente fare

GAIA valuta 466 attività del mondo reale su tre livelli di difficoltà; gli agenti frontier hanno raggiunto il 74,55% a metà 2026 contro il 92% degli umani, e il divario rimanente di Livello 3 si mappa direttamente sulle sfide di coordinamento multi-step nei flussi di lavoro automatizzati con registro Beancount.

ai
llm
machine-learning
OSWorld: Agenti AI Desktop riescono nel 12% dei compiti dove gli umani riescono nel 72%
·mike

OSWorld: Agenti AI Desktop riescono nel 12% dei compiti dove gli umani riescono nel 72%

OSWorld (NeurIPS 2024) valuta gli agenti AI multimodali su 369 compiti desktop reali in Ubuntu, Windows e macOS — rilevando un divario di 60 punti percentuali tra il miglior modello (12,24%) e la performance umana (72,36%), con il 75% degli insuccessi attribuiti a errori di ancoraggio visuomotorio piuttosto che a fallimenti di ragionamento.

ai
machine-learning
automation
WebArena: Il benchmark di 812 compiti che misura cosa gli agenti web possono e non possono effettivamente fare
·mike

WebArena: Il benchmark di 812 compiti che misura cosa gli agenti web possono e non possono effettivamente fare

GPT-4 completa solo il 14,41% degli 812 compiti web realistici di WebArena mentre gli umani raggiungono il 78,24%; la modalità di fallimento dominante è la falsa impossibilità — un rifiuto conservativo di agire — con implicazioni dirette per qualsiasi agente che operi su Fava o interfacce web finanziarie.

ai
llm
automation
WorkArena: Come gli Agenti Web LLM si Comportano nel Lavoro Reale della Conoscenza Aziendale
·mike

WorkArena: Come gli Agenti Web LLM si Comportano nel Lavoro Reale della Conoscenza Aziendale

WorkArena valuta gli agenti web LLM su 33 compiti reali di ServiceNow — GPT-4o raggiunge il 42,7% complessivo ma lo 0% nei compiti di filtro elenchi, esponendo un muro invalicabile tra la compilazione di moduli e l'interazione UI strutturata che si riflette direttamente sulle sfide dell'automazione dei registri Beancount.

ai
llm
automation
τ-bench: Misurare l'affidabilità degli agenti AI in domini reali di utilizzo di strumenti
·mike

τ-bench: Misurare l'affidabilità degli agenti AI in domini reali di utilizzo di strumenti

τ-bench mostra che i migliori LLM come Claude 3.5 Sonnet passano da un pass@1 di 0,692 a un pass@4 di 0,462 in attività di servizio clienti al dettaglio — un precipizio di coerenza con implicazioni dirette per qualsiasi agente di scrittura che opera su un registro Beancount.

ai
llm
machine-learning
Chain-of-Table: Evoluzione delle Tabelle nella Catena di Ragionamento dei LLM
·mike

Chain-of-Table: Evoluzione delle Tabelle nella Catena di Ragionamento dei LLM

Chain-of-Table (ICLR 2024) migliora il ragionamento tabellare dei LLM evolvendo la tabella stessa come stato intermedio — raggiungendo il 67,31% su WikiTQ rispetto al 61,48% dei baselines precedenti, con un vantaggio di +10,25 punti su tabelle oltre i 4.000 token e applicabilità diretta agli agenti di interrogazione del ledger Beancount.

ai
llm
machine-learning
TableLlama: un Modello Open da 7B può Eguagliare GPT-4 nella Comprensione delle Tabelle?
·mike

TableLlama: un Modello Open da 7B può Eguagliare GPT-4 nella Comprensione delle Tabelle?

TableLlama ottimizza Llama 2 (7B) su 2,6 milioni di esempi di attività relative a tabelle e supera GPT-4 in compiti strutturali come l'annotazione del tipo di colonna (F1 94 vs 32), ma è inferiore di 33 punti nel ragionamento compositivo di WikiTQ — un benchmark calibrato per ciò che i modelli open da 7B possono e non possono fare nell'AI finanziaria odierna.

llm
ai
machine-learning
TAPAS: Risposta a Domande su Tabelle con Supervisione Debole Senza SQL, e Cosa Significa per Beancount
·mike

TAPAS: Risposta a Domande su Tabelle con Supervisione Debole Senza SQL, e Cosa Significa per Beancount

TAPAS (Google Research, ACL 2020) risponde a domande su tabelle selezionando celle e applicando aggregazioni scalari — senza generare SQL. Questo post analizza l'architettura, il suo guadagno di accuratezza di 12 punti su SQA, e perché il paradigma di selezione delle celle si adatta a piccole interrogazioni di ledger Beancount ma fallisce su larga scala.

ai
machine-learning
llm
MAC-SQL: Text-to-SQL collaborativo multi-agente
·mike

MAC-SQL: Text-to-SQL collaborativo multi-agente

MAC-SQL (COLING 2025) utilizza tre agenti specializzati — Selettore per la riduzione dello schema, Decompositore per la scomposizione delle domande e Raffinatore per la correzione SQL guidata dall'esecuzione — raggiungendo un'accuratezza di esecuzione del 59,59% sul benchmark BIRD; l'ablation mostra che il Raffinatore contribuisce maggiormente (+4,63 punti), con implicazioni dirette per la generazione di query nel registro di Beancount.

ai
machine-learning
database
DIN-SQL: Apprendimento Contestuale Decomposto per Text-to-SQL
·mike

DIN-SQL: Apprendimento Contestuale Decomposto per Text-to-SQL

DIN-SQL (NeurIPS 2023) decompone text-to-SQL in fasi di collegamento dello schema, classificazione della complessità e generazione SQL, portando GPT-4 dal 67,4% all'85,3% di accuratezza di esecuzione su Spider senza ottimizzazione — e la stessa strategia di decomposizione si applica direttamente alle interfacce in linguaggio naturale per il linguaggio di query BQL di Beancount.

ai
llm
database
Mostrando 25–36 di 89 articoli