#plain-text-accounting
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
Rinvio Consapevole dell'Incertezza per Agenti LLM: Quando Scalare da Modelli Piccoli a Grandi
ReDAct esegue un modello piccolo per impostazione predefinita e scala a un modello costoso solo quando la perplessità a livello di token segnala incertezza, ottenendo un risparmio del 64% rispetto al solo GPT-5.2, mantenendo o superando la sua accuratezza — un pattern direttamente applicabile agli agenti di categorizzazione delle transazioni Beancount.
OpenHands: Piattaforma Aperta per Agenti Software AI e le sue Implicazioni per l'Automazione Finanziaria
OpenHands è una piattaforma per agenti con licenza MIT, in ambiente sandbox Docker, dove CodeAct raggiunge il 26% su SWE-Bench Lite — un benchmark che fissa con sobrietà ciò che gli agenti AI possono fare realmente oggi, e spiega perché le prime implementazioni produttive in finanza dovrebbero essere strettamente circoscritte piuttosto che autonome.
Gli LLM Ottengono il 2,3% sulla Generazione di DSL Beancount: Il Benchmark LLMFinLiteracy
Il benchmark LLMFinLiteracy rileva che cinque modelli open-weight da circa 7B generano transazioni Beancount completamente corrette solo nel 2,3% dei casi, con errori concentrati nel ragionamento contabile—non nella sintassi—indicando il feedback compiler-in-the-loop come ingrediente critico mancante per agenti di write-back affidabili.
TableMaster: Ragionamento Adattivo per la Comprensione di Tabelle con LLM
TableMaster è una pipeline basata esclusivamente su prompting che raggiunge il 78,13% su WikiTQ con GPT-4o-mini—13 punti sopra Chain-of-Table—combinando estrazione del focus tabellare, verbalizzazione semantica e commutazione adattiva tra ragionamento testuale e simbolico. Ecco cosa significa l'architettura per gli agenti AI che lavorano su registri finanziari come Beancount.
τ²-bench: Misurare il Controllo Duale negli Agenti Conversazionali di IA
τ²-bench estende il benchmarking degli agenti a contesti di controllo duale in cui sia l'IA che l'utente invocano strumenti su uno stato condiviso — scoprendo che gli utenti attivi riducono i tassi di successo di 18–25 punti percentuali, con implicazioni dirette per gli agenti Beancount che condividono l'accesso in scrittura con utenti umani.
Benchmark GAIA: Misurare ciò che gli Agenti IA Frontier sanno realmente fare
GAIA valuta 466 attività del mondo reale su tre livelli di difficoltà; gli agenti frontier hanno raggiunto il 74,55% a metà 2026 contro il 92% degli umani, e il divario rimanente di Livello 3 si mappa direttamente sulle sfide di coordinamento multi-step nei flussi di lavoro automatizzati con registro Beancount.
WorkArena: Come gli Agenti Web LLM si Comportano nel Lavoro Reale della Conoscenza Aziendale
WorkArena valuta gli agenti web LLM su 33 compiti reali di ServiceNow — GPT-4o raggiunge il 42,7% complessivo ma lo 0% nei compiti di filtro elenchi, esponendo un muro invalicabile tra la compilazione di moduli e l'interazione UI strutturata che si riflette direttamente sulle sfide dell'automazione dei registri Beancount.
τ-bench: Misurare l'affidabilità degli agenti AI in domini reali di utilizzo di strumenti
τ-bench mostra che i migliori LLM come Claude 3.5 Sonnet passano da un pass@1 di 0,692 a un pass@4 di 0,462 in attività di servizio clienti al dettaglio — un precipizio di coerenza con implicazioni dirette per qualsiasi agente di scrittura che opera su un registro Beancount.
Chain-of-Table: Evoluzione delle Tabelle nella Catena di Ragionamento dei LLM
Chain-of-Table (ICLR 2024) migliora il ragionamento tabellare dei LLM evolvendo la tabella stessa come stato intermedio — raggiungendo il 67,31% su WikiTQ rispetto al 61,48% dei baselines precedenti, con un vantaggio di +10,25 punti su tabelle oltre i 4.000 token e applicabilità diretta agli agenti di interrogazione del ledger Beancount.
TableLlama: un Modello Open da 7B può Eguagliare GPT-4 nella Comprensione delle Tabelle?
TableLlama ottimizza Llama 2 (7B) su 2,6 milioni di esempi di attività relative a tabelle e supera GPT-4 in compiti strutturali come l'annotazione del tipo di colonna (F1 94 vs 32), ma è inferiore di 33 punti nel ragionamento compositivo di WikiTQ — un benchmark calibrato per ciò che i modelli open da 7B possono e non possono fare nell'AI finanziaria odierna.
TAPAS: Risposta a Domande su Tabelle con Supervisione Debole Senza SQL, e Cosa Significa per Beancount
TAPAS (Google Research, ACL 2020) risponde a domande su tabelle selezionando celle e applicando aggregazioni scalari — senza generare SQL. Questo post analizza l'architettura, il suo guadagno di accuratezza di 12 punti su SQA, e perché il paradigma di selezione delle celle si adatta a piccole interrogazioni di ledger Beancount ma fallisce su larga scala.
DIN-SQL: Apprendimento Contestuale Decomposto per Text-to-SQL
DIN-SQL (NeurIPS 2023) decompone text-to-SQL in fasi di collegamento dello schema, classificazione della complessità e generazione SQL, portando GPT-4 dal 67,4% all'85,3% di accuratezza di esecuzione su Spider senza ottimizzazione — e la stessa strategia di decomposizione si applica direttamente alle interfacce in linguaggio naturale per il linguaggio di query BQL di Beancount.