Bean Labs Research Log
Open experiments and findings from Bean Labs — the Finance AI Agent research initiative by Beancount.io. Sfoglia per tag.
SWE-agent: Come il Design dell'Interfaccia Sblocca l'Ingegneria del Software Automatizzata
SWE-agent (NeurIPS 2024) introduce le Interfacce Agente-Computer (ACI) — strati progettati appositamente tra LLM e ambienti software — mostrando un miglioramento di 10,7 punti percentuali rispetto all'accesso shell grezzo e una risoluzione del 12,47% su SWE-bench con GPT-4 Turbo. Il design dell'interfaccia, non la capacità del modello, è il collo di bottiglia principale per gli agenti di codifica autonomi.
SWE-bench: I modelli linguistici possono risolvere problemi reali di GitHub?
SWE-bench valuta i modelli linguistici su 2.294 problemi reali di GitHub in 12 repository Python utilizzando test basati sull'esecuzione; al momento della pubblicazione, Claude 2 risolveva solo l'1,96% dei problemi con recupero realistico, stabilendo il benchmark de facto per gli agenti di codifica e rivelando modalità di fallimento nel recupero e nella lunghezza delle patch direttamente rilevanti per gli agenti di scrittura su Beancount.
CodeAct: Perché il Codice Python Eseguibile Rende gli Agenti LLM il 20% più Precisa
CodeAct (ICML 2024) sostituisce le chiamate a strumenti in JSON con codice Python eseguibile, migliorando i tassi di successo degli agenti GPT-4 di circa 20 punti percentuali in attività multi-strumento e riducendo i turni di interazione del 30% — con implicazioni dirette per la creazione di agenti affidabili per la riconcilazione con Beancount.
I LLM non possono ancora autocorreggere il ragionamento — Risultati ICLR 2024 e implicazioni per la finanza AI
Huang et al. (ICLR 2024) mostrano che i LLM a cui viene chiesto di rivedere il proprio ragionamento senza feedback esterno degradano costantemente l'accuratezza — GPT-4 scende dal 95,5% al 91,5% su GSM8K — e cosa questo significa per progettare agenti affidabili per le registrazioni contabili in Beancount.
Albero dei Pensieri: Risoluzione Deliberata di Problemi con Ricerca LLM
L'Albero dei Pensieri (ToT) raggiunge il 74% nel gioco del 24 contro il 4% del GPT-4 CoT standard, organizzando il ragionamento LLM in un albero di ricerca ramificato con potatura e backtracking — con implicazioni dirette per la classificazione finanziaria multi-step e l'ottimizzazione fiscale nei flussi di lavoro Beancount.
CRITIC: Perché l'Autocorrezione degli LLM Richiede Feedback Esterno dagli Strumenti
CRITIC (ICLR 2024) ottiene un guadagno di 7,7 F1 nel QA su dominio aperto e una riduzione della tossicità del 79,2% ancorando la revisione dell'LLM ai segnali di strumenti esterni — un ciclo di verifica-e-correzione che si mappa direttamente sulla sicurezza di scrittura per agenti finanziari Beancount.
Reflexion: Agenti linguistici che imparano dagli errori senza riaddestramento
Reflexion (NeurIPS 2023) consente agli agenti LLM di migliorare memorizzando post-mortem verbali in un buffer episodico, senza necessità di aggiornamenti dei pesi. Raggiunge il 91% su HumanEval con GPT-4, ma fallisce su WebShop, rivelando un vincolo strutturale: l'apprendimento per rinforzo verbale funziona solo quando il valutatore produce un segnale chiaro e utilizzabile. Ecco cosa significa per la creazione di un agente di contabilità Beancount auto-correttivo.
Auto-coerenza: il voto di maggioranza aumenta l'accuratezza della catena di pensiero
L'auto-coerenza sostituisce la decodifica 'golosa' della catena di pensiero con un voto di maggioranza su N percorsi di ragionamento campionati, migliorando l'accuratezza di GPT-3 su GSM8K di 17,9 punti percentuali senza addestramento aggiuntivo, e si applica direttamente a calcoli finanziari multi-step dove la singola decodifica del modello è inaffidabile.
PAL: Modelli Linguistici Assistiti da Programmi per un'Aritmetica Finanziaria Affidabile
PAL (Modelli Linguistici Assistiti da Programmi) ottiene un guadagno di accuratezza del +38pp rispetto alla catena di pensiero su compiti a forte componente aritmetica, delegando il calcolo a un interprete Python — un'architettura direttamente applicabile per query affidabili sui libri contabili Beancount e per l'IA finanziaria.
I LLM possono ragionare su dati tabellari? Cosa ci dicono quattro benchmark sull'AI finanziaria
Quattro benchmark 2024-2025 mostrano GPT-4 con un punteggio del 42% nel QA su tabelle reali contro l'86% degli umani, con aggregazioni complesse che crollano al 19,6%—e la sintassi nativa di Beancount si trova all'estremità peggiore della gerarchia di serializzazione per l'input LLM.
Intelligenza Artificiale Costituzionale per Agenti Contabili: RLAIF, Regole Politiche e Rischi di Goodharting
Il paper sull'IA Costituzionale di Anthropic (Bai et al., 2022) addestra LLM a seguire regole utilizzando feedback generato da AI invece di etichette di danno umane. Questo report di ricerca esamina come il ciclo critica-revisione-preferenza di RLAIF si mappi sulla sicurezza in scrittura per agenti autonomi del registro Beancount — e come appaiano Goodharting, errori di calibrazione e rischi a duplice uso quando la 'costituzione' è un piano dei conti anziché un insieme di regole etiche.
Prompting a Catena di Pensiero: Compromessi Precisione-Richiamo per l'AI Finanziaria
Una lettura approfondita dell'articolo del 2022 di Wei et al. sul Chain-of-Thought e il suo significato per l'AI finanziaria — perché il CoT aumenta la precisione ma può ridurre il richiamo nel rilevamento di eventi rari, perché la soglia di scala è importante per gli agenti di produzione e cosa dovrebbe monitorare un team finanziario che sviluppa con LLM.