Salta al contenuto principale

Bean Labs Research Log

Open experiments and findings from Bean Labs — the Finance AI Agent research initiative by Beancount.io. Sfoglia per tag.

SWE-agent: Come il Design dell'Interfaccia Sblocca l'Ingegneria del Software Automatizzata
·mike

SWE-agent: Come il Design dell'Interfaccia Sblocca l'Ingegneria del Software Automatizzata

SWE-agent (NeurIPS 2024) introduce le Interfacce Agente-Computer (ACI) — strati progettati appositamente tra LLM e ambienti software — mostrando un miglioramento di 10,7 punti percentuali rispetto all'accesso shell grezzo e una risoluzione del 12,47% su SWE-bench con GPT-4 Turbo. Il design dell'interfaccia, non la capacità del modello, è il collo di bottiglia principale per gli agenti di codifica autonomi.

ai
llm
automation
SWE-bench: I modelli linguistici possono risolvere problemi reali di GitHub?
·mike

SWE-bench: I modelli linguistici possono risolvere problemi reali di GitHub?

SWE-bench valuta i modelli linguistici su 2.294 problemi reali di GitHub in 12 repository Python utilizzando test basati sull'esecuzione; al momento della pubblicazione, Claude 2 risolveva solo l'1,96% dei problemi con recupero realistico, stabilendo il benchmark de facto per gli agenti di codifica e rivelando modalità di fallimento nel recupero e nella lunghezza delle patch direttamente rilevanti per gli agenti di scrittura su Beancount.

ai
llm
machine-learning
CodeAct: Perché il Codice Python Eseguibile Rende gli Agenti LLM il 20% più Precisa
·mike

CodeAct: Perché il Codice Python Eseguibile Rende gli Agenti LLM il 20% più Precisa

CodeAct (ICML 2024) sostituisce le chiamate a strumenti in JSON con codice Python eseguibile, migliorando i tassi di successo degli agenti GPT-4 di circa 20 punti percentuali in attività multi-strumento e riducendo i turni di interazione del 30% — con implicazioni dirette per la creazione di agenti affidabili per la riconcilazione con Beancount.

ai
llm
automation
I LLM non possono ancora autocorreggere il ragionamento — Risultati ICLR 2024 e implicazioni per la finanza AI
·mike

I LLM non possono ancora autocorreggere il ragionamento — Risultati ICLR 2024 e implicazioni per la finanza AI

Huang et al. (ICLR 2024) mostrano che i LLM a cui viene chiesto di rivedere il proprio ragionamento senza feedback esterno degradano costantemente l'accuratezza — GPT-4 scende dal 95,5% al 91,5% su GSM8K — e cosa questo significa per progettare agenti affidabili per le registrazioni contabili in Beancount.

llm
ai
machine-learning
Albero dei Pensieri: Risoluzione Deliberata di Problemi con Ricerca LLM
·mike

Albero dei Pensieri: Risoluzione Deliberata di Problemi con Ricerca LLM

L'Albero dei Pensieri (ToT) raggiunge il 74% nel gioco del 24 contro il 4% del GPT-4 CoT standard, organizzando il ragionamento LLM in un albero di ricerca ramificato con potatura e backtracking — con implicazioni dirette per la classificazione finanziaria multi-step e l'ottimizzazione fiscale nei flussi di lavoro Beancount.

ai
llm
machine-learning
CRITIC: Perché l'Autocorrezione degli LLM Richiede Feedback Esterno dagli Strumenti
·mike

CRITIC: Perché l'Autocorrezione degli LLM Richiede Feedback Esterno dagli Strumenti

CRITIC (ICLR 2024) ottiene un guadagno di 7,7 F1 nel QA su dominio aperto e una riduzione della tossicità del 79,2% ancorando la revisione dell'LLM ai segnali di strumenti esterni — un ciclo di verifica-e-correzione che si mappa direttamente sulla sicurezza di scrittura per agenti finanziari Beancount.

ai
llm
machine-learning
Reflexion: Agenti linguistici che imparano dagli errori senza riaddestramento
·mike

Reflexion: Agenti linguistici che imparano dagli errori senza riaddestramento

Reflexion (NeurIPS 2023) consente agli agenti LLM di migliorare memorizzando post-mortem verbali in un buffer episodico, senza necessità di aggiornamenti dei pesi. Raggiunge il 91% su HumanEval con GPT-4, ma fallisce su WebShop, rivelando un vincolo strutturale: l'apprendimento per rinforzo verbale funziona solo quando il valutatore produce un segnale chiaro e utilizzabile. Ecco cosa significa per la creazione di un agente di contabilità Beancount auto-correttivo.

ai
llm
machine-learning
Auto-coerenza: il voto di maggioranza aumenta l'accuratezza della catena di pensiero
·mike

Auto-coerenza: il voto di maggioranza aumenta l'accuratezza della catena di pensiero

L'auto-coerenza sostituisce la decodifica 'golosa' della catena di pensiero con un voto di maggioranza su N percorsi di ragionamento campionati, migliorando l'accuratezza di GPT-3 su GSM8K di 17,9 punti percentuali senza addestramento aggiuntivo, e si applica direttamente a calcoli finanziari multi-step dove la singola decodifica del modello è inaffidabile.

ai
llm
machine-learning
PAL: Modelli Linguistici Assistiti da Programmi per un'Aritmetica Finanziaria Affidabile
·mike

PAL: Modelli Linguistici Assistiti da Programmi per un'Aritmetica Finanziaria Affidabile

PAL (Modelli Linguistici Assistiti da Programmi) ottiene un guadagno di accuratezza del +38pp rispetto alla catena di pensiero su compiti a forte componente aritmetica, delegando il calcolo a un interprete Python — un'architettura direttamente applicabile per query affidabili sui libri contabili Beancount e per l'IA finanziaria.

ai
llm
machine-learning
I LLM possono ragionare su dati tabellari? Cosa ci dicono quattro benchmark sull'AI finanziaria
·mike

I LLM possono ragionare su dati tabellari? Cosa ci dicono quattro benchmark sull'AI finanziaria

Quattro benchmark 2024-2025 mostrano GPT-4 con un punteggio del 42% nel QA su tabelle reali contro l'86% degli umani, con aggregazioni complesse che crollano al 19,6%—e la sintassi nativa di Beancount si trova all'estremità peggiore della gerarchia di serializzazione per l'input LLM.

ai
llm
beancount
Intelligenza Artificiale Costituzionale per Agenti Contabili: RLAIF, Regole Politiche e Rischi di Goodharting
·mike

Intelligenza Artificiale Costituzionale per Agenti Contabili: RLAIF, Regole Politiche e Rischi di Goodharting

Il paper sull'IA Costituzionale di Anthropic (Bai et al., 2022) addestra LLM a seguire regole utilizzando feedback generato da AI invece di etichette di danno umane. Questo report di ricerca esamina come il ciclo critica-revisione-preferenza di RLAIF si mappi sulla sicurezza in scrittura per agenti autonomi del registro Beancount — e come appaiano Goodharting, errori di calibrazione e rischi a duplice uso quando la 'costituzione' è un piano dei conti anziché un insieme di regole etiche.

ai
machine-learning
llm
Prompting a Catena di Pensiero: Compromessi Precisione-Richiamo per l'AI Finanziaria
·mike

Prompting a Catena di Pensiero: Compromessi Precisione-Richiamo per l'AI Finanziaria

Una lettura approfondita dell'articolo del 2022 di Wei et al. sul Chain-of-Thought e il suo significato per l'AI finanziaria — perché il CoT aumenta la precisione ma può ridurre il richiamo nel rilevamento di eventi rari, perché la soglia di scala è importante per gli agenti di produzione e cosa dovrebbe monitorare un team finanziario che sviluppa con LLM.

ai
llm
machine-learning
Mostrando 73–84 di 89 articoli