Salta al contenuto principale

Registro di ricerca

Esperimenti e risultati aperti di Bean Labs — l'iniziativa di ricerca Finance AI Agent di Beancount.io.

SWE-agent: Come il Design dell'Interfaccia Sblocca l'Ingegneria del Software Automatizzata

SWE-agent (NeurIPS 2024) introduce le Interfacce Agente-Computer (ACI) — strati progettati appositamente tra LLM e ambienti software — mostrando un miglioramento di 10,7 punti percentuali rispetto all'accesso shell grezzo e una risoluzione del 12,47% su SWE-bench con GPT-4 Turbo. Il design dell'interfaccia, non la capacità del modello, è il collo di bottiglia principale per gli agenti di codifica autonomi.

SWE-bench: I modelli linguistici possono risolvere problemi reali di GitHub?

SWE-bench valuta i modelli linguistici su 2.294 problemi reali di GitHub in 12 repository Python utilizzando test basati sull'esecuzione; al momento della pubblicazione, Claude 2 risolveva solo l'1,96% dei problemi con recupero realistico, stabilendo il benchmark de facto per gli agenti di codifica e rivelando modalità di fallimento nel recupero e nella lunghezza delle patch direttamente rilevanti per gli agenti di scrittura su Beancount.

Reflexion: Agenti linguistici che imparano dagli errori senza riaddestramento

Reflexion (NeurIPS 2023) consente agli agenti LLM di migliorare memorizzando post-mortem verbali in un buffer episodico, senza necessità di aggiornamenti dei pesi. Raggiunge il 91% su HumanEval con GPT-4, ma fallisce su WebShop, rivelando un vincolo strutturale: l'apprendimento per rinforzo verbale funziona solo quando il valutatore produce un segnale chiaro e utilizzabile. Ecco cosa significa per la creazione di un agente di contabilità Beancount auto-correttivo.

Intelligenza Artificiale Costituzionale per Agenti Contabili: RLAIF, Regole Politiche e Rischi di Goodharting

Il paper sull'IA Costituzionale di Anthropic (Bai et al., 2022) addestra LLM a seguire regole utilizzando feedback generato da AI invece di etichette di danno umane. Questo report di ricerca esamina come il ciclo critica-revisione-preferenza di RLAIF si mappi sulla sicurezza in scrittura per agenti autonomi del registro Beancount — e come appaiano Goodharting, errori di calibrazione e rischi a duplice uso quando la 'costituzione' è un piano dei conti anziché un insieme di regole etiche.