Bean Labs Research Log
Open experiments and findings from Bean Labs — the Finance AI Agent research initiative by Beancount.io. Sfoglia per tag.
OpenHands: Piattaforma Aperta per Agenti Software AI e le sue Implicazioni per l'Automazione Finanziaria
OpenHands è una piattaforma per agenti con licenza MIT, in ambiente sandbox Docker, dove CodeAct raggiunge il 26% su SWE-Bench Lite — un benchmark che fissa con sobrietà ciò che gli agenti AI possono fare realmente oggi, e spiega perché le prime implementazioni produttive in finanza dovrebbero essere strettamente circoscritte piuttosto che autonome.
Fin-RATE: Come gli LLM Falliscono nell'Analisi Finanziaria Inter-Periodo e Cross-Entità
Fin-RATE valuta 17 LLM su 7.500 coppie Q&A curate da esperti provenienti da 2.472 documenti SEC, rivelando un crollo di accuratezza del 18,60% nel monitoraggio longitudinale e un calo di 54 punti per il modello finanziario specializzato Fin-R1 in compiti cross-entità, con il pipeline di recupero, non il modello di base, come collo di bottiglia vincolante.
FinDER: Query di analisti reali rivelano un divario di recall del 74% nella RAG finanziaria
FinDER valuta la RAG su 5.703 query reali di analisti di hedge fund rispetto ai moduli 10-K S&P 500; E5-Mistral raggiunge solo il 25,95% di recall contestuale, e le query ricche di abbreviazioni costano 8,2 punti di precisione — prova che la normalizzazione delle query, non migliori embedding, è il primo intervento per le pipeline AI finanziarie.
Persi nel Mezzo: Bias Posizionale negli LLM e il Suo Impatto sull'AI Finanziaria
L'articolo di Liu et al. (TACL 2024) mostra che gli LLM ottengono fino a 20 punti in meno sulle informazioni sepolte nel mezzo di contesti lunghi — un degrado a forma di U che colpisce ogni modello testato, incluso Claude-1.3-100K — con implicazioni concrete su come i pipeline RAG dovrebbero ordinare i passaggi recuperati nelle applicazioni finanziarie e contabili.
Benchmark AD-LLM: GPT-4o Raggiunge AUROC 0,93+ Zero-Shot per il Rilevamento di Anomalie nel Testo
AD-LLM valuta GPT-4o e Llama 3.1 8B in tre ruoli di rilevamento anomalie — rilevatore zero-shot, amplificatore di dati e selezionatore di modelli — su cinque dataset NLP; GPT-4o raggiunge AUROC 0,93–0,99 zero-shot, ma la selezione del modello basata su LLM rimane inaffidabile, con implicazioni dirette per l'audit finanziario basato su IA.
CausalTAD: Ordinamento Causale delle Colonne per il Rilevamento di Anomalie Tabulari con LLM
CausalTAD migliora il rilevamento di anomalie tabulari basato su LLM riordinando le colonne delle tabelle per rispettare le dipendenze causali prima della serializzazione, aumentando l'AUC-ROC medio da 0,803 a 0,834 rispetto ad AnoLLM su benchmark a tipi misti — con implicazioni dirette per il rilevamento di anomalie in dati strutturati di registri contabili.
AnoLLM: Fine-Tuning di LLM per il Rilevamento di Anomalie Tabulari in Dati Finanziari
AnoLLM (ICLR 2025) riformula il rilevamento di anomalie tabulari come stima di densità LLM — fine-tuning su righe normali e valutazione tramite log-verosimiglianza negativa. Supera i metodi classici su dataset di frodi a tipi misti, ma non offre alcun vantaggio su dati puramente numerici, con implicazioni reali per il rilevamento di anomalie nelle registrazioni del ledger Beancount.
Gli LLM Ottengono il 2,3% sulla Generazione di DSL Beancount: Il Benchmark LLMFinLiteracy
Il benchmark LLMFinLiteracy rileva che cinque modelli open-weight da circa 7B generano transazioni Beancount completamente corrette solo nel 2,3% dei casi, con errori concentrati nel ragionamento contabile—non nella sintassi—indicando il feedback compiler-in-the-loop come ingrediente critico mancante per agenti di write-back affidabili.
TableMaster: Ragionamento Adattivo per la Comprensione di Tabelle con LLM
TableMaster è una pipeline basata esclusivamente su prompting che raggiunge il 78,13% su WikiTQ con GPT-4o-mini—13 punti sopra Chain-of-Table—combinando estrazione del focus tabellare, verbalizzazione semantica e commutazione adattiva tra ragionamento testuale e simbolico. Ecco cosa significa l'architettura per gli agenti AI che lavorano su registri finanziari come Beancount.
Rilevamento di Anomalie Zero-Shot con LLM: Come GPT-4 si Comporta sui Dati Tabulari
GPT-4 raggiunge un AUROC medio di 74.1 sul benchmark ODDS senza fine-tuning — quasi eguagliando la linea di base classica ECOD a 75.5 — ma fallisce su anomalie multidimensionali e dataset ad alta varianza; una revisione critica del rilevamento di anomalie LLM zero-shot e delle sue implicazioni per la revisione automatizzata della contabilità Beancount.
DocFinQA: Ragionamento Finanziario su Contesto Lungo Basato su Documenti SEC Completi
DocFinQA sostituisce i passaggi curati di 700 parole di FinQA con interi documenti SEC di 123.000 parole, esponendo un aumento di contesto di 175 volte che dimezza quasi l'accuratezza di GPT-4 su documenti lunghi. I pipeline di recupero falliscono nell'estrarre il frammento corretto nel 45% dei casi a HR@3 — e i modelli a contesto lungo non rappresentano un sostituto.
TheAgentCompany: Benchmark degli Agenti LLM su Compiti Aziendali Reali
TheAgentCompany testa 175 compiti lavorativi reali attraverso una intranet simulata con GitLab, OwnCloud e RocketChat. Il miglior modello (Gemini-2.5-Pro) completa solo il 30% dei compiti a $4 ciascuno, rivelando che gli agenti autonomi sono ancora ben lontani dall'essere utilizzabili per i flussi di lavoro di contabilità e finanza.