Salta al contenuto principale

Bean Labs Research Log

Open experiments and findings from Bean Labs — the Finance AI Agent research initiative by Beancount.io. Sfoglia per tag.

OpenHands: Piattaforma Aperta per Agenti Software AI e le sue Implicazioni per l'Automazione Finanziaria
·mike

OpenHands: Piattaforma Aperta per Agenti Software AI e le sue Implicazioni per l'Automazione Finanziaria

OpenHands è una piattaforma per agenti con licenza MIT, in ambiente sandbox Docker, dove CodeAct raggiunge il 26% su SWE-Bench Lite — un benchmark che fissa con sobrietà ciò che gli agenti AI possono fare realmente oggi, e spiega perché le prime implementazioni produttive in finanza dovrebbero essere strettamente circoscritte piuttosto che autonome.

ai
open-source
automation
Fin-RATE: Come gli LLM Falliscono nell'Analisi Finanziaria Inter-Periodo e Cross-Entità
·mike

Fin-RATE: Come gli LLM Falliscono nell'Analisi Finanziaria Inter-Periodo e Cross-Entità

Fin-RATE valuta 17 LLM su 7.500 coppie Q&A curate da esperti provenienti da 2.472 documenti SEC, rivelando un crollo di accuratezza del 18,60% nel monitoraggio longitudinale e un calo di 54 punti per il modello finanziario specializzato Fin-R1 in compiti cross-entità, con il pipeline di recupero, non il modello di base, come collo di bottiglia vincolante.

llm
ai
machine-learning
FinDER: Query di analisti reali rivelano un divario di recall del 74% nella RAG finanziaria
·mike

FinDER: Query di analisti reali rivelano un divario di recall del 74% nella RAG finanziaria

FinDER valuta la RAG su 5.703 query reali di analisti di hedge fund rispetto ai moduli 10-K S&P 500; E5-Mistral raggiunge solo il 25,95% di recall contestuale, e le query ricche di abbreviazioni costano 8,2 punti di precisione — prova che la normalizzazione delle query, non migliori embedding, è il primo intervento per le pipeline AI finanziarie.

ai
llm
machine-learning
Persi nel Mezzo: Bias Posizionale negli LLM e il Suo Impatto sull'AI Finanziaria
·mike

Persi nel Mezzo: Bias Posizionale negli LLM e il Suo Impatto sull'AI Finanziaria

L'articolo di Liu et al. (TACL 2024) mostra che gli LLM ottengono fino a 20 punti in meno sulle informazioni sepolte nel mezzo di contesti lunghi — un degrado a forma di U che colpisce ogni modello testato, incluso Claude-1.3-100K — con implicazioni concrete su come i pipeline RAG dovrebbero ordinare i passaggi recuperati nelle applicazioni finanziarie e contabili.

llm
ai
machine-learning
Benchmark AD-LLM: GPT-4o Raggiunge AUROC 0,93+ Zero-Shot per il Rilevamento di Anomalie nel Testo
·mike

Benchmark AD-LLM: GPT-4o Raggiunge AUROC 0,93+ Zero-Shot per il Rilevamento di Anomalie nel Testo

AD-LLM valuta GPT-4o e Llama 3.1 8B in tre ruoli di rilevamento anomalie — rilevatore zero-shot, amplificatore di dati e selezionatore di modelli — su cinque dataset NLP; GPT-4o raggiunge AUROC 0,93–0,99 zero-shot, ma la selezione del modello basata su LLM rimane inaffidabile, con implicazioni dirette per l'audit finanziario basato su IA.

llm
ai
machine-learning
CausalTAD: Ordinamento Causale delle Colonne per il Rilevamento di Anomalie Tabulari con LLM
·mike

CausalTAD: Ordinamento Causale delle Colonne per il Rilevamento di Anomalie Tabulari con LLM

CausalTAD migliora il rilevamento di anomalie tabulari basato su LLM riordinando le colonne delle tabelle per rispettare le dipendenze causali prima della serializzazione, aumentando l'AUC-ROC medio da 0,803 a 0,834 rispetto ad AnoLLM su benchmark a tipi misti — con implicazioni dirette per il rilevamento di anomalie in dati strutturati di registri contabili.

llm
ai
machine-learning
AnoLLM: Fine-Tuning di LLM per il Rilevamento di Anomalie Tabulari in Dati Finanziari
·mike

AnoLLM: Fine-Tuning di LLM per il Rilevamento di Anomalie Tabulari in Dati Finanziari

AnoLLM (ICLR 2025) riformula il rilevamento di anomalie tabulari come stima di densità LLM — fine-tuning su righe normali e valutazione tramite log-verosimiglianza negativa. Supera i metodi classici su dataset di frodi a tipi misti, ma non offre alcun vantaggio su dati puramente numerici, con implicazioni reali per il rilevamento di anomalie nelle registrazioni del ledger Beancount.

ai
llm
machine-learning
Gli LLM Ottengono il 2,3% sulla Generazione di DSL Beancount: Il Benchmark LLMFinLiteracy
·mike

Gli LLM Ottengono il 2,3% sulla Generazione di DSL Beancount: Il Benchmark LLMFinLiteracy

Il benchmark LLMFinLiteracy rileva che cinque modelli open-weight da circa 7B generano transazioni Beancount completamente corrette solo nel 2,3% dei casi, con errori concentrati nel ragionamento contabile—non nella sintassi—indicando il feedback compiler-in-the-loop come ingrediente critico mancante per agenti di write-back affidabili.

llm
beancount
plain-text-accounting
TableMaster: Ragionamento Adattivo per la Comprensione di Tabelle con LLM
·mike

TableMaster: Ragionamento Adattivo per la Comprensione di Tabelle con LLM

TableMaster è una pipeline basata esclusivamente su prompting che raggiunge il 78,13% su WikiTQ con GPT-4o-mini—13 punti sopra Chain-of-Table—combinando estrazione del focus tabellare, verbalizzazione semantica e commutazione adattiva tra ragionamento testuale e simbolico. Ecco cosa significa l'architettura per gli agenti AI che lavorano su registri finanziari come Beancount.

ai
llm
machine-learning
Rilevamento di Anomalie Zero-Shot con LLM: Come GPT-4 si Comporta sui Dati Tabulari
·mike

Rilevamento di Anomalie Zero-Shot con LLM: Come GPT-4 si Comporta sui Dati Tabulari

GPT-4 raggiunge un AUROC medio di 74.1 sul benchmark ODDS senza fine-tuning — quasi eguagliando la linea di base classica ECOD a 75.5 — ma fallisce su anomalie multidimensionali e dataset ad alta varianza; una revisione critica del rilevamento di anomalie LLM zero-shot e delle sue implicazioni per la revisione automatizzata della contabilità Beancount.

ai
llm
fraud-detection
DocFinQA: Ragionamento Finanziario su Contesto Lungo Basato su Documenti SEC Completi
·mike

DocFinQA: Ragionamento Finanziario su Contesto Lungo Basato su Documenti SEC Completi

DocFinQA sostituisce i passaggi curati di 700 parole di FinQA con interi documenti SEC di 123.000 parole, esponendo un aumento di contesto di 175 volte che dimezza quasi l'accuratezza di GPT-4 su documenti lunghi. I pipeline di recupero falliscono nell'estrarre il frammento corretto nel 45% dei casi a HR@3 — e i modelli a contesto lungo non rappresentano un sostituto.

ai
llm
machine-learning
TheAgentCompany: Benchmark degli Agenti LLM su Compiti Aziendali Reali
·mike

TheAgentCompany: Benchmark degli Agenti LLM su Compiti Aziendali Reali

TheAgentCompany testa 175 compiti lavorativi reali attraverso una intranet simulata con GitLab, OwnCloud e RocketChat. Il miglior modello (Gemini-2.5-Pro) completa solo il 30% dei compiti a $4 ciascuno, rivelando che gli agenti autonomi sono ancora ben lontani dall'essere utilizzabili per i flussi di lavoro di contabilità e finanza.

ai
llm
automation
Mostrando 13–24 di 89 articoli