Bean Labs Research Log
Open experiments and findings from Bean Labs — the Finance AI Agent research initiative by Beancount.io. Sfoglia per tag.
FinQA: Il Benchmark che Misura il Ragionamento Numerico dell'IA sui Report Finanziari
FinQA (EMNLP 2021) ha costruito 8.281 coppie QA dai report sugli utili delle aziende S&P 500, richiedendo programmi aritmetici multi-step. I modelli neurali hanno ottenuto un punteggio del 61% al rilascio, contro il 91% degli esperti umani; l'accuratezza crolla al 22% su programmi con tre o più passaggi. Le modalità di fallimento — costanti di dominio, grounding cross-modale, lunghezza della catena — corrispondono direttamente alle sfide che gli agenti Beancount affrontano oggi.
FinanceBench: Perché il RAG basato su Vector-Store Fallisce sui Documenti Finanziari Reali
FinanceBench valuta 16 configurazioni AI su 10.231 domande tratte da documenti SEC reali; il RAG basato su un archivio vettoriale condiviso risponde correttamente solo nel 19% dei casi, e persino GPT-4-Turbo con il passaggio oracle raggiunge solo l'85% di precisione, dimostrando che il ragionamento numerico, e non il recupero, è il vincolo principale per l'AI finanziaria aziendale.
DSPy: Sostituire l'Ingegneria Fragile dei Prompt con Pipeline LLM Compilate
DSPy sostituisce le stringhe di prompt artigianali con firme dichiarative e un compilatore guidato da metriche, portando Llama2-13b dal 9,4% al 46,9% nel ragionamento matematico GSM8K e offrendo un percorso più manutenibile per pipeline AI finanziarie in produzione.
LATS: Language Agent Tree Search — Integrazione di Ragionamento, Azione e Pianificazione in un unico Framework
LATS (Language Agent Tree Search, ICML 2024) integra ReAct, Tree of Thoughts e Reflexion in un unico framework MCTS, raggiungendo il 92,7% di pass@1 su HumanEval con GPT-4. Per le contabilità Beancount basate su Git, il requisito di ripristino dello stato che limita LATS in produzione è soddisfatto con estrema facilità.
Self-RAG: Recupero Adattivo e Autocritica per LLM
Self-RAG (ICLR 2024 Oral) addestra un modello linguistico a decidere quando recuperare informazioni e poi a valutare i propri risultati utilizzando quattro token di riflessione — raggiungendo il 55,8% su PopQA e 80,2 FactScore sulle biografie, superando ChatGPT su cinque benchmark. L'analisi copre il meccanismo, i risultati delle ablazioni, i limiti di riproducibilità e le implicazioni per agenti di intelligenza artificiale finanziaria su registri Beancount.
Voyager: Le Librerie di Competenze come Fondamento per l'Apprendimento Continuo degli Agenti IA
Voyager, un agente Minecraft basato su GPT-4 di NVIDIA e Caltech, dimostra che una libreria persistente di competenze in codice consente un vero apprendimento continuo senza fine-tuning — scoprendo 3,3× più oggetti rispetto allo stato dell'arte precedente. Il pattern si applica direttamente all'automazione di ledger Beancount a lungo orizzonte, sebbene la correttezza finanziaria richieda livelli di staging che i sandbox di gioco non richiedono mai.
HippoRAG: Memoria a Lungo Termine Neurobiologicamente Ispirata per LLM
HippoRAG (NeurIPS 2024) costruisce un grafo della conoscenza da triple OpenIE e applica Personalized PageRank al momento della query, raggiungendo 89.1% Recall@5 su 2WikiMultiHopQA rispetto al 68.2% di ColBERTv2—con implicazioni dirette per interrogare registri finanziari complessi su storie transazionali pluriennali.
AgentBench:评估作为代理的 LLM —— 对金融 AI 可靠性的启示
AgentBench(Liu 等人,ICLR 2024)在 8 个交互式环境中对 27 个大语言模型进行了基准测试 —— GPT-4 的综合得分为 4.01,而表现最好的开源模型仅为 0.96。三种主要的失败模式(知识图谱失败中 67.9% 为超出任务限制、数据库失败中 53.3% 为格式错误以及无效操作)直接对应了在真实账本上部署 Beancount 回写代理的风险。
BloombergGPT e i Limiti dei LLM Specifici di Dominio nella Finanza
Bloomberg ha addestrato un LLM da 50 miliardi di parametri su 569 miliardi di token di dati finanziari, superando i modelli generici nei benchmark di sentiment analysis e ragionamento su tabelle, finché GPT-4 non lo ha eguagliato senza alcun pre-addestramento specifico per la finanza. Cosa rivela l'esperimento da 10 milioni di dollari sui compromessi del pre-addestramento di dominio, la tokenizzazione dei numeri e perché l'uso di strumenti è più affidabile degli interni del modello per gli agenti contabili.
AutoGen: Framework di Conversazione Multi-Agente per l'AI Finanziaria
AutoGen (Wu et al., 2023) introduce un framework di conversazione multi-agente in cui agenti basati su LLM si scambiano messaggi per completare attività; una configurazione a due agenti porta l'accuratezza sul benchmark MATH dal 55% al 69%, e un agente SafeGuard dedicato migliora il rilevamento di codice non sicuro fino a 35 punti F1 — risultati direttamente applicabili alla creazione di pipeline di automazione Beancount sicure e modulari.
Gorilla: Come l'Addestramento Retrieval-Aware Riduce le Allucinazioni delle API LLM dal 78% all'11%
Gorilla (Patil et al., NeurIPS 2024) mette a punto un modello LLaMA da 7B con Addestramento Retriever-Aware sulla documentazione API recuperata, riducendo i tassi di allucinazione dal 78% all'11% rispetto a GPT-4 zero-shot — con implicazioni dirette per gli agenti di scrittura AI in finanza, dove nomi di conto errati o segni invertiti sono fallimenti di correttezza, non fastidi.
MemGPT: Gestione del Contestuale Virtuale per Agenti LLM
MemGPT applica il paging della memoria virtuale in stile OS agli LLM, utilizzando un archivio a tre livelli — memoria di lavoro, richiamo e archivio — per fornire agli agenti un ricordo persistente tra le sessioni; sui benchmark di chat multi-sessione, MemGPT con GPT-4 raggiunge il 92,5% di accuratezza rispetto al 32,1% della baseline a contesto fisso.