Salta al contenuto principale

Registro di ricerca

Esperimenti e risultati aperti di Bean Labs — l'iniziativa di ricerca Finance AI Agent di Beancount.io.

GuardAgent: Applicazione Deterministica della Sicurezza per Agenti LLM tramite Esecuzione di Codice

GuardAgent (ICML 2025) posiziona un agente LLM separato tra un agente target e il suo ambiente, verificando ogni azione proposta generando ed eseguendo codice Python — raggiungendo il 98,7% di accuratezza nell'applicazione delle policy, preservando al contempo il 100% del completamento delle attività, contro l'81% di accuratezza e il 29-71% di fallimento nelle attività per le regole di sicurezza incorporate nel prompt.

Dibattito Multiagente con LLM: Veri Guadagni di Accuratezza, Calcolo Incontrollato e Delirio Collettivo

Un'analisi approfondita del paper di Du et al. su ICML 2024 sul dibattito multiagente — che riporta guadagni di accuratezza del 14,8% su operazioni aritmetiche — insieme alle confutazioni del 2025 che mostrano come agenti singoli con pari budget eguaglino le performance del dibattito, e un'analisi del perché il Delirio Collettivo (65% dei fallimenti del dibattito) rappresenti un rischio specifico per le registrazioni contabili assistite da IA.

I LLM non sono utili per il forecasting di serie temporali: cosa significa NeurIPS 2024 per la finanza AI

Un articolo Spotlight di NeurIPS 2024 abla tre metodi di previsione di serie temporali basati su LLM — OneFitsAll, Time-LLM e CALF — e scopre che la rimozione del modello linguistico migliora l'accuratezza nella maggior parte dei casi, con un'accelerazione dell'addestramento fino a 1.383×. Per applicazioni di finanza AI come la previsione del saldo di Beancount, modelli leggeri e costruiti appositamente superano costantemente i LLM riadattati.

Generazione Aumentata da Recupero per Compiti NLP ad Alta Intensità di Conoscenza

L'articolo di Lewis et al. del NeurIPS 2020 ha introdotto l'architettura ibrida RAG—un generatore BART-large abbinato a un recuperatore indicizzato FAISS su 21 milioni di passaggi di Wikipedia—raggiungendo un EM di 44.5 su Natural Questions e stabilendo la suddivisione parametrico/non-parametrico che oggi è alla base della maggior parte dei sistemi AI di produzione. Questa rassegna copre i compromessi RAG-Sequence vs. RAG-Token, la modalità di fallimento del collasso del recupero, e cosa significano gli indici obsoleti per l'AI finanziaria costruita su registri Beancount solo-append.

ConvFinQA: Domande e Risposte Finanziarie Multi-Turn e il Divario di 21 Punti tra Modelli ed Esperti Umani

ConvFinQA (EMNLP 2022) estende FinQA al dialogo multi-turn sui report sugli utili delle aziende S&P 500, scoprendo che il miglior modello ottimizzato raggiunge un'accuratezza di esecuzione del 68,9% contro l'89,4% degli esperti umani – e scende al 52,4% nelle conversazioni ibride multi-aspetto dove i modelli devono trasportare il contesto numerico tra diversi argomenti finanziari.

TAT-QA: Benchmark ibrido basato su tabella e testo per il ragionamento su relazioni finanziarie annuali

TAT-QA è un benchmark con 16.552 domande su contesti ibridi di tabelle e testo tratti da relazioni finanziarie, che ha dimostrato che l’ancoraggio dell’evidenza — non l’aritmetica — è il collo di bottiglia principale nell’IA finanziaria; entro il 2024, LLM 7B ottimizzati hanno raggiunto l’83% F1, colmando gran parte del divario rispetto al tetto umano del 91%.