Salta al contenuto principale

Registro di ricerca

Esperimenti e risultati aperti di Bean Labs — l'iniziativa di ricerca Finance AI Agent di Beancount.io.

GraphRAG: Dalla Sintesi Locale a quella Globale Focalizzata sulle Query

Il GraphRAG di Microsoft costruisce un grafo di entità partizionato con Leiden su un corpus di testi e precalcola riassunti delle community per rispondere a domande di comprensione globale che il RAG vettoriale standard non può gestire — ma un audit sui bias del 2025 mostra che i suoi tassi di vittoria del 72–83% crollano dopo aver corretto gli artefatti di posizione e lunghezza nella valutazione LLM-as-judge.

InvestorBench: Benchmarking di Agenti LLM nelle Decisioni di Trading Finanziario

InvestorBench (ACL 2025) testa 13 modelli LLM backbone su trading backtestato di azioni, criptovalute ed ETF utilizzando il rendimento cumulativo e l'indice di Sharpe — non l'accuratezza nel rispondere a domande. Qwen2.5-72B è in cima alla classifica delle azioni con un CR del 46,15%; i modelli ottimizzati per la finanza falliscono con le azioni. La dimensione del modello predice le performance in modo più affidabile dell'ottimizzazione per dominio.

StructRAG (ICLR 2025): Scegliere la Struttura Documentale Giusta Supera GraphRAG di 28 Punti

StructRAG (ICLR 2025) instrada ogni query al tipo di struttura più adatto al compito — tabella, grafo, catalogo, algoritmo o blocco di testo — prima di ragionare, ottenendo un punteggio di 28 punti superiore a GraphRAG sul benchmark Loong, eseguendo 22× più velocemente, con il solo router addestrato con DPO che contribuisce a un guadagno di accuratezza di 15 punti.

LLM ad Agente Singolo Superano i Sistemi Multi-Agente nel Ragionamento Multi-Salto a Parità di Budget di Token di Pensiero

Una preprint di Stanford del 2026 equalizza i budget di token di pensiero in cinque architetture multi-agente e scopre che i LLM ad agente singolo eguagliano o superano i sistemi multi-agente nel ragionamento multi-salto — con fondamento teorico nella Disuguaglianza di Elaborazione dei Dati e implicazioni per la progettazione di agenti AI finanziari.

AGrail: Barriere di Sicurezza Adattive per Agenti LLM che Imparano tra Attività Diverse

AGrail (ACL 2025) introduce una barriera di sicurezza cooperativa a due LLM che adatta i controlli di sicurezza al momento dell'inferenza tramite adattamento al test, raggiungendo uno 0% di successo negli attacchi di iniezione di prompt e il 95,6% di preservazione delle azioni benigne su Safe-OS — rispetto a GuardAgent e LLaMA-Guard che bloccano fino al 49,2% delle azioni legittime.

Atlas: Il Pre-Addestramento Congiunto Retriever-Reader Supera LLM da 540B Parametri con 11B Parametri

Atlas (JMLR 2023) raggiunge il 42,4% di accuratezza su Natural Questions con solo 64 esempi di addestramento—superando PaLM 540B di 3 punti usando 11B parametri—pre-addestrando congiuntamente un retriever denso basato su Contriever con un lettore T5 Fusion-in-Decoder. L'analisi copre i limiti dell'accuratezza del recupero, i costi infrastrutturali dell'indice da 587GB e le implicazioni per i sistemi di Q&A sui libri contabili Beancount.