#finance
Finance
Financial research, analysis, and domain knowledge for accounting AI
FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario
FinRAGBench-V (EMNLP 2025) è il primo benchmark su larga scala per RAG multimodale con citazioni visive in finanza, coprendo oltre 112.000 pagine di documenti e 1.394 coppie QA annotate da umani. I modelli migliori raggiungono solo il 20–61% di richiamo delle citazioni a livello di blocco, e il recupero multimodale supera quello solo testuale di quasi 50 punti percentuali.
Confidenza e Calibrazione degli LLM: Una Rassegna su Quanto Mostra Realmente la Ricerca
Una rassegna sistematica dei metodi di stima della confidenza e calibrazione degli LLM—approcci white-box basati su logit, SelfCheckGPT basato sulla consistenza ed entropia semantica—rivela che i punteggi di confidenza verbalizzata di GPT-4 raggiungono solo circa il 62,7% di AUROC, appena sopra il caso, con implicazioni dirette per l'implementazione di agenti sensibili all'incertezza nella finanza e nella contabilità.
FinTrace: Valutazione a Livello di Traiettoria della Chiamata a Strumenti LLM per Compiti Finanziari
FinTrace valuta 13 LLM su 800 traiettorie di compiti finanziari annotate da esperti, attraverso 9 metriche, scoprendo che i modelli all'avanguardia ottengono una forte selezione degli strumenti (F1 ~0.9) ma solo 3,23/5 nell'utilizzo delle informazioni — il passaggio in cui gli agenti ragionano su ciò che gli strumenti restituiscono.
OmniEval: Benchmark di Valutazione RAG Omnidirezionale per il Dominio Finanziario
OmniEval (EMNLP 2025) valuta i sistemi RAG su 5 tipi di task × 16 argomenti finanziari utilizzando 11.4k casi di test generati automaticamente. I sistemi migliori raggiungono solo il 36% di accuratezza numerica — prova concreta che le pipeline RAG necessitano di livelli di validazione prima di scrivere su registri finanziari strutturati.
FinDER: Query di analisti reali rivelano un divario di recall del 74% nella RAG finanziaria
FinDER valuta la RAG su 5.703 query reali di analisti di hedge fund rispetto ai moduli 10-K S&P 500; E5-Mistral raggiunge solo il 25,95% di recall contestuale, e le query ricche di abbreviazioni costano 8,2 punti di precisione — prova che la normalizzazione delle query, non migliori embedding, è il primo intervento per le pipeline AI finanziarie.
Persi nel Mezzo: Bias Posizionale negli LLM e il Suo Impatto sull'AI Finanziaria
L'articolo di Liu et al. (TACL 2024) mostra che gli LLM ottengono fino a 20 punti in meno sulle informazioni sepolte nel mezzo di contesti lunghi — un degrado a forma di U che colpisce ogni modello testato, incluso Claude-1.3-100K — con implicazioni concrete su come i pipeline RAG dovrebbero ordinare i passaggi recuperati nelle applicazioni finanziarie e contabili.
AnoLLM: Fine-Tuning di LLM per il Rilevamento di Anomalie Tabulari in Dati Finanziari
AnoLLM (ICLR 2025) riformula il rilevamento di anomalie tabulari come stima di densità LLM — fine-tuning su righe normali e valutazione tramite log-verosimiglianza negativa. Supera i metodi classici su dataset di frodi a tipi misti, ma non offre alcun vantaggio su dati puramente numerici, con implicazioni reali per il rilevamento di anomalie nelle registrazioni del ledger Beancount.
DocFinQA: Ragionamento Finanziario su Contesto Lungo Basato su Documenti SEC Completi
DocFinQA sostituisce i passaggi curati di 700 parole di FinQA con interi documenti SEC di 123.000 parole, esponendo un aumento di contesto di 175 volte che dimezza quasi l'accuratezza di GPT-4 su documenti lunghi. I pipeline di recupero falliscono nell'estrarre il frammento corretto nel 45% dei casi a HR@3 — e i modelli a contesto lungo non rappresentano un sostituto.
TheAgentCompany: Benchmark degli Agenti LLM su Compiti Aziendali Reali
TheAgentCompany testa 175 compiti lavorativi reali attraverso una intranet simulata con GitLab, OwnCloud e RocketChat. Il miglior modello (Gemini-2.5-Pro) completa solo il 30% dei compiti a $4 ciascuno, rivelando che gli agenti autonomi sono ancora ben lontani dall'essere utilizzabili per i flussi di lavoro di contabilità e finanza.
InvestorBench: Benchmarking di Agenti LLM nelle Decisioni di Trading Finanziario
InvestorBench (ACL 2025) testa 13 modelli LLM backbone su trading backtestato di azioni, criptovalute ed ETF utilizzando il rendimento cumulativo e l'indice di Sharpe — non l'accuratezza nel rispondere a domande. Qwen2.5-72B è in cima alla classifica delle azioni con un CR del 46,15%; i modelli ottimizzati per la finanza falliscono con le azioni. La dimensione del modello predice le performance in modo più affidabile dell'ottimizzazione per dominio.
LLM ad Agente Singolo Superano i Sistemi Multi-Agente nel Ragionamento Multi-Salto a Parità di Budget di Token di Pensiero
Una preprint di Stanford del 2026 equalizza i budget di token di pensiero in cinque architetture multi-agente e scopre che i LLM ad agente singolo eguagliano o superano i sistemi multi-agente nel ragionamento multi-salto — con fondamento teorico nella Disuguaglianza di Elaborazione dei Dati e implicazioni per la progettazione di agenti AI finanziari.
M3MAD-Bench: I dibattiti multi-agente sono davvero efficaci tra domini e modalità?
M3MAD-Bench mette sotto stress il Dibattito Multi-Agente su 9 modelli, 5 domini e impostazioni visione-linguaggio, scoprendo che il Delirio Collettivo causa il 65% dei fallimenti, il dibattito avversario riduce l'accuratezza fino al 12,8% e l'Auto-Consistenza generalmente eguaglia l'accuratezza del dibattito a un costo di token inferiore.