#data-science
Data Science
Data science methods applied to financial datasets and accounting workflows
FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario
FinRAGBench-V (EMNLP 2025) è il primo benchmark su larga scala per RAG multimodale con citazioni visive in finanza, coprendo oltre 112.000 pagine di documenti e 1.394 coppie QA annotate da umani. I modelli migliori raggiungono solo il 20–61% di richiamo delle citazioni a livello di blocco, e il recupero multimodale supera quello solo testuale di quasi 50 punti percentuali.
WildToolBench: Perché nessun LLM supera il 15% di accuratezza di sessione nell'uso di strumenti reali
WildToolBench (ICLR 2026) valuta 57 LLM su 1.024 attività derivate dal comportamento reale degli utenti — nessun modello supera il 15% di accuratezza di sessione, con orchestrazione compositiva, intento nascosto e transizioni di istruzione come le tre modalità di fallimento più marcate.
Confidenza e Calibrazione degli LLM: Una Rassegna su Quanto Mostra Realmente la Ricerca
Una rassegna sistematica dei metodi di stima della confidenza e calibrazione degli LLM—approcci white-box basati su logit, SelfCheckGPT basato sulla consistenza ed entropia semantica—rivela che i punteggi di confidenza verbalizzata di GPT-4 raggiungono solo circa il 62,7% di AUROC, appena sopra il caso, con implicazioni dirette per l'implementazione di agenti sensibili all'incertezza nella finanza e nella contabilità.
FinToolBench: Valutazione degli agenti LLM sull'uso di strumenti finanziari in scenari reali
FinToolBench combina 760 strumenti finanziari API attivi con 295 query eseguibili per testare gli agenti LLM su compiti finanziari reali — rivelando che la frequenza di chiamata conservativa di GPT-4o del 22,7% garantisce una qualità delle risposte superiore (CSS 0,670) rispetto al TIR aggressivo di Qwen3-8B all'87,1%, mentre il disallineamento delle intenzioni supera il 50% in tutti i modelli testati.
OmniEval: Benchmark di Valutazione RAG Omnidirezionale per il Dominio Finanziario
OmniEval (EMNLP 2025) valuta i sistemi RAG su 5 tipi di task × 16 argomenti finanziari utilizzando 11.4k casi di test generati automaticamente. I sistemi migliori raggiungono solo il 36% di accuratezza numerica — prova concreta che le pipeline RAG necessitano di livelli di validazione prima di scrivere su registri finanziari strutturati.
Survey sull'Anomaly Detection con LLM (NAACL 2025): Tassonomia Solida, Copertura su Dati Tabulari Assente
Una lettura critica del survey di Xu e Ding per NAACL 2025 sull'anomaly e OOD detection basata su LLM: la tassonomia rilevazione-vs-generazione regge, ma l'assenza quasi totale di copertura sui dati tabulari costringe i professionisti dell'AI finanziaria a sintetizzare da soli le informazioni dai modelli di visione.
Trovato nel Mezzo: La Calibrazione del Bias di Attenzione Posizionale Migliora il RAG a Contesto Lungo
Una calibrazione al momento dell'inferenza, senza bisogno di training, sottrae il bias posizionale dai pesi di attenzione degli LLM, recuperando fino a 15 punti percentuali di accuratezza RAG quando i documenti recuperati sono sepolti nel mezzo del contesto — e cosa significa per pipeline di agenti specifiche per la finanza.
Fin-RATE: Come gli LLM Falliscono nell'Analisi Finanziaria Inter-Periodo e Cross-Entità
Fin-RATE valuta 17 LLM su 7.500 coppie Q&A curate da esperti provenienti da 2.472 documenti SEC, rivelando un crollo di accuratezza del 18,60% nel monitoraggio longitudinale e un calo di 54 punti per il modello finanziario specializzato Fin-R1 in compiti cross-entità, con il pipeline di recupero, non il modello di base, come collo di bottiglia vincolante.
FinDER: Query di analisti reali rivelano un divario di recall del 74% nella RAG finanziaria
FinDER valuta la RAG su 5.703 query reali di analisti di hedge fund rispetto ai moduli 10-K S&P 500; E5-Mistral raggiunge solo il 25,95% di recall contestuale, e le query ricche di abbreviazioni costano 8,2 punti di precisione — prova che la normalizzazione delle query, non migliori embedding, è il primo intervento per le pipeline AI finanziarie.
Persi nel Mezzo: Bias Posizionale negli LLM e il Suo Impatto sull'AI Finanziaria
L'articolo di Liu et al. (TACL 2024) mostra che gli LLM ottengono fino a 20 punti in meno sulle informazioni sepolte nel mezzo di contesti lunghi — un degrado a forma di U che colpisce ogni modello testato, incluso Claude-1.3-100K — con implicazioni concrete su come i pipeline RAG dovrebbero ordinare i passaggi recuperati nelle applicazioni finanziarie e contabili.
Benchmark AD-LLM: GPT-4o Raggiunge AUROC 0,93+ Zero-Shot per il Rilevamento di Anomalie nel Testo
AD-LLM valuta GPT-4o e Llama 3.1 8B in tre ruoli di rilevamento anomalie — rilevatore zero-shot, amplificatore di dati e selezionatore di modelli — su cinque dataset NLP; GPT-4o raggiunge AUROC 0,93–0,99 zero-shot, ma la selezione del modello basata su LLM rimane inaffidabile, con implicazioni dirette per l'audit finanziario basato su IA.
CausalTAD: Ordinamento Causale delle Colonne per il Rilevamento di Anomalie Tabulari con LLM
CausalTAD migliora il rilevamento di anomalie tabulari basato su LLM riordinando le colonne delle tabelle per rispettare le dipendenze causali prima della serializzazione, aumentando l'AUC-ROC medio da 0,803 a 0,834 rispetto ad AnoLLM su benchmark a tipi misti — con implicazioni dirette per il rilevamento di anomalie in dati strutturati di registri contabili.