Salta al contenuto principale

#analytics

Analytics

Data analytics techniques and metrics for financial AI systems

Fin-RATE: Come gli LLM Falliscono nell'Analisi Finanziaria Inter-Periodo e Cross-Entità

Fin-RATE valuta 17 LLM su 7.500 coppie Q&A curate da esperti provenienti da 2.472 documenti SEC, rivelando un crollo di accuratezza del 18,60% nel monitoraggio longitudinale e un calo di 54 punti per il modello finanziario specializzato Fin-R1 in compiti cross-entità, con il pipeline di recupero, non il modello di base, come collo di bottiglia vincolante.

Persi nel Mezzo: Bias Posizionale negli LLM e il Suo Impatto sull'AI Finanziaria

L'articolo di Liu et al. (TACL 2024) mostra che gli LLM ottengono fino a 20 punti in meno sulle informazioni sepolte nel mezzo di contesti lunghi — un degrado a forma di U che colpisce ogni modello testato, incluso Claude-1.3-100K — con implicazioni concrete su come i pipeline RAG dovrebbero ordinare i passaggi recuperati nelle applicazioni finanziarie e contabili.

Benchmark AD-LLM: GPT-4o Raggiunge AUROC 0,93+ Zero-Shot per il Rilevamento di Anomalie nel Testo

AD-LLM valuta GPT-4o e Llama 3.1 8B in tre ruoli di rilevamento anomalie — rilevatore zero-shot, amplificatore di dati e selezionatore di modelli — su cinque dataset NLP; GPT-4o raggiunge AUROC 0,93–0,99 zero-shot, ma la selezione del modello basata su LLM rimane inaffidabile, con implicazioni dirette per l'audit finanziario basato su IA.

FinanceBench: Perché il RAG basato su Vector-Store Fallisce sui Documenti Finanziari Reali

FinanceBench valuta 16 configurazioni AI su 10.231 domande tratte da documenti SEC reali; il RAG basato su un archivio vettoriale condiviso risponde correttamente solo nel 19% dei casi, e persino GPT-4-Turbo con il passaggio oracle raggiunge solo l'85% di precisione, dimostrando che il ragionamento numerico, e non il recupero, è il vincolo principale per l'AI finanziaria aziendale.

Self-consistenza: il campionamento a voto di maggioranza migliora l'accuratezza del chain-of-thought

La self-consistency sostituisce la decodifica greedy del chain-of-thought con un voto di maggioranza su N percorsi di ragionamento campionati — aumentando l'accuratezza di GPT-3 su GSM8K di 17,9 punti percentuali senza addestramento aggiuntivo — e si applica direttamente ai calcoli finanziari multi-step in cui una singola decodifica del modello è inaffidabile.