#analytics
Analytics
Data analytics techniques and metrics for financial AI systems
Survey sull'Anomaly Detection con LLM (NAACL 2025): Tassonomia Solida, Copertura su Dati Tabulari Assente
Una lettura critica del survey di Xu e Ding per NAACL 2025 sull'anomaly e OOD detection basata su LLM: la tassonomia rilevazione-vs-generazione regge, ma l'assenza quasi totale di copertura sui dati tabulari costringe i professionisti dell'AI finanziaria a sintetizzare da soli le informazioni dai modelli di visione.
Fin-RATE: Come gli LLM Falliscono nell'Analisi Finanziaria Inter-Periodo e Cross-Entità
Fin-RATE valuta 17 LLM su 7.500 coppie Q&A curate da esperti provenienti da 2.472 documenti SEC, rivelando un crollo di accuratezza del 18,60% nel monitoraggio longitudinale e un calo di 54 punti per il modello finanziario specializzato Fin-R1 in compiti cross-entità, con il pipeline di recupero, non il modello di base, come collo di bottiglia vincolante.
Persi nel Mezzo: Bias Posizionale negli LLM e il Suo Impatto sull'AI Finanziaria
L'articolo di Liu et al. (TACL 2024) mostra che gli LLM ottengono fino a 20 punti in meno sulle informazioni sepolte nel mezzo di contesti lunghi — un degrado a forma di U che colpisce ogni modello testato, incluso Claude-1.3-100K — con implicazioni concrete su come i pipeline RAG dovrebbero ordinare i passaggi recuperati nelle applicazioni finanziarie e contabili.
Benchmark AD-LLM: GPT-4o Raggiunge AUROC 0,93+ Zero-Shot per il Rilevamento di Anomalie nel Testo
AD-LLM valuta GPT-4o e Llama 3.1 8B in tre ruoli di rilevamento anomalie — rilevatore zero-shot, amplificatore di dati e selezionatore di modelli — su cinque dataset NLP; GPT-4o raggiunge AUROC 0,93–0,99 zero-shot, ma la selezione del modello basata su LLM rimane inaffidabile, con implicazioni dirette per l'audit finanziario basato su IA.
τ-bench: Misurare l'affidabilità degli agenti AI in domini reali di utilizzo di strumenti
τ-bench mostra che i migliori LLM come Claude 3.5 Sonnet passano da un pass@1 di 0,692 a un pass@4 di 0,462 in attività di servizio clienti al dettaglio — un precipizio di coerenza con implicazioni dirette per qualsiasi agente di scrittura che opera su un registro Beancount.
ConvFinQA: Domande e Risposte Finanziarie Multi-Turn e il Divario di 21 Punti tra Modelli ed Esperti Umani
ConvFinQA (EMNLP 2022) estende FinQA al dialogo multi-turn sui report sugli utili delle aziende S&P 500, scoprendo che il miglior modello ottimizzato raggiunge un'accuratezza di esecuzione del 68,9% contro l'89,4% degli esperti umani – e scende al 52,4% nelle conversazioni ibride multi-aspetto dove i modelli devono trasportare il contesto numerico tra diversi argomenti finanziari.
FinanceBench: Perché il RAG basato su Vector-Store Fallisce sui Documenti Finanziari Reali
FinanceBench valuta 16 configurazioni AI su 10.231 domande tratte da documenti SEC reali; il RAG basato su un archivio vettoriale condiviso risponde correttamente solo nel 19% dei casi, e persino GPT-4-Turbo con il passaggio oracle raggiunge solo l'85% di precisione, dimostrando che il ragionamento numerico, e non il recupero, è il vincolo principale per l'AI finanziaria aziendale.
Auto-coerenza: il voto di maggioranza aumenta l'accuratezza della catena di pensiero
L'auto-coerenza sostituisce la decodifica 'golosa' della catena di pensiero con un voto di maggioranza su N percorsi di ragionamento campionati, migliorando l'accuratezza di GPT-3 su GSM8K di 17,9 punti percentuali senza addestramento aggiuntivo, e si applica direttamente a calcoli finanziari multi-step dove la singola decodifica del modello è inaffidabile.