Salta al contenuto principale

#analytics

Analytics

Data analytics techniques and metrics for financial AI systems

ConvFinQA: Domande e Risposte Finanziarie Multi-Turn e il Divario di 21 Punti tra Modelli ed Esperti Umani

ConvFinQA (EMNLP 2022) estende FinQA al dialogo multi-turn sui report sugli utili delle aziende S&P 500, scoprendo che il miglior modello ottimizzato raggiunge un'accuratezza di esecuzione del 68,9% contro l'89,4% degli esperti umani – e scende al 52,4% nelle conversazioni ibride multi-aspetto dove i modelli devono trasportare il contesto numerico tra diversi argomenti finanziari.

FinanceBench: Perché il RAG basato su Vector-Store Fallisce sui Documenti Finanziari Reali

FinanceBench valuta 16 configurazioni AI su 10.231 domande tratte da documenti SEC reali; il RAG basato su un archivio vettoriale condiviso risponde correttamente solo nel 19% dei casi, e persino GPT-4-Turbo con il passaggio oracle raggiunge solo l'85% di precisione, dimostrando che il ragionamento numerico, e non il recupero, è il vincolo principale per l'AI finanziaria aziendale.