Salta al contenuto principale

#finance

Finance

Financial research, analysis, and domain knowledge for accounting AI

FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario

FinRAGBench-V (EMNLP 2025) è il primo benchmark su larga scala per RAG multimodale con citazioni visive in finanza, coprendo oltre 112.000 pagine di documenti e 1.394 coppie QA annotate da umani. I modelli migliori raggiungono solo il 20–61% di richiamo delle citazioni a livello di blocco, e il recupero multimodale supera quello solo testuale di quasi 50 punti percentuali.

Confidenza e Calibrazione degli LLM: Una Rassegna su Quanto Mostra Realmente la Ricerca

Una rassegna sistematica dei metodi di stima della confidenza e calibrazione degli LLM—approcci white-box basati su logit, SelfCheckGPT basato sulla consistenza ed entropia semantica—rivela che i punteggi di confidenza verbalizzata di GPT-4 raggiungono solo circa il 62,7% di AUROC, appena sopra il caso, con implicazioni dirette per l'implementazione di agenti sensibili all'incertezza nella finanza e nella contabilità.

FinDER: Query di analisti reali rivelano un divario di recall del 74% nella RAG finanziaria

FinDER valuta la RAG su 5.703 query reali di analisti di hedge fund rispetto ai moduli 10-K S&P 500; E5-Mistral raggiunge solo il 25,95% di recall contestuale, e le query ricche di abbreviazioni costano 8,2 punti di precisione — prova che la normalizzazione delle query, non migliori embedding, è il primo intervento per le pipeline AI finanziarie.

Persi nel Mezzo: Bias Posizionale negli LLM e il Suo Impatto sull'AI Finanziaria

L'articolo di Liu et al. (TACL 2024) mostra che gli LLM ottengono fino a 20 punti in meno sulle informazioni sepolte nel mezzo di contesti lunghi — un degrado a forma di U che colpisce ogni modello testato, incluso Claude-1.3-100K — con implicazioni concrete su come i pipeline RAG dovrebbero ordinare i passaggi recuperati nelle applicazioni finanziarie e contabili.

AnoLLM: Fine-Tuning di LLM per il Rilevamento di Anomalie Tabulari in Dati Finanziari

AnoLLM (ICLR 2025) riformula il rilevamento di anomalie tabulari come stima di densità LLM — fine-tuning su righe normali e valutazione tramite log-verosimiglianza negativa. Supera i metodi classici su dataset di frodi a tipi misti, ma non offre alcun vantaggio su dati puramente numerici, con implicazioni reali per il rilevamento di anomalie nelle registrazioni del ledger Beancount.

DocFinQA: Ragionamento Finanziario su Contesto Lungo Basato su Documenti SEC Completi

DocFinQA sostituisce i passaggi curati di 700 parole di FinQA con interi documenti SEC di 123.000 parole, esponendo un aumento di contesto di 175 volte che dimezza quasi l'accuratezza di GPT-4 su documenti lunghi. I pipeline di recupero falliscono nell'estrarre il frammento corretto nel 45% dei casi a HR@3 — e i modelli a contesto lungo non rappresentano un sostituto.