Salta al contenuto principale

#financial-reporting

Financial Reporting

Generating and auditing financial reports with language models

FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario
·mike

FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario

FinRAGBench-V (EMNLP 2025) è il primo benchmark su larga scala per RAG multimodale con citazioni visive in finanza, coprendo oltre 112.000 pagine di documenti e 1.394 coppie QA annotate da umani. I modelli migliori raggiungono solo il 20–61% di richiamo delle citazioni a livello di blocco, e il recupero multimodale supera quello solo testuale di quasi 50 punti percentuali.

ai
llm
machine-learning
Fin-RATE: Come gli LLM Falliscono nell'Analisi Finanziaria Inter-Periodo e Cross-Entità
·mike

Fin-RATE: Come gli LLM Falliscono nell'Analisi Finanziaria Inter-Periodo e Cross-Entità

Fin-RATE valuta 17 LLM su 7.500 coppie Q&A curate da esperti provenienti da 2.472 documenti SEC, rivelando un crollo di accuratezza del 18,60% nel monitoraggio longitudinale e un calo di 54 punti per il modello finanziario specializzato Fin-R1 in compiti cross-entità, con il pipeline di recupero, non il modello di base, come collo di bottiglia vincolante.

llm
ai
machine-learning
FinDER: Query di analisti reali rivelano un divario di recall del 74% nella RAG finanziaria
·mike

FinDER: Query di analisti reali rivelano un divario di recall del 74% nella RAG finanziaria

FinDER valuta la RAG su 5.703 query reali di analisti di hedge fund rispetto ai moduli 10-K S&P 500; E5-Mistral raggiunge solo il 25,95% di recall contestuale, e le query ricche di abbreviazioni costano 8,2 punti di precisione — prova che la normalizzazione delle query, non migliori embedding, è il primo intervento per le pipeline AI finanziarie.

ai
llm
machine-learning
DocFinQA: Ragionamento Finanziario su Contesto Lungo Basato su Documenti SEC Completi
·mike

DocFinQA: Ragionamento Finanziario su Contesto Lungo Basato su Documenti SEC Completi

DocFinQA sostituisce i passaggi curati di 700 parole di FinQA con interi documenti SEC di 123.000 parole, esponendo un aumento di contesto di 175 volte che dimezza quasi l'accuratezza di GPT-4 su documenti lunghi. I pipeline di recupero falliscono nell'estrarre il frammento corretto nel 45% dei casi a HR@3 — e i modelli a contesto lungo non rappresentano un sostituto.

ai
llm
machine-learning
FinAuditing: i LLM ottengono meno del 14% su compiti reali di revisione XBRL della SEC
·mike

FinAuditing: i LLM ottengono meno del 14% su compiti reali di revisione XBRL della SEC

FinAuditing testa 13 LLM in modalità zero-shot su 1.102 istanze reali di depositi XBRL della SEC; i punteggi migliori sono 13,86% sulla verifica matematica finanziaria e 12,42% sul recupero di concetti—risultati che delimitano direttamente ciò che gli strumenti di contabilità AI possono essere autorizzati ad automatizzare senza strumentazione esterna.

llm
ai
financial-reporting
TAT-LLM: LLaMA 2 ottimizzato per il ragionamento discreto su tabelle e testo finanziario
·mike

TAT-LLM: LLaMA 2 ottimizzato per il ragionamento discreto su tabelle e testo finanziario

TAT-LLM ottimizza LLaMA 2 7B con LoRA su benchmark di QA ibrida tabella-testo finanziario, raggiungendo 64,60% EM su FinQA — superando il 63,91% di GPT-4 — attraverso la scomposizione del ragionamento in passi deterministici di Estrazione, Ragionamento ed Esecuzione che eliminano errori di calcolo.

llm
ai
machine-learning
MultiHiertt: Benchmarking del Ragionamento Numerico su Tabelle Finanziarie Multi-Gerarchiche
·mike

MultiHiertt: Benchmarking del Ragionamento Numerico su Tabelle Finanziarie Multi-Gerarchiche

MultiHiertt (ACL 2022) introduce 10.440 coppie QA da report finanziari reali con una media di 3,89 tabelle gerarchiche ciascuno; i modelli all'avanguardia ottengono un F1 del 38% contro l'87% degli umani, con una penalità di 15 punti per le domande cross-tabella, quantificando il divario di recupero che l'AI finanziaria deve colmare.

ai
machine-learning
llm
ConvFinQA: Domande e Risposte Finanziarie Multi-Turn e il Divario di 21 Punti tra Modelli ed Esperti Umani
·mike

ConvFinQA: Domande e Risposte Finanziarie Multi-Turn e il Divario di 21 Punti tra Modelli ed Esperti Umani

ConvFinQA (EMNLP 2022) estende FinQA al dialogo multi-turn sui report sugli utili delle aziende S&P 500, scoprendo che il miglior modello ottimizzato raggiunge un'accuratezza di esecuzione del 68,9% contro l'89,4% degli esperti umani – e scende al 52,4% nelle conversazioni ibride multi-aspetto dove i modelli devono trasportare il contesto numerico tra diversi argomenti finanziari.

ai
llm
machine-learning
TAT-QA: Benchmark ibrido basato su tabella e testo per il ragionamento su relazioni finanziarie annuali
·mike

TAT-QA: Benchmark ibrido basato su tabella e testo per il ragionamento su relazioni finanziarie annuali

TAT-QA è un benchmark con 16.552 domande su contesti ibridi di tabelle e testo tratti da relazioni finanziarie, che ha dimostrato che l’ancoraggio dell’evidenza — non l’aritmetica — è il collo di bottiglia principale nell’IA finanziaria; entro il 2024, LLM 7B ottimizzati hanno raggiunto l’83% F1, colmando gran parte del divario rispetto al tetto umano del 91%.

ai
machine-learning
llm
FinQA: Il Benchmark che Misura il Ragionamento Numerico dell'IA sui Report Finanziari
·mike

FinQA: Il Benchmark che Misura il Ragionamento Numerico dell'IA sui Report Finanziari

FinQA (EMNLP 2021) ha costruito 8.281 coppie QA dai report sugli utili delle aziende S&P 500, richiedendo programmi aritmetici multi-step. I modelli neurali hanno ottenuto un punteggio del 61% al rilascio, contro il 91% degli esperti umani; l'accuratezza crolla al 22% su programmi con tre o più passaggi. Le modalità di fallimento — costanti di dominio, grounding cross-modale, lunghezza della catena — corrispondono direttamente alle sfide che gli agenti Beancount affrontano oggi.

ai
machine-learning
llm
FinanceBench: Perché il RAG basato su Vector-Store Fallisce sui Documenti Finanziari Reali
·mike

FinanceBench: Perché il RAG basato su Vector-Store Fallisce sui Documenti Finanziari Reali

FinanceBench valuta 16 configurazioni AI su 10.231 domande tratte da documenti SEC reali; il RAG basato su un archivio vettoriale condiviso risponde correttamente solo nel 19% dei casi, e persino GPT-4-Turbo con il passaggio oracle raggiunge solo l'85% di precisione, dimostrando che il ragionamento numerico, e non il recupero, è il vincolo principale per l'AI finanziaria aziendale.

ai
llm
machine-learning
PHANTOM (NeurIPS 2025): Misurazione del Rilevamento di Allucinazioni negli LLM in Documenti Finanziari
·mike

PHANTOM (NeurIPS 2025): Misurazione del Rilevamento di Allucinazioni negli LLM in Documenti Finanziari

PHANTOM (NeurIPS 2025) è il primo benchmark a misurare il rilevamento di allucinazioni negli LLM su reali depositi SEC per contesti di lunghezza fino a 30.000 token. Qwen3-30B-A3B-Thinking è leader con F1=0,882; i modelli da 7B ottengono punteggi vicini a una scelta casuale — con implicazioni dirette per agenti contabili autonomi.

llm
ai
machine-learning