Salta al contenuto principale

#financial-statements

Financial Statements

Balance sheet, income statement, and cash-flow generation research

MultiHiertt: Benchmarking del Ragionamento Numerico su Tabelle Finanziarie Multi-Gerarchiche
·mike

MultiHiertt: Benchmarking del Ragionamento Numerico su Tabelle Finanziarie Multi-Gerarchiche

MultiHiertt (ACL 2022) introduce 10.440 coppie QA da report finanziari reali con una media di 3,89 tabelle gerarchiche ciascuno; i modelli all'avanguardia ottengono un F1 del 38% contro l'87% degli umani, con una penalità di 15 punti per le domande cross-tabella, quantificando il divario di recupero che l'AI finanziaria deve colmare.

ai
machine-learning
llm
FinanceBench: Perché il RAG basato su Vector-Store Fallisce sui Documenti Finanziari Reali
·mike

FinanceBench: Perché il RAG basato su Vector-Store Fallisce sui Documenti Finanziari Reali

FinanceBench valuta 16 configurazioni AI su 10.231 domande tratte da documenti SEC reali; il RAG basato su un archivio vettoriale condiviso risponde correttamente solo nel 19% dei casi, e persino GPT-4-Turbo con il passaggio oracle raggiunge solo l'85% di precisione, dimostrando che il ragionamento numerico, e non il recupero, è il vincolo principale per l'AI finanziaria aziendale.

ai
llm
machine-learning
Benchmark FinMaster: perché i modelli linguistici di grandi dimensioni ottengono il 96% in alfabetizzazione finanziaria ma il 3% nella generazione di rendiconti
·mike

Benchmark FinMaster: perché i modelli linguistici di grandi dimensioni ottengono il 96% in alfabetizzazione finanziaria ma il 3% nella generazione di rendiconti

FinMaster (arXiv:2505.13533) valuta o3-mini, Claude 3.7 Sonnet e DeepSeek-V3 in 183 attività finanziarie, rivelando che i modelli ottengono il 96% in alfabetizzazione finanziaria, ma crollano al 3% nella generazione di rendiconti, con attività di consulenza multi-step che perdono 21 punti di accuratezza a causa della propagazione degli errori.

llm
accounting
ai