Salta al contenuto principale

#finance

Finance

Financial research, analysis, and domain knowledge for accounting AI

FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario
·mike

FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario

FinRAGBench-V (EMNLP 2025) è il primo benchmark su larga scala per RAG multimodale con citazioni visive in finanza, coprendo oltre 112.000 pagine di documenti e 1.394 coppie QA annotate da umani. I modelli migliori raggiungono solo il 20–61% di richiamo delle citazioni a livello di blocco, e il recupero multimodale supera quello solo testuale di quasi 50 punti percentuali.

ai
llm
machine-learning
Confidenza e Calibrazione degli LLM: Una Rassegna su Quanto Mostra Realmente la Ricerca
·mike

Confidenza e Calibrazione degli LLM: Una Rassegna su Quanto Mostra Realmente la Ricerca

Una rassegna sistematica dei metodi di stima della confidenza e calibrazione degli LLM—approcci white-box basati su logit, SelfCheckGPT basato sulla consistenza ed entropia semantica—rivela che i punteggi di confidenza verbalizzata di GPT-4 raggiungono solo circa il 62,7% di AUROC, appena sopra il caso, con implicazioni dirette per l'implementazione di agenti sensibili all'incertezza nella finanza e nella contabilità.

llm
ai
machine-learning
FinTrace: Valutazione a Livello di Traiettoria della Chiamata a Strumenti LLM per Compiti Finanziari
·mike

FinTrace: Valutazione a Livello di Traiettoria della Chiamata a Strumenti LLM per Compiti Finanziari

FinTrace valuta 13 LLM su 800 traiettorie di compiti finanziari annotate da esperti, attraverso 9 metriche, scoprendo che i modelli all'avanguardia ottengono una forte selezione degli strumenti (F1 ~0.9) ma solo 3,23/5 nell'utilizzo delle informazioni — il passaggio in cui gli agenti ragionano su ciò che gli strumenti restituiscono.

llm
ai
finance
OmniEval: Benchmark di Valutazione RAG Omnidirezionale per il Dominio Finanziario
·mike

OmniEval: Benchmark di Valutazione RAG Omnidirezionale per il Dominio Finanziario

OmniEval (EMNLP 2025) valuta i sistemi RAG su 5 tipi di task × 16 argomenti finanziari utilizzando 11.4k casi di test generati automaticamente. I sistemi migliori raggiungono solo il 36% di accuratezza numerica — prova concreta che le pipeline RAG necessitano di livelli di validazione prima di scrivere su registri finanziari strutturati.

ai
machine-learning
llm
FinDER: Query di analisti reali rivelano un divario di recall del 74% nella RAG finanziaria
·mike

FinDER: Query di analisti reali rivelano un divario di recall del 74% nella RAG finanziaria

FinDER valuta la RAG su 5.703 query reali di analisti di hedge fund rispetto ai moduli 10-K S&P 500; E5-Mistral raggiunge solo il 25,95% di recall contestuale, e le query ricche di abbreviazioni costano 8,2 punti di precisione — prova che la normalizzazione delle query, non migliori embedding, è il primo intervento per le pipeline AI finanziarie.

ai
llm
machine-learning
Persi nel Mezzo: Bias Posizionale negli LLM e il Suo Impatto sull'AI Finanziaria
·mike

Persi nel Mezzo: Bias Posizionale negli LLM e il Suo Impatto sull'AI Finanziaria

L'articolo di Liu et al. (TACL 2024) mostra che gli LLM ottengono fino a 20 punti in meno sulle informazioni sepolte nel mezzo di contesti lunghi — un degrado a forma di U che colpisce ogni modello testato, incluso Claude-1.3-100K — con implicazioni concrete su come i pipeline RAG dovrebbero ordinare i passaggi recuperati nelle applicazioni finanziarie e contabili.

llm
ai
machine-learning
AnoLLM: Fine-Tuning di LLM per il Rilevamento di Anomalie Tabulari in Dati Finanziari
·mike

AnoLLM: Fine-Tuning di LLM per il Rilevamento di Anomalie Tabulari in Dati Finanziari

AnoLLM (ICLR 2025) riformula il rilevamento di anomalie tabulari come stima di densità LLM — fine-tuning su righe normali e valutazione tramite log-verosimiglianza negativa. Supera i metodi classici su dataset di frodi a tipi misti, ma non offre alcun vantaggio su dati puramente numerici, con implicazioni reali per il rilevamento di anomalie nelle registrazioni del ledger Beancount.

ai
llm
machine-learning
DocFinQA: Ragionamento Finanziario su Contesto Lungo Basato su Documenti SEC Completi
·mike

DocFinQA: Ragionamento Finanziario su Contesto Lungo Basato su Documenti SEC Completi

DocFinQA sostituisce i passaggi curati di 700 parole di FinQA con interi documenti SEC di 123.000 parole, esponendo un aumento di contesto di 175 volte che dimezza quasi l'accuratezza di GPT-4 su documenti lunghi. I pipeline di recupero falliscono nell'estrarre il frammento corretto nel 45% dei casi a HR@3 — e i modelli a contesto lungo non rappresentano un sostituto.

ai
llm
machine-learning
TheAgentCompany: Benchmark degli Agenti LLM su Compiti Aziendali Reali
·mike

TheAgentCompany: Benchmark degli Agenti LLM su Compiti Aziendali Reali

TheAgentCompany testa 175 compiti lavorativi reali attraverso una intranet simulata con GitLab, OwnCloud e RocketChat. Il miglior modello (Gemini-2.5-Pro) completa solo il 30% dei compiti a $4 ciascuno, rivelando che gli agenti autonomi sono ancora ben lontani dall'essere utilizzabili per i flussi di lavoro di contabilità e finanza.

ai
llm
automation
InvestorBench: Benchmarking di Agenti LLM nelle Decisioni di Trading Finanziario
·mike

InvestorBench: Benchmarking di Agenti LLM nelle Decisioni di Trading Finanziario

InvestorBench (ACL 2025) testa 13 modelli LLM backbone su trading backtestato di azioni, criptovalute ed ETF utilizzando il rendimento cumulativo e l'indice di Sharpe — non l'accuratezza nel rispondere a domande. Qwen2.5-72B è in cima alla classifica delle azioni con un CR del 46,15%; i modelli ottimizzati per la finanza falliscono con le azioni. La dimensione del modello predice le performance in modo più affidabile dell'ottimizzazione per dominio.

llm
ai
finance
LLM ad Agente Singolo Superano i Sistemi Multi-Agente nel Ragionamento Multi-Salto a Parità di Budget di Token di Pensiero
·mike

LLM ad Agente Singolo Superano i Sistemi Multi-Agente nel Ragionamento Multi-Salto a Parità di Budget di Token di Pensiero

Una preprint di Stanford del 2026 equalizza i budget di token di pensiero in cinque architetture multi-agente e scopre che i LLM ad agente singolo eguagliano o superano i sistemi multi-agente nel ragionamento multi-salto — con fondamento teorico nella Disuguaglianza di Elaborazione dei Dati e implicazioni per la progettazione di agenti AI finanziari.

ai
llm
machine-learning
M3MAD-Bench: I dibattiti multi-agente sono davvero efficaci tra domini e modalità?
·mike

M3MAD-Bench: I dibattiti multi-agente sono davvero efficaci tra domini e modalità?

M3MAD-Bench mette sotto stress il Dibattito Multi-Agente su 9 modelli, 5 domini e impostazioni visione-linguaggio, scoprendo che il Delirio Collettivo causa il 65% dei fallimenti, il dibattito avversario riduce l'accuratezza fino al 12,8% e l'Auto-Consistenza generalmente eguaglia l'accuratezza del dibattito a un costo di token inferiore.

ai
llm
machine-learning
Mostrando 1–12 di 35 articoli
1 / 3Successivo