Salta al contenuto principale

#llm

LLM

Large language model research with applications in financial tasks

FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario

FinRAGBench-V (EMNLP 2025) è il primo benchmark su larga scala per RAG multimodale con citazioni visive in finanza, coprendo oltre 112.000 pagine di documenti e 1.394 coppie QA annotate da umani. I modelli migliori raggiungono solo il 20–61% di richiamo delle citazioni a livello di blocco, e il recupero multimodale supera quello solo testuale di quasi 50 punti percentuali.

I CFO con Agenti LLM Possono Davvero Funzionare? La Simulazione di 132 Mesi di EnterpriseArena Rivela un Ampio Divario

EnterpriseArena esegue 11 LLM attraverso una simulazione CFO di 132 mesi, monitorando la sopravvivenza, la valutazione terminale e i tassi di chiusura contabile. Solo Qwen3.5-9B sopravvive nell'80% delle esecuzioni; GPT-5.4 e DeepSeek-V3.1 arrivano allo 0%. Gli esperti umani ottengono una sopravvivenza del 100% con un valore terminale 5 volte superiore. Il collo di bottiglia critico: gli LLM saltano la riconciliazione contabile nell'80% dei casi, agendo su uno stato finanziario obsoleto.

Confidenza e Calibrazione degli LLM: Una Rassegna su Quanto Mostra Realmente la Ricerca

Una rassegna sistematica dei metodi di stima della confidenza e calibrazione degli LLM—approcci white-box basati su logit, SelfCheckGPT basato sulla consistenza ed entropia semantica—rivela che i punteggi di confidenza verbalizzata di GPT-4 raggiungono solo circa il 62,7% di AUROC, appena sopra il caso, con implicazioni dirette per l'implementazione di agenti sensibili all'incertezza nella finanza e nella contabilità.

JSONSchemaBench: La complessità degli schemi reali mette in crisi le garanzie di output strutturato degli LLM

JSONSchemaBench testa 9.558 schemi JSON reali su sei framework di decodifica vincolata e scopre che la complessità degli schemi fa crollare la copertura dall'86% su schemi semplici al 3% su quelli complessi, con XGrammar che emette silenziosamente 38 output non conformi e nessun framework che copre tutte le 45 categorie di funzionalità JSON Schema.

FinToolBench: Valutare gli Agenti LLM sull'Uso Reale di Strumenti Finanziari

FinToolBench abbina 760 API finanziarie in tempo reale a 295 query eseguibili per valutare gli agenti LLM su compiti finanziari reali — rivelando che il tasso di invocazione conservativo del 22,7% di GPT-4o produce una qualità delle risposte superiore (CSS 0,670) rispetto al TIR aggressivo dell'87,1% di Qwen3-8B, mentre la mancata corrispondenza dell'intento supera il 50% in ogni modello testato.