Salta al contenuto principale

#reconciliation

Reconciliation

Automated ledger reconciliation using language model agents

FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario

FinRAGBench-V (EMNLP 2025) è il primo benchmark su larga scala per RAG multimodale con citazioni visive in finanza, coprendo oltre 112.000 pagine di documenti e 1.394 coppie QA annotate da umani. I modelli migliori raggiungono solo il 20–61% di richiamo delle citazioni a livello di blocco, e il recupero multimodale supera quello solo testuale di quasi 50 punti percentuali.

I CFO con Agenti LLM Possono Davvero Funzionare? La Simulazione di 132 Mesi di EnterpriseArena Rivela un Ampio Divario

EnterpriseArena esegue 11 LLM attraverso una simulazione CFO di 132 mesi, monitorando la sopravvivenza, la valutazione terminale e i tassi di chiusura contabile. Solo Qwen3.5-9B sopravvive nell'80% delle esecuzioni; GPT-5.4 e DeepSeek-V3.1 arrivano allo 0%. Gli esperti umani ottengono una sopravvivenza del 100% con un valore terminale 5 volte superiore. Il collo di bottiglia critico: gli LLM saltano la riconciliazione contabile nell'80% dei casi, agendo su uno stato finanziario obsoleto.

Fin-RATE: Come gli LLM Falliscono nell'Analisi Finanziaria Inter-Periodo e Cross-Entità

Fin-RATE valuta 17 LLM su 7.500 coppie Q&A curate da esperti provenienti da 2.472 documenti SEC, rivelando un crollo di accuratezza del 18,60% nel monitoraggio longitudinale e un calo di 54 punti per il modello finanziario specializzato Fin-R1 in compiti cross-entità, con il pipeline di recupero, non il modello di base, come collo di bottiglia vincolante.

AutoGen: Framework di Conversazione Multi-Agente per l'AI Finanziaria

AutoGen (Wu et al., 2023) introduce un framework di conversazione multi-agente in cui agenti basati su LLM si scambiano messaggi per completare attività; una configurazione a due agenti porta l'accuratezza sul benchmark MATH dal 55% al 69%, e un agente SafeGuard dedicato migliora il rilevamento di codice non sicuro fino a 35 punti F1 — risultati direttamente applicabili alla creazione di pipeline di automazione Beancount sicure e modulari.

ReAct: Sinergizzare Ragionamento e Azione nei Modelli Linguistici

ReAct (Yao et al., ICLR 2023) alterna ragionamento a catena di pensiero e azioni tramite strumenti in un'unica traiettoria, superando il puro CoT nella verifica dei fatti e l'apprendimento per imitazione in compiti incarnati di 34 punti percentuali. Questa analisi esamina le modalità di fallimento dell'articolo — distrazione indotta dalla ricerca ed errori cumulativi — e cosa significano per agenti autonomi che scrivono su libri mastri Beancount.