Salta al contenuto principale

#reconciliation

Reconciliation

Automated ledger reconciliation using language model agents

FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario
·mike

FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario

FinRAGBench-V (EMNLP 2025) è il primo benchmark su larga scala per RAG multimodale con citazioni visive in finanza, coprendo oltre 112.000 pagine di documenti e 1.394 coppie QA annotate da umani. I modelli migliori raggiungono solo il 20–61% di richiamo delle citazioni a livello di blocco, e il recupero multimodale supera quello solo testuale di quasi 50 punti percentuali.

ai
llm
machine-learning
I CFO con Agenti LLM Possono Davvero Funzionare? La Simulazione di 132 Mesi di EnterpriseArena Rivela un Ampio Divario
·mike

I CFO con Agenti LLM Possono Davvero Funzionare? La Simulazione di 132 Mesi di EnterpriseArena Rivela un Ampio Divario

EnterpriseArena esegue 11 LLM attraverso una simulazione CFO di 132 mesi, monitorando la sopravvivenza, la valutazione terminale e i tassi di chiusura contabile. Solo Qwen3.5-9B sopravvive nell'80% delle esecuzioni; GPT-5.4 e DeepSeek-V3.1 arrivano allo 0%. Gli esperti umani ottengono una sopravvivenza del 100% con un valore terminale 5 volte superiore. Il collo di bottiglia critico: gli LLM saltano la riconciliazione contabile nell'80% dei casi, agendo su uno stato finanziario obsoleto.

ai
llm
automation
FinMCP-Bench: Valutazione di Agenti LLM per l'Uso di Strumenti Finanziari Reali tramite MCP
·mike

FinMCP-Bench: Valutazione di Agenti LLM per l'Uso di Strumenti Finanziari Reali tramite MCP

FinMCP-Bench valuta sei modelli LLM su 613 compiti reali di utilizzo di strumenti finanziari, supportati da 65 server MCP. Il modello migliore ottiene un 3,08% di corrispondenza esatta nei compiti multi-turn, rivelando un crollo prestazionale di 20 volte passando da compiti a singolo strumento a scenari multi-turn.

ai
llm
automation
Trovato nel Mezzo: La Calibrazione del Bias di Attenzione Posizionale Migliora il RAG a Contesto Lungo
·mike

Trovato nel Mezzo: La Calibrazione del Bias di Attenzione Posizionale Migliora il RAG a Contesto Lungo

Una calibrazione al momento dell'inferenza, senza bisogno di training, sottrae il bias posizionale dai pesi di attenzione degli LLM, recuperando fino a 15 punti percentuali di accuratezza RAG quando i documenti recuperati sono sepolti nel mezzo del contesto — e cosa significa per pipeline di agenti specifiche per la finanza.

ai
llm
machine-learning
Fin-RATE: Come gli LLM Falliscono nell'Analisi Finanziaria Inter-Periodo e Cross-Entità
·mike

Fin-RATE: Come gli LLM Falliscono nell'Analisi Finanziaria Inter-Periodo e Cross-Entità

Fin-RATE valuta 17 LLM su 7.500 coppie Q&A curate da esperti provenienti da 2.472 documenti SEC, rivelando un crollo di accuratezza del 18,60% nel monitoraggio longitudinale e un calo di 54 punti per il modello finanziario specializzato Fin-R1 in compiti cross-entità, con il pipeline di recupero, non il modello di base, come collo di bottiglia vincolante.

llm
ai
machine-learning
Voyager: Le Librerie di Competenze come Fondamento per l'Apprendimento Continuo degli Agenti IA
·mike

Voyager: Le Librerie di Competenze come Fondamento per l'Apprendimento Continuo degli Agenti IA

Voyager, un agente Minecraft basato su GPT-4 di NVIDIA e Caltech, dimostra che una libreria persistente di competenze in codice consente un vero apprendimento continuo senza fine-tuning — scoprendo 3,3× più oggetti rispetto allo stato dell'arte precedente. Il pattern si applica direttamente all'automazione di ledger Beancount a lungo orizzonte, sebbene la correttezza finanziaria richieda livelli di staging che i sandbox di gioco non richiedono mai.

ai
llm
machine-learning
AutoGen: Framework di Conversazione Multi-Agente per l'AI Finanziaria
·mike

AutoGen: Framework di Conversazione Multi-Agente per l'AI Finanziaria

AutoGen (Wu et al., 2023) introduce un framework di conversazione multi-agente in cui agenti basati su LLM si scambiano messaggi per completare attività; una configurazione a due agenti porta l'accuratezza sul benchmark MATH dal 55% al 69%, e un agente SafeGuard dedicato migliora il rilevamento di codice non sicuro fino a 35 punti F1 — risultati direttamente applicabili alla creazione di pipeline di automazione Beancount sicure e modulari.

ai
llm
automation
CodeAct: Perché il Codice Python Eseguibile Rende gli Agenti LLM il 20% più Precisa
·mike

CodeAct: Perché il Codice Python Eseguibile Rende gli Agenti LLM il 20% più Precisa

CodeAct (ICML 2024) sostituisce le chiamate a strumenti in JSON con codice Python eseguibile, migliorando i tassi di successo degli agenti GPT-4 di circa 20 punti percentuali in attività multi-strumento e riducendo i turni di interazione del 30% — con implicazioni dirette per la creazione di agenti affidabili per la riconcilazione con Beancount.

ai
llm
automation
CRITIC: Perché l'Autocorrezione degli LLM Richiede Feedback Esterno dagli Strumenti
·mike

CRITIC: Perché l'Autocorrezione degli LLM Richiede Feedback Esterno dagli Strumenti

CRITIC (ICLR 2024) ottiene un guadagno di 7,7 F1 nel QA su dominio aperto e una riduzione della tossicità del 79,2% ancorando la revisione dell'LLM ai segnali di strumenti esterni — un ciclo di verifica-e-correzione che si mappa direttamente sulla sicurezza di scrittura per agenti finanziari Beancount.

ai
llm
machine-learning
ReAct: Sinergizzare Ragionamento e Azione nei Modelli Linguistici
·mike

ReAct: Sinergizzare Ragionamento e Azione nei Modelli Linguistici

ReAct (Yao et al., ICLR 2023) alterna ragionamento a catena di pensiero e azioni tramite strumenti in un'unica traiettoria, superando il puro CoT nella verifica dei fatti e l'apprendimento per imitazione in compiti incarnati di 34 punti percentuali. Questa analisi esamina le modalità di fallimento dell'articolo — distrazione indotta dalla ricerca ed errori cumulativi — e cosa significano per agenti autonomi che scrivono su libri mastri Beancount.

ai
llm
machine-learning