Salta al contenuto principale

#automation

Automation

Automation techniques and tools for financial data processing workflows

I CFO con Agenti LLM Possono Davvero Funzionare? La Simulazione di 132 Mesi di EnterpriseArena Rivela un Ampio Divario
·mike

I CFO con Agenti LLM Possono Davvero Funzionare? La Simulazione di 132 Mesi di EnterpriseArena Rivela un Ampio Divario

EnterpriseArena esegue 11 LLM attraverso una simulazione CFO di 132 mesi, monitorando la sopravvivenza, la valutazione terminale e i tassi di chiusura contabile. Solo Qwen3.5-9B sopravvive nell'80% delle esecuzioni; GPT-5.4 e DeepSeek-V3.1 arrivano allo 0%. Gli esperti umani ottengono una sopravvivenza del 100% con un valore terminale 5 volte superiore. Il collo di bottiglia critico: gli LLM saltano la riconciliazione contabile nell'80% dei casi, agendo su uno stato finanziario obsoleto.

ai
llm
automation
WildToolBench: Perché nessun LLM supera il 15% di accuratezza di sessione nell'uso di strumenti reali
·mike

WildToolBench: Perché nessun LLM supera il 15% di accuratezza di sessione nell'uso di strumenti reali

WildToolBench (ICLR 2026) valuta 57 LLM su 1.024 attività derivate dal comportamento reale degli utenti — nessun modello supera il 15% di accuratezza di sessione, con orchestrazione compositiva, intento nascosto e transizioni di istruzione come le tre modalità di fallimento più marcate.

ai
llm
automation
JSONSchemaBench: La complessità degli schemi reali mette in crisi le garanzie di output strutturato degli LLM
·mike

JSONSchemaBench: La complessità degli schemi reali mette in crisi le garanzie di output strutturato degli LLM

JSONSchemaBench testa 9.558 schemi JSON reali su sei framework di decodifica vincolata e scopre che la complessità degli schemi fa crollare la copertura dall'86% su schemi semplici al 3% su quelli complessi, con XGrammar che emette silenziosamente 38 output non conformi e nessun framework che copre tutte le 45 categorie di funzionalità JSON Schema.

llm
ai
machine-learning
FinMCP-Bench: Valutazione di Agenti LLM per l'Uso di Strumenti Finanziari Reali tramite MCP
·mike

FinMCP-Bench: Valutazione di Agenti LLM per l'Uso di Strumenti Finanziari Reali tramite MCP

FinMCP-Bench valuta sei modelli LLM su 613 compiti reali di utilizzo di strumenti finanziari, supportati da 65 server MCP. Il modello migliore ottiene un 3,08% di corrispondenza esatta nei compiti multi-turn, rivelando un crollo prestazionale di 20 volte passando da compiti a singolo strumento a scenari multi-turn.

ai
llm
automation
FinTrace: Valutazione a Livello di Traiettoria della Chiamata a Strumenti LLM per Compiti Finanziari
·mike

FinTrace: Valutazione a Livello di Traiettoria della Chiamata a Strumenti LLM per Compiti Finanziari

FinTrace valuta 13 LLM su 800 traiettorie di compiti finanziari annotate da esperti, attraverso 9 metriche, scoprendo che i modelli all'avanguardia ottengono una forte selezione degli strumenti (F1 ~0.9) ma solo 3,23/5 nell'utilizzo delle informazioni — il passaggio in cui gli agenti ragionano su ciò che gli strumenti restituiscono.

llm
ai
finance
FinToolBench: Valutazione degli agenti LLM sull'uso di strumenti finanziari in scenari reali
·mike

FinToolBench: Valutazione degli agenti LLM sull'uso di strumenti finanziari in scenari reali

FinToolBench combina 760 strumenti finanziari API attivi con 295 query eseguibili per testare gli agenti LLM su compiti finanziari reali — rivelando che la frequenza di chiamata conservativa di GPT-4o del 22,7% garantisce una qualità delle risposte superiore (CSS 0,670) rispetto al TIR aggressivo di Qwen3-8B all'87,1%, mentre il disallineamento delle intenzioni supera il 50% in tutti i modelli testati.

ai
llm
automation
OmniEval: Benchmark di Valutazione RAG Omnidirezionale per il Dominio Finanziario
·mike

OmniEval: Benchmark di Valutazione RAG Omnidirezionale per il Dominio Finanziario

OmniEval (EMNLP 2025) valuta i sistemi RAG su 5 tipi di task × 16 argomenti finanziari utilizzando 11.4k casi di test generati automaticamente. I sistemi migliori raggiungono solo il 36% di accuratezza numerica — prova concreta che le pipeline RAG necessitano di livelli di validazione prima di scrivere su registri finanziari strutturati.

ai
machine-learning
llm
Trovato nel Mezzo: La Calibrazione del Bias di Attenzione Posizionale Migliora il RAG a Contesto Lungo
·mike

Trovato nel Mezzo: La Calibrazione del Bias di Attenzione Posizionale Migliora il RAG a Contesto Lungo

Una calibrazione al momento dell'inferenza, senza bisogno di training, sottrae il bias posizionale dai pesi di attenzione degli LLM, recuperando fino a 15 punti percentuali di accuratezza RAG quando i documenti recuperati sono sepolti nel mezzo del contesto — e cosa significa per pipeline di agenti specifiche per la finanza.

ai
llm
machine-learning
Rinvio Consapevole dell'Incertezza per Agenti LLM: Quando Scalare da Modelli Piccoli a Grandi
·mike

Rinvio Consapevole dell'Incertezza per Agenti LLM: Quando Scalare da Modelli Piccoli a Grandi

ReDAct esegue un modello piccolo per impostazione predefinita e scala a un modello costoso solo quando la perplessità a livello di token segnala incertezza, ottenendo un risparmio del 64% rispetto al solo GPT-5.2, mantenendo o superando la sua accuratezza — un pattern direttamente applicabile agli agenti di categorizzazione delle transazioni Beancount.

ai
llm
automation
OpenHands: Piattaforma Aperta per Agenti Software AI e le sue Implicazioni per l'Automazione Finanziaria
·mike

OpenHands: Piattaforma Aperta per Agenti Software AI e le sue Implicazioni per l'Automazione Finanziaria

OpenHands è una piattaforma per agenti con licenza MIT, in ambiente sandbox Docker, dove CodeAct raggiunge il 26% su SWE-Bench Lite — un benchmark che fissa con sobrietà ciò che gli agenti AI possono fare realmente oggi, e spiega perché le prime implementazioni produttive in finanza dovrebbero essere strettamente circoscritte piuttosto che autonome.

ai
open-source
automation
TableMaster: Ragionamento Adattivo per la Comprensione di Tabelle con LLM
·mike

TableMaster: Ragionamento Adattivo per la Comprensione di Tabelle con LLM

TableMaster è una pipeline basata esclusivamente su prompting che raggiunge il 78,13% su WikiTQ con GPT-4o-mini—13 punti sopra Chain-of-Table—combinando estrazione del focus tabellare, verbalizzazione semantica e commutazione adattiva tra ragionamento testuale e simbolico. Ecco cosa significa l'architettura per gli agenti AI che lavorano su registri finanziari come Beancount.

ai
llm
machine-learning
Rilevamento di Anomalie Zero-Shot con LLM: Come GPT-4 si Comporta sui Dati Tabulari
·mike

Rilevamento di Anomalie Zero-Shot con LLM: Come GPT-4 si Comporta sui Dati Tabulari

GPT-4 raggiunge un AUROC medio di 74.1 sul benchmark ODDS senza fine-tuning — quasi eguagliando la linea di base classica ECOD a 75.5 — ma fallisce su anomalie multidimensionali e dataset ad alta varianza; una revisione critica del rilevamento di anomalie LLM zero-shot e delle sue implicazioni per la revisione automatizzata della contabilità Beancount.

ai
llm
fraud-detection
Mostrando 1–12 di 57 articoli
1 / 5Successivo