Salta al contenuto principale

Mike Thrift

Marketing Manager

GuardAgent: Applicazione Deterministica della Sicurezza per Agenti LLM tramite Esecuzione di Codice
·mike

GuardAgent: Applicazione Deterministica della Sicurezza per Agenti LLM tramite Esecuzione di Codice

GuardAgent (ICML 2025) posiziona un agente LLM separato tra un agente target e il suo ambiente, verificando ogni azione proposta generando ed eseguendo codice Python — raggiungendo il 98,7% di accuratezza nell'applicazione delle policy, preservando al contempo il 100% del completamento delle attività, contro l'81% di accuratezza e il 29-71% di fallimento nelle attività per le regole di sicurezza incorporate nel prompt.

ai
llm
automation
Dibattito Multiagente con LLM: Veri Guadagni di Accuratezza, Calcolo Incontrollato e Delirio Collettivo
·mike

Dibattito Multiagente con LLM: Veri Guadagni di Accuratezza, Calcolo Incontrollato e Delirio Collettivo

Un'analisi approfondita del paper di Du et al. su ICML 2024 sul dibattito multiagente — che riporta guadagni di accuratezza del 14,8% su operazioni aritmetiche — insieme alle confutazioni del 2025 che mostrano come agenti singoli con pari budget eguaglino le performance del dibattito, e un'analisi del perché il Delirio Collettivo (65% dei fallimenti del dibattito) rappresenti un rischio specifico per le registrazioni contabili assistite da IA.

ai
llm
machine-learning
I LLM non sono utili per il forecasting di serie temporali: cosa significa NeurIPS 2024 per la finanza AI
·mike

I LLM non sono utili per il forecasting di serie temporali: cosa significa NeurIPS 2024 per la finanza AI

Un articolo Spotlight di NeurIPS 2024 abla tre metodi di previsione di serie temporali basati su LLM — OneFitsAll, Time-LLM e CALF — e scopre che la rimozione del modello linguistico migliora l'accuratezza nella maggior parte dei casi, con un'accelerazione dell'addestramento fino a 1.383×. Per applicazioni di finanza AI come la previsione del saldo di Beancount, modelli leggeri e costruiti appositamente superano costantemente i LLM riadattati.

ai
machine-learning
forecasting
AuditCopilot: LLM per il Rilevamento di Frodi nella Contabilità in Partita Doppia
·mike

AuditCopilot: LLM per il Rilevamento di Frodi nella Contabilità in Partita Doppia

AuditCopilot applica LLM open-source (Mistral-8B, Gemma, Llama-3.1) al rilevamento di frodi nelle registrazioni contabili aziendali, riducendo i falsi positivi da 942 a 12 — ma l'analisi di ablazione rivela che l'LLM funziona principalmente come livello di sintesi basato sui punteggi di Isolation Forest, non come rilevatore di anomalie indipendente.

fraud-detection
llm
double-entry
TAT-LLM: LLaMA 2 ottimizzato per il ragionamento discreto su tabelle e testo finanziario
·mike

TAT-LLM: LLaMA 2 ottimizzato per il ragionamento discreto su tabelle e testo finanziario

TAT-LLM ottimizza LLaMA 2 7B con LoRA su benchmark di QA ibrida tabella-testo finanziario, raggiungendo 64,60% EM su FinQA — superando il 63,91% di GPT-4 — attraverso la scomposizione del ragionamento in passi deterministici di Estrazione, Ragionamento ed Esecuzione che eliminano errori di calcolo.

llm
ai
machine-learning
Fine-Tuning vs. RAG: Perché il Recupero Vince per Iniettare Nuova Conoscenza negli LLM
·mike

Fine-Tuning vs. RAG: Perché il Recupero Vince per Iniettare Nuova Conoscenza negli LLM

Un confronto empirico tra RAG e fine-tuning non supervisionato su LLM con 7 miliardi di parametri mostra che RAG raggiunge una precisione superiore a 0,875 su fatti successivi al cutoff, mentre il fine-tuning si attesta a 0,504 — con implicazioni dirette per la progettazione di agenti Beancount e qualsiasi sistema che richieda aggiornamenti frequenti della conoscenza.

ai
llm
machine-learning
IRCoT: Intercalare il Recupero con il Chain-of-Thought per QA Multi-Fase
·mike

IRCoT: Intercalare il Recupero con il Chain-of-Thought per QA Multi-Fase

IRCoT intercala il recupero BM25 con ogni fase di un ciclo di ragionamento chain-of-thought, ottenendo +11,3 di richiamo nel recupero e +7,1 di F1 su HotpotQA rispetto al RAG a fase singola — e mostra che un modello da 3B può battere GPT-3 175B quando la strategia di recupero è corretta.

ai
llm
machine-learning
FLARE: Generazione Aumentata con Recupero Attivo
·mike

FLARE: Generazione Aumentata con Recupero Attivo

FLARE (EMNLP 2023) migliora il RAG standard attivando il recupero a metà generazione tramite soglie di confidenza basate sulla probabilità dei token, raggiungendo 51.0 EM su 2WikiMultihopQA contro 39.4 del recupero singolo — ma i fallimenti di calibrazione nei modelli chat ottimizzati tramite istruzioni ne limitano l'affidabilità per agenti finanziari in produzione.

ai
machine-learning
llm
Generazione Aumentata da Recupero per Compiti NLP ad Alta Intensità di Conoscenza
·mike

Generazione Aumentata da Recupero per Compiti NLP ad Alta Intensità di Conoscenza

L'articolo di Lewis et al. del NeurIPS 2020 ha introdotto l'architettura ibrida RAG—un generatore BART-large abbinato a un recuperatore indicizzato FAISS su 21 milioni di passaggi di Wikipedia—raggiungendo un EM di 44.5 su Natural Questions e stabilendo la suddivisione parametrico/non-parametrico che oggi è alla base della maggior parte dei sistemi AI di produzione. Questa rassegna copre i compromessi RAG-Sequence vs. RAG-Token, la modalità di fallimento del collasso del recupero, e cosa significano gli indici obsoleti per l'AI finanziaria costruita su registri Beancount solo-append.

ai
machine-learning
llm
MultiHiertt: Benchmarking del Ragionamento Numerico su Tabelle Finanziarie Multi-Gerarchiche
·mike

MultiHiertt: Benchmarking del Ragionamento Numerico su Tabelle Finanziarie Multi-Gerarchiche

MultiHiertt (ACL 2022) introduce 10.440 coppie QA da report finanziari reali con una media di 3,89 tabelle gerarchiche ciascuno; i modelli all'avanguardia ottengono un F1 del 38% contro l'87% degli umani, con una penalità di 15 punti per le domande cross-tabella, quantificando il divario di recupero che l'AI finanziaria deve colmare.

ai
machine-learning
llm
ConvFinQA: Domande e Risposte Finanziarie Multi-Turn e il Divario di 21 Punti tra Modelli ed Esperti Umani
·mike

ConvFinQA: Domande e Risposte Finanziarie Multi-Turn e il Divario di 21 Punti tra Modelli ed Esperti Umani

ConvFinQA (EMNLP 2022) estende FinQA al dialogo multi-turn sui report sugli utili delle aziende S&P 500, scoprendo che il miglior modello ottimizzato raggiunge un'accuratezza di esecuzione del 68,9% contro l'89,4% degli esperti umani – e scende al 52,4% nelle conversazioni ibride multi-aspetto dove i modelli devono trasportare il contesto numerico tra diversi argomenti finanziari.

ai
llm
machine-learning
TAT-QA: Benchmark ibrido basato su tabella e testo per il ragionamento su relazioni finanziarie annuali
·mike

TAT-QA: Benchmark ibrido basato su tabella e testo per il ragionamento su relazioni finanziarie annuali

TAT-QA è un benchmark con 16.552 domande su contesti ibridi di tabelle e testo tratti da relazioni finanziarie, che ha dimostrato che l’ancoraggio dell’evidenza — non l’aritmetica — è il collo di bottiglia principale nell’IA finanziaria; entro il 2024, LLM 7B ottimizzati hanno raggiunto l’83% F1, colmando gran parte del divario rispetto al tetto umano del 91%.

ai
machine-learning
llm
Mostrando 49–60 di 87 articoli