Salta al contenuto principale

Mike Thrift

Responsabile marketing

GuardAgent: Applicazione Deterministica della Sicurezza per Agenti LLM tramite Esecuzione di Codice

GuardAgent (ICML 2025) posiziona un agente LLM separato tra un agente target e il suo ambiente, verificando ogni azione proposta generando ed eseguendo codice Python — raggiungendo il 98,7% di accuratezza nell'applicazione delle policy, preservando al contempo il 100% del completamento delle attività, contro l'81% di accuratezza e il 29-71% di fallimento nelle attività per le regole di sicurezza incorporate nel prompt.

Dibattito Multiagente con LLM: Veri Guadagni di Accuratezza, Calcolo Incontrollato e Delirio Collettivo

Un'analisi approfondita del paper di Du et al. su ICML 2024 sul dibattito multiagente — che riporta guadagni di accuratezza del 14,8% su operazioni aritmetiche — insieme alle confutazioni del 2025 che mostrano come agenti singoli con pari budget eguaglino le performance del dibattito, e un'analisi del perché il Delirio Collettivo (65% dei fallimenti del dibattito) rappresenti un rischio specifico per le registrazioni contabili assistite da IA.

I LLM non sono utili per il forecasting di serie temporali: cosa significa NeurIPS 2024 per la finanza AI

Un articolo Spotlight di NeurIPS 2024 abla tre metodi di previsione di serie temporali basati su LLM — OneFitsAll, Time-LLM e CALF — e scopre che la rimozione del modello linguistico migliora l'accuratezza nella maggior parte dei casi, con un'accelerazione dell'addestramento fino a 1.383×. Per applicazioni di finanza AI come la previsione del saldo di Beancount, modelli leggeri e costruiti appositamente superano costantemente i LLM riadattati.

AuditCopilot: LLM per il Rilevamento di Frodi nella Contabilità in Partita Doppia

AuditCopilot applica LLM open-source (Mistral-8B, Gemma, Llama-3.1) al rilevamento di frodi nelle registrazioni contabili aziendali, riducendo i falsi positivi da 942 a 12 — ma l'analisi di ablazione rivela che l'LLM funziona principalmente come livello di sintesi basato sui punteggi di Isolation Forest, non come rilevatore di anomalie indipendente.

Fine-Tuning vs. RAG: Perché il Recupero Vince per Iniettare Nuova Conoscenza negli LLM

Un confronto empirico tra RAG e fine-tuning non supervisionato su LLM con 7 miliardi di parametri mostra che RAG raggiunge una precisione superiore a 0,875 su fatti successivi al cutoff, mentre il fine-tuning si attesta a 0,504 — con implicazioni dirette per la progettazione di agenti Beancount e qualsiasi sistema che richieda aggiornamenti frequenti della conoscenza.