Salta al contenuto principale

Mike Thrift

Responsabile marketing

FinAuditing: i LLM ottengono meno del 14% su compiti reali di revisione XBRL della SEC

FinAuditing testa 13 LLM in modalità zero-shot su 1.102 istanze reali di depositi XBRL della SEC; i punteggi migliori sono 13,86% sulla verifica matematica finanziaria e 12,42% sul recupero di concetti—risultati che delimitano direttamente ciò che gli strumenti di contabilità AI possono essere autorizzati ad automatizzare senza strumentazione esterna.

StructRAG (ICLR 2025): Scegliere la Struttura Documentale Giusta Supera GraphRAG di 28 Punti

StructRAG (ICLR 2025) instrada ogni query al tipo di struttura più adatto al compito — tabella, grafo, catalogo, algoritmo o blocco di testo — prima di ragionare, ottenendo un punteggio di 28 punti superiore a GraphRAG sul benchmark Loong, eseguendo 22× più velocemente, con il solo router addestrato con DPO che contribuisce a un guadagno di accuratezza di 15 punti.

AGrail: Barriere di Sicurezza Adattive per Agenti LLM che Imparano tra Attività Diverse

AGrail (ACL 2025) introduce una barriera di sicurezza cooperativa a due LLM che adatta i controlli di sicurezza al momento dell'inferenza tramite adattamento al test, raggiungendo uno 0% di successo negli attacchi di iniezione di prompt e il 95,6% di preservazione delle azioni benigne su Safe-OS — rispetto a GuardAgent e LLaMA-Guard che bloccano fino al 49,2% delle azioni legittime.

Atlas: Il Pre-Addestramento Congiunto Retriever-Reader Supera LLM da 540B Parametri con 11B Parametri

Atlas (JMLR 2023) raggiunge il 42,4% di accuratezza su Natural Questions con solo 64 esempi di addestramento—superando PaLM 540B di 3 punti usando 11B parametri—pre-addestrando congiuntamente un retriever denso basato su Contriever con un lettore T5 Fusion-in-Decoder. L'analisi copre i limiti dell'accuratezza del recupero, i costi infrastrutturali dell'indice da 587GB e le implicazioni per i sistemi di Q&A sui libri contabili Beancount.