Salta al contenuto principale

Mike Thrift

Marketing Manager

BIRD Benchmark: Il Divario tra Database Reali e LLM per Text-to-SQL
·mike

BIRD Benchmark: Il Divario tra Database Reali e LLM per Text-to-SQL

Il benchmark BIRD (NeurIPS 2023) testa gli LLM su 95 database reali — GPT-4 raggiunge solo il 54,89% di accuratezza di esecuzione con suggerimenti di dominio e il 34,88% senza, un divario di 20 punti che modella direttamente ciò che un'interfaccia BQL in linguaggio naturale per Beancount dovrebbe risolvere.

beancount
ai
llm
Uso Sicuro e Verificabile degli Strumenti per Agenti LLM: STPA incontra MCP
·mike

Uso Sicuro e Verificabile degli Strumenti per Agenti LLM: STPA incontra MCP

Ricercatori di CMU e NC State propongono l'uso dell'Analisi Sistemico-Teoretica dei Processi (STPA) e un Model Context Protocol potenziato per derivare specifiche di sicurezza formali per l'uso di strumenti da parte di agenti LLM, con verifica basata su Alloy che dimostra l'assenza di flussi non sicuri in un caso di studio sulla pianificazione di calendari.

ai
llm
security
GraphRAG: Dalla Sintesi Locale a quella Globale Focalizzata sulle Query
·mike

GraphRAG: Dalla Sintesi Locale a quella Globale Focalizzata sulle Query

Il GraphRAG di Microsoft costruisce un grafo di entità partizionato con Leiden su un corpus di testi e precalcola riassunti delle community per rispondere a domande di comprensione globale che il RAG vettoriale standard non può gestire — ma un audit sui bias del 2025 mostra che i suoi tassi di vittoria del 72–83% crollano dopo aver corretto gli artefatti di posizione e lunghezza nella valutazione LLM-as-judge.

ai
llm
machine-learning
FinAuditing: i LLM ottengono meno del 14% su compiti reali di revisione XBRL della SEC
·mike

FinAuditing: i LLM ottengono meno del 14% su compiti reali di revisione XBRL della SEC

FinAuditing testa 13 LLM in modalità zero-shot su 1.102 istanze reali di depositi XBRL della SEC; i punteggi migliori sono 13,86% sulla verifica matematica finanziaria e 12,42% sul recupero di concetti—risultati che delimitano direttamente ciò che gli strumenti di contabilità AI possono essere autorizzati ad automatizzare senza strumentazione esterna.

llm
ai
financial-reporting
InvestorBench: Benchmarking di Agenti LLM nelle Decisioni di Trading Finanziario
·mike

InvestorBench: Benchmarking di Agenti LLM nelle Decisioni di Trading Finanziario

InvestorBench (ACL 2025) testa 13 modelli LLM backbone su trading backtestato di azioni, criptovalute ed ETF utilizzando il rendimento cumulativo e l'indice di Sharpe — non l'accuratezza nel rispondere a domande. Qwen2.5-72B è in cima alla classifica delle azioni con un CR del 46,15%; i modelli ottimizzati per la finanza falliscono con le azioni. La dimensione del modello predice le performance in modo più affidabile dell'ottimizzazione per dominio.

llm
ai
finance
StructRAG (ICLR 2025): Scegliere la Struttura Documentale Giusta Supera GraphRAG di 28 Punti
·mike

StructRAG (ICLR 2025): Scegliere la Struttura Documentale Giusta Supera GraphRAG di 28 Punti

StructRAG (ICLR 2025) instrada ogni query al tipo di struttura più adatto al compito — tabella, grafo, catalogo, algoritmo o blocco di testo — prima di ragionare, ottenendo un punteggio di 28 punti superiore a GraphRAG sul benchmark Loong, eseguendo 22× più velocemente, con il solo router addestrato con DPO che contribuisce a un guadagno di accuratezza di 15 punti.

ai
llm
machine-learning
LLM ad Agente Singolo Superano i Sistemi Multi-Agente nel Ragionamento Multi-Salto a Parità di Budget di Token di Pensiero
·mike

LLM ad Agente Singolo Superano i Sistemi Multi-Agente nel Ragionamento Multi-Salto a Parità di Budget di Token di Pensiero

Una preprint di Stanford del 2026 equalizza i budget di token di pensiero in cinque architetture multi-agente e scopre che i LLM ad agente singolo eguagliano o superano i sistemi multi-agente nel ragionamento multi-salto — con fondamento teorico nella Disuguaglianza di Elaborazione dei Dati e implicazioni per la progettazione di agenti AI finanziari.

ai
llm
machine-learning
M3MAD-Bench: I dibattiti multi-agente sono davvero efficaci tra domini e modalità?
·mike

M3MAD-Bench: I dibattiti multi-agente sono davvero efficaci tra domini e modalità?

M3MAD-Bench mette sotto stress il Dibattito Multi-Agente su 9 modelli, 5 domini e impostazioni visione-linguaggio, scoprendo che il Delirio Collettivo causa il 65% dei fallimenti, il dibattito avversario riduce l'accuratezza fino al 12,8% e l'Auto-Consistenza generalmente eguaglia l'accuratezza del dibattito a un costo di token inferiore.

ai
llm
machine-learning
AGrail: Barriere di Sicurezza Adattive per Agenti LLM che Imparano tra Attività Diverse
·mike

AGrail: Barriere di Sicurezza Adattive per Agenti LLM che Imparano tra Attività Diverse

AGrail (ACL 2025) introduce una barriera di sicurezza cooperativa a due LLM che adatta i controlli di sicurezza al momento dell'inferenza tramite adattamento al test, raggiungendo uno 0% di successo negli attacchi di iniezione di prompt e il 95,6% di preservazione delle azioni benigne su Safe-OS — rispetto a GuardAgent e LLaMA-Guard che bloccano fino al 49,2% delle azioni legittime.

ai
llm
security
ShieldAgent: Ragionamento Verificabile sulla Sicurezza delle Policy per Agenti LLM
·mike

ShieldAgent: Ragionamento Verificabile sulla Sicurezza delle Policy per Agenti LLM

ShieldAgent (ICML 2025) sostituisce i guardrail basati su LLM con circuiti di regole probabilistiche costruiti su Reti Logiche Markov, raggiungendo il 90.4% di accuratezza sugli attacchi agli agenti con il 64.7% in meno di chiamate API — e cosa significa per la sicurezza verificabile nei sistemi AI finanziari.

ai
llm
machine-learning
Atlas: Il Pre-Addestramento Congiunto Retriever-Reader Supera LLM da 540B Parametri con 11B Parametri
·mike

Atlas: Il Pre-Addestramento Congiunto Retriever-Reader Supera LLM da 540B Parametri con 11B Parametri

Atlas (JMLR 2023) raggiunge il 42,4% di accuratezza su Natural Questions con solo 64 esempi di addestramento—superando PaLM 540B di 3 punti usando 11B parametri—pre-addestrando congiuntamente un retriever denso basato su Contriever con un lettore T5 Fusion-in-Decoder. L'analisi copre i limiti dell'accuratezza del recupero, i costi infrastrutturali dell'indice da 587GB e le implicazioni per i sistemi di Q&A sui libri contabili Beancount.

ai
machine-learning
llm
Fusion-in-Decoder: Come il Recupero Multi-Passaggio Migliora la QA Generativa
·mike

Fusion-in-Decoder: Come il Recupero Multi-Passaggio Migliora la QA Generativa

L'architettura FiD di Izacard e Grave codifica indipendentemente i passaggi recuperati e poi li fonde nel decoder, superando RAG-Sequence di 4–11 punti su NQ e TriviaQA. Questo post esamina il design e le sue implicazioni per la QA sui registri Beancount, dove la sintesi multi-voce tra le transazioni è la norma.

ai
machine-learning
llm
Mostrando 37–48 di 87 articoli