
DIN-SQL: GPT-4 salta dal 67,4% all'85,3% EX su Spider
DIN-SQL porta GPT-4 dal 67,4% all'85,3% di accuratezza di esecuzione su Spider tramite fasi di schema-link e auto-correzione—la stessa scomposizione si adatta a Beancount BQL.

DIN-SQL porta GPT-4 dal 67,4% all'85,3% di accuratezza di esecuzione su Spider tramite fasi di schema-link e auto-correzione—la stessa scomposizione si adatta a Beancount BQL.

Su BIRD, GPT-4 raggiunge il 54,89% di accuratezza di esecuzione con suggerimenti di dominio e il 34,88% senza—un divario di 20 punti che qualsiasi interfaccia NL→BQL di Beancount deve colmare.

Ricercatori di CMU e NC State propongono l'uso dell'Analisi Sistemico-Teoretica dei Processi (STPA) e un Model Context Protocol potenziato per derivare specifiche di sicurezza formali per l'uso di strumenti da parte di agenti LLM, con verifica basata su Alloy che dimostra l'assenza di flussi non sicuri in un caso di studio sulla pianificazione di calendari.

GraphRAG di Microsoft mostra guadagni del 72–83% nell'analisi sensemaking rispetto al RAG vettoriale; un audit del 2025 li fa crollare dopo aver corretto il bias del giudice—un monito per la QA su registri multi-documento.

FinAuditing testa 13 LLM in modalità zero-shot su 1.102 istanze reali di depositi XBRL della SEC; i punteggi migliori sono 13,86% sulla verifica matematica finanziaria e 12,42% sul recupero di concetti—risultati che delimitano direttamente ciò che gli strumenti di contabilità AI possono essere autorizzati ad automatizzare senza strumentazione esterna.

InvestorBench: Qwen2.5-72B guida il trading azionario con un CR del 46,15%; Palmyra-Fin ottimizzata per la finanza fallisce sulle azioni—le dimensioni superano il fine-tuning di dominio.

StructRAG (ICLR 2025) instrada ogni query al tipo di struttura più adatto al compito — tabella, grafo, catalogo, algoritmo o blocco di testo — prima di ragionare, ottenendo un punteggio di 28 punti superiore a GraphRAG sul benchmark Loong, eseguendo 22× più velocemente, con il solo router addestrato con DPO che contribuisce a un guadagno di accuratezza di 15 punti.

Con budget di token di pensiero uguali, gli LLM single-agent eguagliano o superano i sistemi multi-agent nel ragionamento multi-hop—privilegia design di agenti finanziari più semplici.

M3MAD-Bench mette sotto stress il Dibattito Multi-Agente su 9 modelli, 5 domini e impostazioni visione-linguaggio, scoprendo che il Delirio Collettivo causa il 65% dei fallimenti, il dibattito avversario riduce l'accuratezza fino al 12,8% e l'Auto-Consistenza generalmente eguaglia l'accuratezza del dibattito a un costo di token inferiore.

AGrail (ACL 2025) introduce una barriera di sicurezza cooperativa a due LLM che adatta i controlli di sicurezza al momento dell'inferenza tramite adattamento al test, raggiungendo uno 0% di successo negli attacchi di iniezione di prompt e il 95,6% di preservazione delle azioni benigne su Safe-OS — rispetto a GuardAgent e LLaMA-Guard che bloccano fino al 49,2% delle azioni legittime.

ShieldAgent (ICML 2025) sostituisce i guardrail basati su LLM con circuiti di regole probabilistiche costruiti su Reti Logiche Markov, raggiungendo il 90.4% di accuratezza sugli attacchi agli agenti con il 64.7% in meno di chiamate API — e cosa significa per la sicurezza verificabile nei sistemi AI finanziari.

Atlas (JMLR 2023) raggiunge il 42,4% di accuratezza su Natural Questions con solo 64 esempi di addestramento—superando PaLM 540B di 3 punti usando 11B parametri—pre-addestrando congiuntamente un retriever denso basato su Contriever con un lettore T5 Fusion-in-Decoder. L'analisi copre i limiti dell'accuratezza del recupero, i costi infrastrutturali dell'indice da 587GB e le implicazioni per i sistemi di Q&A sui libri contabili Beancount.