I tre articoli precedenti di questa serie riguardavano AnoLLM, CausalTAD e AD-LLM, ciascuno incentrato specificamente sull'anomaly detection in dati tabulari. Questo survey di Ruiyao Xu e Kaize Ding, accettato per NAACL 2025 Findings, dovrebbe collegare questi fili in una mappa unificata del panorama. Mi aspettavo una tassonomia che chiarisse lo spazio progettuale; ciò che ho ottenuto è per lo più un survey sull'anomaly detection in immagini e video con una sottile vernice di generalità.
L'articolo
Il survey di Xu e Ding (arXiv:2409.01980) propone di organizzare l'anomaly e out-of-distribution (OOD) detection basata su LLM in due classi di alto livello: LLM per la Rilevazione, dove il modello identifica direttamente le anomalie, e LLM per la Generazione, dove il modello potenzia i dati di addestramento o produce spiegazioni in linguaggio naturale che alimentano un rilevatore a valle. Ogni classe si suddivide ulteriormente. La rilevazione si divide in metodi basati su prompt (LLM congelati o ottimizzati interrogati tramite prompt in linguaggio naturale) e metodi basati su contrasto (modelli della famiglia CLIP che valutano l'anomalia confrontando porzioni di immagine con descrizioni testuali). La generazione si divide in metodi incentrati sull'aumento (generazione di etichette pseudo-OOD o campioni sintetici di minoranze) e metodi incentrati sulla spiegazione (produzione di motivazioni in linguaggio naturale per gli eventi segnalati).
L'elenco di letture su GitHub allegato copre circa 39 articoli: 24 sulla rilevazione, 10 sull'aumento e 5 sulla spiegazione.
Idee chiave
- I metodi basati su contrasto dominano l'anomaly detection in immagini. WinCLIP raggiunge il 91,8% e l'85,1% di AUROC nella classificazione e segmentazione zero-shot delle anomalie su MVTec-AD senza alcuna ottimizzazione specifica per il dataset, un risultato competitivo con i metodi supervisionati addestrati su quel dataset.
- Gli LLM congelati incontrano un divario di modalità per i dati non testuali. Il survey nota esplicitamente che "interrogare direttamente LLM congelati per l'anomaly o OOD detection in vari tipi di dati spesso produce prestazioni subottimali a causa del divario di modalità intrinseco tra testo e altre modalità di dati."
- L'ottimizzazione con LoRA e adapter recupera gran parte di quel divario. Metodi come AnomalyGPT e AnomalyCLIP si ottimizzano con tecniche a efficienza parametrica e superano sostanzialmente le loro controparti congelate.
- La generazione come aumento è sottoutilizzata. Le etichette pseudo-OOD a livello di didascalia generate da BLIP-2 superano le alternative a livello di parola e di descrizione nella OOD detection, suggerendo che una supervisione testuale più ricca conta anche per compiti visivi.
- La generazione incentrata sulla spiegazione è la sottocategoria più recente. Sistemi come Holmes-VAD e VAD-LLaMA vanno oltre le semplici segnalazioni binarie per generare motivazioni in linguaggio naturale per eventi anomali, principalmente in video di sorveglianza.
- I dati tabulari sono quasi assenti. Il survey cita un metodo — "Tabular" di Li et al. (2024) — che converte righe tabulari in prompt testuali e si ottimizza con LoRA, ma non fornisce valori comparativi.
Cosa regge — e cosa no
La tassonomia a due classi è genuinamente chiara e probabilmente la userò per organizzare il mio pensiero. La distinzione tra rilevazione e generazione cattura un vero bivio architetturale: o si chiede all'LLM di classificare direttamente o lo si usa per costruire un segnale di addestramento migliore per un rilevatore tradizionale.
Ciò che non posso accettare è l'inquadramento dell'articolo come un survey sull'anomaly detection in generale. La copertura è fortemente concentrata su immagini di difetti industriali (MVTec-AD, VisA) e video di sorveglianza (UCF-Crime, XD-Violence). Dei circa 39 articoli catalogati, quasi nessuno affronta dati tabulari o finanziari. Le serie temporali ricevono qualche citazione. I dati tabulari ricevono una frase. Questa non è una mappa del panorama per Bean Labs — è una mappa del panorama per ricercatori di computer vision che vogliono usare CLIP per la rilevazione di difetti.
Gli autori riconoscono che "vincoli di spazio impediscono riepiloghi metrici dettagliati", un modo elegante per dire che non ci sono tabelle di confronto. Per un survey, l'assenza di una sintesi quantitativa è una lacuna significativa. I lettori non possono usare questo articolo per decidere quale paradigma sia migliore per il loro caso d'uso senza rintracciare e leggere individualmente ogni articolo citato.
La sfida dell'allucinazione è elencata come problema aperto, ma il trattamento è superficiale — si nomina il rischio senza analizzare quali paradigmi di rilevazione siano più o meno suscettibili, o come la generazione incentrata sulla spiegazione potrebbe rendere le allucinazioni più rilevabili tramite revisione umana.
Perché questo è importante per l'AI finanziaria
Due sottocategorie sono rilevanti nonostante la copertura incentrata sulle immagini. Primo, la sottocategoria generazione incentrata sulla spiegazione è esattamente ciò di cui hanno bisogno gli agenti di audit di Beancount: non solo una segnalazione su una registrazione contabile anomala, ma una frase in linguaggio naturale che ne spieghi il motivo. I revisori finanziari non possono agire su un output binario. Secondo, il silenzio quasi totale del survey sull'anomaly detection in dati tabulari è di per sé informativo — conferma che il filone di AnoLLM, CausalTAD e AD-LLM che sto seguendo è un'area di frontiera piuttosto che un percorso ben battuto, e che progettare strumenti di audit basati su LLM per i registri Beancount richiede di sintetizzare intuizioni dall'anomaly detection in visione che non sono state ancora trasferite ai contesti tabulari.
Il compromesso tra prompting e ottimizzazione è il risultato più utilizzabile: il prompting zero-shot funziona come prima approssimazione ma soffre del divario di modalità; l'ottimizzazione basata su LoRA su esempi etichettati rappresentativi colma il divario. Per un'implementazione Beancount con esempi di anomalie etichettate da registri storici, il percorso dell'ottimizzazione sembra più affidabile del semplice prompting.
Cosa leggere dopo
- "Advancing Anomaly Detection: Non-Semantic Financial Data Encoding with LLMs" (arXiv:2406.03614) — utilizza embeddings di frasi da modelli LLM su registrazioni contabili reali di libri mastri generali; un collegamento diretto dal quadro di questo survey al caso d'uso tabulare di Beancount.
- "Enhancing Anomaly Detection in Financial Markets with an LLM-based Multi-Agent Framework" (arXiv:2403.19735) — pipeline multi-agente per l'anomaly detection in dati di mercato; il modello di coordinamento multi-agente potrebbe essere trasferito all'audit dei registri contabili.
- AnomalyGPT (arXiv:2308.15366) — LVLM ottimizzato per l'anomaly detection industriale con localizzazione a livello di pixel; la lettura chiarisce cosa significhi architetturalmente "ottimizzazione LLM per la rilevazione", che il survey descrive ma non spiega.