
LLM Anomaly Detection Survey (NAACL 2025): Sterke Taxonomie, Ontbrekende Tabeldekking
De NAACL 2025-taxonomie houdt stand, maar tabeldekking ontbreekt. Finance-AI-teams moeten methoden voor vision-modellen zelf aanpassen.
#fraud-detection
Detectie van anomalieën of fraude in financiële data

De NAACL 2025-taxonomie houdt stand, maar tabeldekking ontbreekt. Finance-AI-teams moeten methoden voor vision-modellen zelf aanpassen.

AD-LLM vindt dat GPT-4o 0,93–0,99 AUROC zero-shot haalt voor tekstuele anomaliedetectie, maar LLM-modelselectie blijft onbetrouwbaar voor financiële audit-AI.

CausalTAD herordent tabelkolommen op causale afhankelijkheid vóór LLM-serialisatie, en verhoogt gemiddelde AUC-ROC van 0,803 naar 0,834 boven AnoLLM.

AnoLLM verslaat klassieke baselines op fraudedata met gemengde types door rijen te scoren met LLM negative log-likelihood, maar biedt geen voordeel op puur numerieke tabellen.

GPT-4 bereikt 74,1 gemiddelde AUROC op ODDS zero-shot, dicht bij de 75,5 ECOD-baseline, maar faalt op data met hoge variantie. Ledger-auditing is nog niet opgelost.

AuditCopilot verlaagt false positives bij fraude met journaalposten van 942 naar 12, maar ablatie toont dat de LLM vooral Isolation Forest-scores synthetiseert.

Chain-of-Thought-prompting verhoogt de precisie, maar kan de recall op zeldzame financiële gebeurtenissen verlagen, zodat fraudedetectie-agents anomalieën missen.