
LLM-Anomalieerkennung Survey (NAACL 2025): Starke Taxonomie, fehlende Abdeckung tabellarischer Daten
Die NAACL-2025-Taxonomie bleibt gültig, doch tabellarische Abdeckung fehlt. Finanz-KI-Teams müssen Vision-Modell-Methoden selbst anpassen.
#fraud-detection
Erkennung anomaler oder betrügerischer Einträge in Finanzdaten

Die NAACL-2025-Taxonomie bleibt gültig, doch tabellarische Abdeckung fehlt. Finanz-KI-Teams müssen Vision-Modell-Methoden selbst anpassen.

AD-LLM zeigt, dass GPT-4o Zero-Shot 0,93–0,99 AUROC bei der Text-Anomalieerkennung erreicht, doch die LLM-Modellauswahl für KI-Finanzprüfung bleibt unzuverlässig.

CausalTAD ordnet Tabellenspalten vor der LLM-Serialisierung nach kausaler Abhängigkeit um und hebt den mittleren AUC-ROC gegenüber AnoLLM von 0,803 auf 0,834.

AnoLLM schlägt klassische Baselines bei gemischttypischen Betrugsdaten durch Zeilenbewertung mit LLM-Log-Likelihood, bringt aber bei rein numerischen Tabellen keinen Vorteil.

GPT-4 erreicht 74,1 mittleren AUROC bei ODDS Zero-Shot, nahe der ECOD-Baseline von 75,5, versagt aber bei Daten mit hoher Varianz. Ledger-Prüfung ist noch nicht gelöst.

AuditCopilot senkt Falschpositive bei Buchungsbetrug von 942 auf 12, doch die Ablation zeigt, dass das LLM hauptsächlich Isolation-Forest-Scores synthetisiert.

Chain-of-Thought-Prompting erhöht die Präzision, kann aber den Recall bei seltenen Finanzereignissen senken, sodass Betrugs-Agenten Anomalien übersehen, die sie melden sollten.