
AD-LLM Benchmark: GPT-4o behaalt 0,93+ AUROC Zero-Shot voor tekstuele anomaliedetectie
AD-LLM vindt dat GPT-4o 0,93–0,99 AUROC zero-shot haalt voor tekstuele anomaliedetectie, maar LLM-modelselectie blijft onbetrouwbaar voor financiële audit-AI.
#anomaly-detection
Detectie van onregelmatigheden en dubbele boekingen in plain-text grootboekdata

AD-LLM vindt dat GPT-4o 0,93–0,99 AUROC zero-shot haalt voor tekstuele anomaliedetectie, maar LLM-modelselectie blijft onbetrouwbaar voor financiële audit-AI.

CausalTAD herordent tabelkolommen op causale afhankelijkheid vóór LLM-serialisatie, en verhoogt gemiddelde AUC-ROC van 0,803 naar 0,834 boven AnoLLM.