
LLM 异常检测综述 (NAACL 2025):强大的分类体系,缺失的表格数据覆盖
NAACL 2025的分类法依然成立,但表格覆盖缺失。金融AI团队必须自行适配视觉模型方法。
#fraud-detection

NAACL 2025的分类法依然成立,但表格覆盖缺失。金融AI团队必须自行适配视觉模型方法。

AD-LLM 发现 GPT-4o 在文本异常检测的零样本任务上达到 0.93–0.99 AUROC,但 LLM 模型选择对金融审计 AI 而言仍不可靠。

CausalTAD 在 LLM 序列化前按因果依赖关系重排表格列,使平均 AUC-ROC 从 AnoLLM 的 0.803 提升到 0.834。

AnoLLM 通过用 LLM 负对数似然为行打分,在混合类型欺诈数据上超越经典基线,但在纯数值表格上并未带来额外优势。

GPT-4 在 ODDS 零样本任务上达到 74.1 的平均 AUROC,接近 75.5 的 ECOD 基线,但在高方差数据上失败。账本审计尚未解决。

AuditCopilot 将日记账分录欺诈误报从 942 降至 12,但消融实验显示 LLM 主要在综合 Isolation Forest 的分数。

思维链提示提升精确率,却可能降低对罕见金融事件的召回率,让欺诈检测智能体漏掉本应标记的异常。