2026年6月26日阅读需 2 分钟AD-LLM 基准测试:GPT-4o 在文本异常检测中零样本 AUROC 达到 0.93+AD-LLM 发现 GPT-4o 在文本异常检测的零样本任务上达到 0.93–0.99 AUROC,但 LLM 模型选择对金融审计 AI 而言仍不可靠。Mike Thriftllmaimachine-learning
2026年6月25日阅读需 1 分钟CausalTAD:用于大语言模型表格异常检测的因果列排序CausalTAD 在 LLM 序列化前按因果依赖关系重排表格列,使平均 AUC-ROC 从 AnoLLM 的 0.803 提升到 0.834。Mike Thriftllmaimachine-learning