
LLM 异常检测综述 (NAACL 2025):强大的分类体系,缺失的表格数据覆盖
NAACL 2025的分类法依然成立,但表格覆盖缺失。金融AI团队必须自行适配视觉模型方法。
#analytics

NAACL 2025的分类法依然成立,但表格覆盖缺失。金融AI团队必须自行适配视觉模型方法。

Fin-RATE 显示 LLM 在纵向追踪上的准确率骤降 18.60%,真正的瓶颈是检索流程,而非模型本身。

当答案位于上下文中段时,LLM 得分最多会低 20 分,因此金融 RAG 流程应把最佳段落放在最前或最后。

AD-LLM 发现 GPT-4o 在文本异常检测的零样本任务上达到 0.93–0.99 AUROC,但 LLM 模型选择对金融审计 AI 而言仍不可靠。

τ-bench 发现顶尖大模型在零售工具调用任务上从 pass@1 的 0.692 降至 pass@4 的 0.462。在账本上执行写回的智能体也面临同样的稳定性悬崖。

ConvFinQA最佳模型得分为68.9%的执行准确率,而人类专家为89.4%——这一21个百分点的差距仍是多轮账本对话面临的挑战。

FinanceBench 用 16 种 AI 方案测试了 10,231 个真实 SEC 文件问题:共享向量存储 RAG 只答对 19%,可见检索并非瓶颈。

自一致性对多条采样的推理路径进行多数投票,而非单一贪婪解码,在 GSM8K 上提升 17.9 个点且无需额外训练。