
FinRAGBench-V:金融领域带视觉引用的多模态 RAG
FinRAGBench-V发现,顶级模型在金融页面上仅达到20–61%的块级引用召回率。多模态检索比纯文本高出近50个百分点。
#data-science

FinRAGBench-V发现,顶级模型在金融页面上仅达到20–61%的块级引用召回率。多模态检索比纯文本高出近50个百分点。

WildToolBench发现,在1,024个真实用户任务上,没有LLM的会话准确率超过15%,隐藏意图和指令转换是最尖锐的失败模式。

GPT-4语言化置信度的AUROC仅为约62.7%,勉强高于随机。不确定性感知的金融智能体需要比这更好的校准。

FinToolBench发现,所有受测LLM的意图不匹配率均超过50%,因此激进的工具调用并不意味着在金融任务上有更好的答案。

OmniEval 给最佳 RAG 系统在 5 类金融任务上的数值准确率评分为 36%,因此账本智能体在写入分录前需要验证。

NAACL 2025的分类法依然成立,但表格覆盖缺失。金融AI团队必须自行适配视觉模型方法。

当证据位于上下文中部时,从LLM注意力权重中减去位置偏差可恢复高达15个百分点的RAG准确率,有助于金融智能体流水线。

Fin-RATE 显示 LLM 在纵向追踪上的准确率骤降 18.60%,真正的瓶颈是检索流程,而非模型本身。

FinDER的5,703个真实分析师查询显示,顶级RAG仅召回10-K证据的25.95%。应先规范化缩写,再更换嵌入模型。

当答案位于上下文中段时,LLM 得分最多会低 20 分,因此金融 RAG 流程应把最佳段落放在最前或最后。

AD-LLM 发现 GPT-4o 在文本异常检测的零样本任务上达到 0.93–0.99 AUROC,但 LLM 模型选择对金融审计 AI 而言仍不可靠。

CausalTAD 在 LLM 序列化前按因果依赖关系重排表格列,使平均 AUC-ROC 从 AnoLLM 的 0.803 提升到 0.834。