
FinRAGBench-V:金融领域带视觉引用的多模态 RAG
FinRAGBench-V发现,顶级模型在金融页面上仅达到20–61%的块级引用召回率。多模态检索比纯文本高出近50个百分点。
#machine-learning

FinRAGBench-V发现,顶级模型在金融页面上仅达到20–61%的块级引用召回率。多模态检索比纯文本高出近50个百分点。

WildToolBench发现,在1,024个真实用户任务上,没有LLM的会话准确率超过15%,隐藏意图和指令转换是最尖锐的失败模式。

GPT-4语言化置信度的AUROC仅为约62.7%,勉强高于随机。不确定性感知的金融智能体需要比这更好的校准。

JSONSchemaBench发现,覆盖率从简单模式的86%骤降至复杂模式的3%,因此LLM结构化输出可能静默发出不合规的JSON。

FinMCP-Bench在613个真实MCP金融任务上,六个LLM中最佳者精确匹配率仅为3.08%,从单工具到多轮使用骤降20倍。

FinTrace显示,前沿LLM能选对金融工具(F1约0.9),但在使用结果上仅得3.23/5,这正是写回智能体崩溃的环节。

FinToolBench发现,所有受测LLM的意图不匹配率均超过50%,因此激进的工具调用并不意味着在金融任务上有更好的答案。

OmniEval 给最佳 RAG 系统在 5 类金融任务上的数值准确率评分为 36%,因此账本智能体在写入分录前需要验证。

NAACL 2025的分类法依然成立,但表格覆盖缺失。金融AI团队必须自行适配视觉模型方法。

当证据位于上下文中部时,从LLM注意力权重中减去位置偏差可恢复高达15个百分点的RAG准确率,有助于金融智能体流水线。

ReDAct 仅在困惑度表明不确定时,才从小模型推迟到大模型,在保持准确率的同时将智能体工作流的成本降低 64%。

OpenHands 的 CodeAct 智能体在 SWE-Bench Lite 上得分 26%,展示了 AI 智能体如今可靠能做到什么。金融自动化应从严格限定范围开始,而非完全自主。