
FinRAGBench-V:金融领域带视觉引用的多模态 RAG
FinRAGBench-V发现,顶级模型在金融页面上仅达到20–61%的块级引用召回率。多模态检索比纯文本高出近50个百分点。
#finance

FinRAGBench-V发现,顶级模型在金融页面上仅达到20–61%的块级引用召回率。多模态检索比纯文本高出近50个百分点。

GPT-4语言化置信度的AUROC仅为约62.7%,勉强高于随机。不确定性感知的金融智能体需要比这更好的校准。

FinTrace显示,前沿LLM能选对金融工具(F1约0.9),但在使用结果上仅得3.23/5,这正是写回智能体崩溃的环节。

OmniEval 给最佳 RAG 系统在 5 类金融任务上的数值准确率评分为 36%,因此账本智能体在写入分录前需要验证。

FinDER的5,703个真实分析师查询显示,顶级RAG仅召回10-K证据的25.95%。应先规范化缩写,再更换嵌入模型。

当答案位于上下文中段时,LLM 得分最多会低 20 分,因此金融 RAG 流程应把最佳段落放在最前或最后。

AnoLLM 通过用 LLM 负对数似然为行打分,在混合类型欺诈数据上超越经典基线,但在纯数值表格上并未带来额外优势。

DocFinQA 将 FinQA 的 700 词段落换成完整 SEC 文件,上下文长度增加到 175 倍,使 GPT-4 在长文档上的准确率几乎减半。

TheAgentCompany 在模拟内网中评测了 175 项企业任务,最佳模型 Gemini-2.5-Pro 仅完成 30%,每项任务成本 4 美元。

InvestorBench:Qwen2.5-72B以46.15%的CR引领股票交易;金融调优的Palmyra-Fin在股票上适得其反——规模胜过领域微调。

在相同的思考预算下,单代理LLM在多跳推理上等同于或超越多智能体系统——更倾向于简单的金融代理设计。

M3MAD-Bench 发现集体妄想驱动了 65% 的多智能体辩论失败,对抗性辩论最多使准确率下降 12.8%。