
FinRAGBench-V:金融领域带视觉引用的多模态 RAG
FinRAGBench-V发现,顶级模型在金融页面上仅达到20–61%的块级引用召回率。多模态检索比纯文本高出近50个百分点。
#financial-reporting

FinRAGBench-V发现,顶级模型在金融页面上仅达到20–61%的块级引用召回率。多模态检索比纯文本高出近50个百分点。

Fin-RATE 显示 LLM 在纵向追踪上的准确率骤降 18.60%,真正的瓶颈是检索流程,而非模型本身。

FinDER的5,703个真实分析师查询显示,顶级RAG仅召回10-K证据的25.95%。应先规范化缩写,再更换嵌入模型。

DocFinQA 将 FinQA 的 700 词段落换成完整 SEC 文件,上下文长度增加到 175 倍,使 GPT-4 在长文档上的准确率几乎减半。

FinAuditing 显示,顶级 LLM 在真实 SEC XBRL 文件的金融数学验证上仅得 13.86%,这限定了 AI 会计工具无法独立自动化的范围。

TAT-LLM将LLaMA 2 7B微调至FinQA上64.60%的EM,略胜GPT-4的63.91%:提取-推理-执行流水线让小模型完成表格算术。

MultiHiertt 显示模型在 10,440 个财务问答对上 F1 为 38%,人类为 87%,跨表格问题上再降 15 个点。

ConvFinQA最佳模型得分为68.9%的执行准确率,而人类专家为89.4%——这一21个百分点的差距仍是多轮账本对话面临的挑战。

TAT-QA 的表格-文本混合问题表明,金融 AI 的瓶颈是证据定位,而非算术。到 2024 年,微调后的 7B 大模型达到了 83% F1。

FinQA 发现神经模型在财报数学上得分 61%,人类专家则为 91%,在三步及以上推理程序上更骤降至 22%。

FinanceBench 用 16 种 AI 方案测试了 10,231 个真实 SEC 文件问题:共享向量存储 RAG 只答对 19%,可见检索并非瓶颈。

PHANTOM(NeurIPS 2025)衡量 LLM 在真实数据上的幻觉检测。Qwen3-30B 以 F1=0.882 领先,但 7B 模型近乎随机猜测。