
DIN-SQL:GPT-4 在 Spider 上从 67.4% 跃升至 85.3% 的执行准确率
DIN-SQL 通过 schema-link 和自校正阶段,将 GPT-4 在 Spider 上的执行准确率从 67.4% 提升至 85.3%——这种分解同样适用于 Beancount BQL。

DIN-SQL 通过 schema-link 和自校正阶段,将 GPT-4 在 Spider 上的执行准确率从 67.4% 提升至 85.3%——这种分解同样适用于 Beancount BQL。

在BIRD上,GPT-4在领域提示下达到54.89%的执行准确率,无提示时为34.88%——这是任何Beancount NL→BQL界面必须缩小的20个百分点的差距。

CMU 和北卡罗来纳州立大学的研究人员提出利用系统理论过程分析 (STPA) 和能力增强的模型上下文协议 (MCP) 为 LLM 智能体工具使用推导形式化安全规范,并通过基于 Alloy 的验证在日历调度案例研究中证明了不存在不安全流。

微软的GraphRAG在多文档账查询中声称比向量RAG有72–83%的理解优势;2025年审计在修正裁判偏差后,这些优势消失——多文档账查询需谨慎。

FinAuditing 在 1,102 个真实 SEC XBRL 申报实例上对 13 个大语言模型进行了零样本测试;财务数学验证的最高分仅为 13.86%,概念检索的最高分为 12.42% —— 这些结果直接限制了在没有外部工具的情况下,可以信任 AI 会计工具自动执行的任务范围。

InvestorBench:Qwen2.5-72B以46.15%的CR引领股票交易;金融调优的Palmyra-Fin在股票上适得其反——规模胜过领域微调。

StructRAG (ICLR 2025) 在推理前根据每个查询将路由到适当的任务结构类型(表格、图、目录、算法或分块),在 Loong 基准测试中比 GraphRAG 高出 28 分,且运行速度快 22 倍,仅 DPO 训练的路由模型就带来了 15 分的准确率提升。

在相同的思考预算下,单代理LLM在多跳推理上等同于或超越多智能体系统——更倾向于简单的金融代理设计。

M3MAD-Bench 对 9 个模型、5 个领域以及视觉语言设置下的多智能体辩论进行了压力测试,发现“集体幻觉”导致了 65% 的失败,对抗性辩论使准确率下降了高达 12.8%,而自我一致性通常能以更低的 Token 成本达到与辩论相当的准确率。

AGrail (ACL 2025) 引入了一种双 LLM 协作护栏,通过测试时自适应(TTA)在推理阶段调整安全检查。在 Safe-OS 上实现了 0% 的提示注入攻击成功率和 95.6% 的良性操作保留率——相比之下,GuardAgent 和 LLaMA-Guard 拦截了高达 49.2% 的合法操作。

ShieldAgent (ICML 2025) 使用基于马尔可夫逻辑网络构建的概率规则电路取代了基于 LLM 的护栏,在针对智能体攻击的防御中实现了 90.4% 的准确率,同时 API 调用减少了 64.7% —— 以及这对金融 AI 系统中可验证安全的意义。

Atlas (JMLR 2023) 在仅有 64 个训练样本的情况下,在 Natural Questions 上实现了 42.4% 的准确率——以 11B 参数击败了拥有 540B 参数的 PaLM 模型 3 个百分点。该模型通过联合预训练基于 Contriever 的稠密检索器和基于 T5 的 Fusion-in-Decoder 阅读器实现。本文分析涵盖了检索准确率限制、587GB 索引基础设施成本,以及对 Beancount 账本问答系统的影响。