
Fusion-in-Decoder:多篇章检索如何提升生成式问答性能
Izacard 和 Grave 的 FiD 架构独立编码检索到的篇章,然后在解码器中进行融合,在 NQ 和 TriviaQA 数据集上比 RAG-Sequence 高出 4–11 分。本文探讨了该设计及其对 Beancount 账本问答的启示,在这类场景中,跨交易的多分录综合是常态。

Izacard 和 Grave 的 FiD 架构独立编码检索到的篇章,然后在解码器中进行融合,在 NQ 和 TriviaQA 数据集上比 RAG-Sequence 高出 4–11 分。本文探讨了该设计及其对 Beancount 账本问答的启示,在这类场景中,跨交易的多分录综合是常态。

GuardAgent (ICML 2025) places a separate LLM agent between a target agent and its environment, verifying every proposed action by generating and running Python code — achieving 98.7% policy enforcement accuracy while preserving 100% task completion, versus 81% accuracy and 29–71% task failure for prompt-embedded safety rules.

深入解读 Du 等人的 ICML 2024 多智能体辩论论文——该研究报告称算术准确率提升了 14.8 个百分点——同时参考了 2025 年的反驳研究(显示在同等预算下,单智能体表现与辩论持平),并分析了为何集体幻觉(占辩论失败案例的 65%)会对 AI 辅助的账本提交构成特定风险。

一篇 NeurIPS 2024 Spotlight 论文对三种基于 LLM 的时间序列预测方法(OneFitsAll、Time-LLM 和 CALF)进行了消融实验,发现移除语言模型在大多数情况下能提高准确度,且训练速度最高可提升 1,383 倍。对于 Beancount 余额预测等金融 AI 应用,轻量级的专用模型表现始终优于改造成的 LLM。

AuditCopilot 将开源大语言模型(Mistral-8B、Gemma、Llama-3.1)应用于企业分录欺诈检测,将误报从 942 个削减至 12 个——但消融实验显示,LLM 主要作为孤立森林(Isolation Forest)得分之上的综合层,而非独立的异常检测器。

TAT-LLM 通过 LoRA 在金融表格文本问答基准上对 LLaMA 2 7B 进行微调,在 FinQA 上实现了 64.60% 的精确匹配率(EM)——超过了 GPT-4 的 63.91% ——其原理是将推理分解为确定的“提取-推理-执行”步骤,从而消除了算术错误。

对 7B 参数 LLM 进行的 RAG 与无监督微调的实证比较显示,RAG 在知识截止日期后的事实准确率达到了 0.875 以上,而微调则停滞在 0.504 —— 这对 Beancount 智能体设计及任何需要频繁更新知识的系统具有直接意义。

IRCoT 将 BM25 检索与思维链推理循环的每一步交织在一起,在 HotpotQA 数据集上相比单步 RAG 实现了 +11.3 的检索召回率和 +7.1 的 F1 分数提升,并证明了当检索策略正确时,3B 模型可以击败 GPT-3 175B。

FLARE (EMNLP 2023) 通过在生成过程中利用词元概率置信度阈值触发检索,在标准 RAG 基础上进行了改进。在 2WikiMultihopQA 任务中,它达到了 51.0 EM,而单次检索仅为 39.4。然而,指令微调聊天模型中的校准失效限制了其在生产级财务智能体中的可靠性。

Lewis 等人使用冻结的 FAISS 索引在 Natural Questions 上达到 44.5 EM;对于 Beancount 账本,这意味着当余额每日变化时,要么重新索引,要么错过。

MultiHiertt (ACL 2022) 引入了来自真实财务报告的 10,440 个问答对,每份报告平均包含 3.89 个层级表;最先进的模型 F1 分数为 38%,而人类为 87%,且跨表问题的得分下降了 15 个百分点——这量化了金融人工智能必须弥补的检索差距。

ConvFinQA最佳模型得分为68.9%的执行准确率,而人类专家为89.4%——这一21个百分点的差距仍是多轮账本对话面临的挑战。