
TAT-QA:针对财务年报推理的混合表格-文本问答基准
TAT-QA 是一个包含 16,552 个问题的基准测试,涵盖了财务报表中混合表格与文本的语境。该研究证明证据定位(而非算术)是财务 AI 的核心瓶颈;到 2024 年,微调后的 7B 参数量 LLM 已达到 83% 的 F1 分数,基本缩小了与 91% 人类上限的差距。

TAT-QA 是一个包含 16,552 个问题的基准测试,涵盖了财务报表中混合表格与文本的语境。该研究证明证据定位(而非算术)是财务 AI 的核心瓶颈;到 2024 年,微调后的 7B 参数量 LLM 已达到 83% 的 F1 分数,基本缩小了与 91% 人类上限的差距。

FinQA (EMNLP 2021) 基于标准普尔 500 强企业的收益报告构建了 8,281 个问答对,这些问答需要多步算术程序。发布时,神经模型的得分为 61%,而人类专家为 91%;在三步及以上的程序中,准确率骤降至 22%。其失败模式——领域常数、跨模态锚定、推理链长度——直接对应了当今 Beancount 代理所面临的挑战。

FinanceBench 针对来自真实 SEC 备案文件的 10,231 个问题评估了 16 种 AI 配置;共享向量存储 RAG 的正确率仅为 19%,即使是拥有“金标准”段落的 GPT-4-Turbo,准确率也仅达到 85% —— 这表明数值推理而非检索才是企业财务 AI 的核心瓶颈。

DSPy 用声明式签名和指标驱动的编译器替换了手工编写的提示字符串——将 Llama2-13b 在 GSM8K 数学推理上的表现从 9.4% 提升到 46.9%,并为生产级金融 AI 管道提供了一条更具可维护性的路径。

LATS(语言智能体树搜索,ICML 2024)将ReAct、思维树和Reflexion统一到一个MCTS框架中,在HumanEval上使用GPT-4达到92.7%的pass@1。 对于基于git的Beancount账本,限制LATS在生产环境中应用的状态回滚要求可以轻松满足。

Self-RAG (ICLR 2024 Oral) 训练语言模型决定何时进行检索,并使用四个反思令牌对其自身结果进行评分——在 PopQA 上达到 55.8%,在传记 FactScore 上达到 80.2,同时在五个基准测试中表现优于 ChatGPT。本文分析涵盖了其机制、消融实验结果、可复现性局限,以及对基于 Beancount 账本的金融 AI 智能体的启示。

Voyager的持久代码技能库无需微调即可发现3.3倍于先前SOTA的Minecraft物品——这是账本智能体需要的重用模式。

HippoRAG的OpenIE+PageRank记忆在2WikiMultiHopQA上达到89.1%的Recall@5,而ColBERTv2为68.2%——适用于多年账本的通路感知检索。

AgentBench(Liu 等人,ICLR 2024)在 8 个交互式环境中对 27 个 LLM 进行基准测试——GPT-4 综合得分 4.01,而最佳开源模型仅 0.96。三大主导失败模式(67.9% 的知识图谱失败源于超出任务限制、53.3% 的数据库失败源于格式错误、以及无效动作)直接对应在真实账本上部署 Beancount 写回智能体的风险。

彭博社在 5690 亿个金融数据 token 上训练了一个拥有 500 亿参数的大语言模型,并在情感分析和表格推理基准测试中击败了通用模型——然而 GPT-4 在没有任何金融特定预训练的情况下赶上了它。这项耗资 1000 万美元的实验揭示了领域预训练的权衡、数字的分词(tokenization)问题,以及为什么对于会计智能体来说,使用工具比依赖模型内部机制更可靠。

AutoGen(Wu 等,2023)引入了一个多智能体对话框架,其中由大语言模型(LLM)驱动的智能体通过传递消息来完成任务;双智能体设置将 MATH 基准测试的准确率从 55% 提升至 69%,而专门的 SafeGuard 智能体将不安全代码检测提高了多达 35 个 F1 分数——这些研究结果直接适用于构建安全、模块化的 Beancount 自动化流程。

Gorilla (Patil et al., NeurIPS 2024) 通过对检索到的 API 文档进行检索感知训练(Retriever-Aware Training),对 7B LLaMA 模型进行了微调,将幻觉率从 GPT-4 零样本下的 78% 降低到 11% —— 这对金融 AI 回写代理具有直接意义,因为错误的账户名称或正负号颠倒属于正确性故障,而不仅仅是干扰。