跳转到主要内容

会计领域AI基准测试:如何衡量你的大语言模型是否算对了数字

发布日期 阅读需 1 分钟Mike ThriftMike Thrift
会计领域AI基准测试:如何衡量你的大语言模型是否算对了数字

你的AI记账工具在你喝咖啡的功夫就处理了200张发票。快速、不知疲倦、信心满满——但其中可能有四十张是错的。2026年9月的一项调查发现,62%的金融服务专业人士表示,AI生成的错误已经送达客户手中,而93%的审计职能现在使用AI,但其中60%没有正式的AI战略。这两个数字之间的差距,就是账目错报、审计失败和尴尬客户对话的滋生之地。

令人不安的真相是:供应商引用的准确率是在干净、精心挑选的文档上测得的,而你的收件箱里恰恰不是这些东西。皱巴巴的收据、带三种货币行项目的多页发票、看起来像发票的贷项通知单、每季度都换格式的供应商——这才是真正的测试集。如果你在会计工作流程中的任何环节使用AI,你都需要自己的基准:一种可重复的方法来衡量模型做对了什么、做错了什么,以及它是改进了还是在悄悄退化。本指南将展示如何构建这样一个基准。

为什么“看起来对”不算衡量标准

大语言模型出错的方式与人类不同。一个疲惫的簿记员会把两位数字调换,错误看起来像错误。而一个LLM会自信地幻觉出一个看似合理的发票总额,格式化得漂漂亮亮,然后继续处理。正如一个花了数年时间测试文档提取模型的团队所说:模型无论如何都会给你一个自信的答案——没有推理,没有判断,只是读取数字,而且即使是最好的模型也无法达到100%的准确率。

这种失效模式有实际后果。审计师现在明确测试AI生成的工作底稿,而那些依赖AI输出却不进行佐证、测试和记录结论的公司,应预期在财务控制方面出现重大缺陷认定。财务报告中的幻觉数字很少看起来明显错误——一个捏造的行项目总额在模型同时生成的电子表格中仍然加得起。唯一的防御是测量:了解你的工具在你的文档上的实际错误率,并持续监控。

也有值得衡量的好消息。在与人类发票审核员的正面对比测试中,LLM在发票审批决策上达到了高达92%的准确率,超过了经验丰富的律师设定的72%上限——而且速度快了几个数量级,成本更低。AI在定义明确的提取任务上确实可以超越人类。基准测试的重点不是证明AI不好;而是找出你的AI在哪些方面表现出色,这样你就能自动化它擅长的部分,并监督它不擅长的部分。

值得基准测试的三项任务

会计AI能做很多事情,但三项任务承载了大部分风险和大部分工作量。分别对每项进行基准测试,因为一个在某一任务上表现出色的模型可能在另一任务上失败。

1. 发票提取

从PDF和扫描件中提取结构化字段——供应商名称、发票编号、日期、行项目、小计、税额、总计、货币。这是工作量最大的任务,也是基准测试最多的:像DocILE这样的公开测试集用55个发票字段对模型评分,即使是最前沿的模型也会有大约26%的字段失败。特别注意行项目、含税与不含税总额,以及多币种发票,这些地方错误集中。

2. 费用分类

将每笔交易分配到正确的账户或类别——餐饮与娱乐、供应品与设备、承包商付款与工资。这是一项伪装成标签任务的判断任务:“正确”答案取决于你的会计科目表和税务立场,所以这里的准确率总是相对于你的规则来衡量,而不是相对于一个通用标准。追踪每个类别的精确率和召回率,因为一个整体准确率为98%的模型可能仍会错误分类每一笔软件订阅。

3. 财务数据录入和过账

将源文档转换为实际的日记账分录——正确的账户、正确的借/贷方向、正确的金额、正确的期间。这是小错误会放大的任务:一笔错误分类的费用只是一个错误的单元格,但一笔错误过账的分录会流入你的试算平衡表、财务报表和纳税申报表。从头到尾进行基准测试,从文档到过账分录,而不是逐字段。

先构建你的真值测试集

一个基准的诚实程度取决于它的答案密钥。在测试任何模型之前,从你自己的工作流程中收集50到100份真实文档,并手动标记——要仔细,因为每个标记错误后来都会变成虚假失败。

目标是一个现实的组合,而不是一个干净的组合。一个好的真值测试集大约有三分之二的普通文档和三分之一的麻烦文档:低质量的手机扫描件、收据上的手写备注、多页发票、有几十个行项目的对账单、贷项凭单、外语发票,以及来自你最乱供应商的文档。一个已发表的发票代理评估恰好使用了这种拆分——35份干净发票和15份问题发票——而问题集正是所有有趣失败出现的地方。

在字段级别标记,而不只是“每份文档对错”。对每张发票,记录供应商、发票编号、开票日期、到期日期、每个行项目的数量和单价、小计、税额和总额。对费用,记录你当前会计科目表下的正确账户。将标记存储在简单的电子表格或JSON文件中,与你的账簿一起进行版本控制,这样你就能针对每个新模型或提示更改重新运行相同的测试。那个版本化的答案密钥才是持久的资产;模型来了又走。

抵制让AI标记自己测试集的诱惑。模型辅助标记对于初稿是可行的,但每个标记都必须由人类对照源文档进行验证。模型为自己编写的答案密钥是一面镜子,而不是一种测量。

真正重要的指标

供应商仪表板喜欢单一的头条数字。对于会计工作,你需要一小组指标,因为不同的错误成本不同。

字段级准确率是你的头条指标:在所有测试文档中,你要求的所有字段中,有多少比例与答案密钥完全匹配?要严格——“接近”在会计中不算数。$12,540不是$12,450,一个“帮忙”四舍五入、重新格式化或“纠正”日期的模型,是在未经许可的情况下编辑你的账簿。

完全匹配率是更严格的兄弟指标:有多少比例的文档每个字段都完全正确?这个数字预测了你的复核工作量。82%和94%的字段准确率听起来差别不大,直到你换算一下:82%意味着大约每五张发票就有一张需要人工处理;94%意味着十七分之一。

每个字段的精确率和召回率告诉你错误在哪里。精确率问:当模型填写这个字段时,它正确的频率是多少?召回率问:当字段存在于文档中时,模型找到它的频率是多少?发票总额的低精确率意味着编造的数字——危险。行项目的低召回率意味着跳过行——也危险,但至少可见。按字段细分,因为“95%准确”可能隐藏一个从不漏日期却经常编造税额的模型。

直通率是业务指标:有多少比例的文档从收件箱到过账分录零人工干预?结合OCR与LLM提取和确定性验证的构建良好的生产管道报告约77%的直通率和99%的字段级准确率——而且,同样重要的是,它们知道该把哪23%路由给人工。一个不衡量路由决策的基准只衡量了系统的一半。

每份文档的成本和延迟使画面完整。一个前沿模型得分高两分,但每张发票成本是二十倍,可能对复杂文档是值得的,对简单文档却不值得——但只有你的基准能告诉你这条线在哪里。在准确率旁边追踪每份文档的美元成本和秒数,否则你会在优化成绩的同时,发票处理账单翻了三倍。

如何运行测试

有了答案密钥和指标,程序很简单:

  1. 冻结测试集。 在测试任何东西之前锁定你的50到100份文档和标记。永远不要在模型失败后再向测试集添加文档——那会把测量变成训练。
  2. 盲测。 只给模型原始文档,使用与生产环境相同的提示和设置。没有提示、没有重试、没有挑选。
  3. 自动评分。 用脚本将输出与标记逐字段比较,而不是肉眼观察。自动化评分是让重新运行变得便宜的原因,而重新运行是整个重点。
  4. 分类每个错误。 在审核失败时构建错误分类法:幻觉字段(编造的值)、行项目互换、多供应商对账单上的错误供应商、含税与不含税的混淆、货币错误、日期格式重新解释、跳过页面。分类法中的模式变成你的修复清单——更好的提示、预处理步骤或验证规则。
  5. 添加验证层并重新测试。 性能最高的设置将LLM与确定性检查配对:行项目之和等于小计吗?小计加税等于总额吗?供应商在批准列表中吗?日期在开放的期间吗?在有和没有这些防护措施的情况下测量准确率,看看每层为你带来什么。
  6. 按计划重新运行。 模型会在你下面变化——供应商更新权重、弃用版本、无通知地调整行为。每月重新运行你的基准,并在切换模型、提示或预处理时随时运行。运行过一次的基准是纪念品;重新运行的基准是控制。

让基准说谎的错误

大多数自行评估以可预测的方式失败。避免这五个:

在五份干净发票上测试。 一个小而整齐的测试集证明模型能读取整齐的文档——这你早就知道了。如果你的测试集没有扫描件、没有手写、没有边缘情况,那么你的100%分数是在衡量你的测试集,而不是你的模型。

让模型给自己评分。 LLM作为评委的评分很方便,但系统性地慷慨,尤其是对模型自己的输出。如果你使用自动评判,每次运行都手动抽查一个样本,并使用与被测模型不同的模型作为评委。

只给标头评分而忽略行项目。 标头字段(供应商、日期、总额)是容易的部分。钱藏在行项目里——错误数量、丢失行、误读单价。一个跳过行项目的基准是在审计信封而忽略信纸。

混淆OCR准确率和提取准确率。 正确读取每个单词和把正确的数字放在正确的字段是两种不同的技能。传统OCR可以完美转录一页却不理解任何内容;LLM可以理解布局却误读一个模糊的数字。给结构化输出评分,而不是转录文本。

没有置信阈值。 不是每份文档都值得自动化。专业模式是选择性预测:系统自动过账高置信度的提取,将低置信度的路由给人工。你的基准应该找到阈值——低于该置信度分数,人工复核捕获的错误多于成本。跳过这一步意味着在审核一切(无节省)和信任一切(62%俱乐部)之间选择。

“足够好”是什么样的

基准只有在你知道如何解读分数时才有帮助。按层级思考:

  • 低于85%字段准确率: 仅辅助模式。模型起草,人工验证每个字段。仍然比手动录入快,但什么都不信任。
  • 85–95%: 有监督自动化。自动过账来自已知供应商的常规文档,其他所有内容——新供应商、大额、低置信度提取——路由给复核。这是大多数小企业应该运作的范围。
  • 高于95%并带验证防护: 标准文档直通处理,配合抽样审计(每月随机复检5–10%)以捕捉漂移。即使在这里,也保持硬规则:超过美元阈值不自动过账,不自动过账到已关闭期间,未经批准不添加新供应商。

上下文至关重要。92%AI准确率的发票审批决策可以击败72%的人类审核员——但审批是一个有人员兜底的判断,而将错误总额过账到你的分类账是一种无声的损坏。将自主权与可逆性匹配:错误越难撤销,要求就越高。

干净的账簿使测量成为可能

这是供应商跳过部分:没有一致的会计科目表,你无法基准测试费用分类;没有对账的账簿作为比较基础,你无法评分数据录入准确性。你的基准需要的真值集,本质上是一块维护良好的账簿——分类一致、完全对账、版本控制。簿记纪律良好的企业可以一个下午构建基准;而电子表格里有三个月未分类交易的企业根本构建不了,因为根本没有答案密钥。

这是双向的。同一个让你财务可审计的纯文本账簿也让你AI可测量:每个账户用文本定义,每笔分录可进行diff审核,每次更正可追踪。当模型建议一个分类时,你可以看到它遵循或违反了哪条规则。而且将账簿渲染为图表的可视化工具能让模型的错误——以及你自己的错误——一目了然;Fava仪表板随Beancount一起提供,将账簿分录变成你每月可以审核的余额和费用视图。如果你要让AI碰你的账簿,请把这些账簿保持在你真正能检查的格式中。

先测量再信任

AI在会计中的采用不再是问题——近九成会计专业人士将其用于客户工作,税务研究中的使用率同比翻倍——问题在于你是否在测量它对你有何作用。一个周末构建50份文档的基准,能买到任何供应商演示都买不到的东西:了解你的工具在你的文档上、在你的规则下的实际错误率——再加上一个可重新运行的控制,能在漂移到达你的客户或你的纳税申报表之前捕获它。

从小处开始:拉出五十张发票,手动标记,给你的当前工具评分,并分类它出错的地方。无论数字是多少,知道它都会让你领先于那60%没有战略就运行AI的审计职能。在会计AI中蓬勃发展的公司不会是最信任它的那些——而是最先测量它的那些。

将你的AI复核账簿保持在纯文本中

在基准测试和采用AI工具处理发票和费用追踪时,维护你可以检查的清晰财务记录仍然至关重要——一个你读不了的答案密钥根本不算答案密钥。Beancount.io提供纯文本会计,让你对财务数据有完全的透明度和控制——没有黑箱,没有供应商锁定。免费开始,看看为什么开发者和财务专业人士正在转向纯文本会计。

分享这篇文章

来源:https://beancount.io/zh/blog/2026/09/15/ai-benchmarking-accounting-llm-accuracy-invoice-expense-guide

发布日期: 2026年9月15日

阅读需 12 分钟

QuickBooks Bill Pay 现在能读取你的供应商邮件:AI 账单录入对 2026 年手动数据录入意味着什么

手动录入发票每张成本约 12.88 美元,从收到到付款平均耗时 17 天,而一流的自动化应付账款(AP)团队处理同一张发票只需不到 3 美元、约 3…

quickbooks
accounts-payable
阅读需 8 分钟

小型企业的AI应付账款自动化:成本、节省与如何选择

人工处理发票的成本为每张$13–$30,大约每10张发票中就有4张存在错误,超过一半的发票逾期支付。本指南详细拆解AI应付账款自动化究竟做了什么——采集、编码、…

accounts-payable
automation
阅读需 11 分钟

2026 年应付账款自动化:AI 发票捕获、三方匹配和无感审批如何降低处理成本并消除重复付款

2026 年的应付账款 (AP) 自动化通过结合 AI 发票捕获、三方匹配和基于规则的无感审批,将发票处理成本从约 18 美元和 10 天降低到 3 美元和…

accounts-payable
automation
阅读需 10 分钟

Ramp的会计代理与实时结账:自动编码记账对小企业意味着什么

Ramp的会计代理在交易发生的那一刻就对其进行编码,在后台审查100%的支出,并自动将常规项目同步到你的ERP——声称能快三倍地交出干净账本,每月节省超过40小…

ai
automation
阅读需 5 分钟

超越人为错误:AI 在纯文本记账中的异常检测

了解 AI 驱动的异常检测如何通过增强错误检测和保持透明度来改变纯文本记账,从而解决金融系统中的关键漏洞。

ai
fraud-detection