LOG-009介绍了PAL,它将算术运算外包给Python解释器,使模型永远不必自己计算。自洽性则解决一个正交问题:如果模型大多数时候推理正确,但并非总是如此,该怎么办?答案被证明是统计性的而非架构性的——而且出奇地有效。
论文
《自洽性提升语言模型中的思维链推理》由Xuezhi Wang、Jason Wei、Dale Schuurmans、Quoc Le、Ed Chi、Sharan Narang、Aakanksha Chowdhery和Denny Zhou撰写(ICLR 2023,arXiv:2203.11171),提出了一种解码策略,用对多条采样路径的多数投票取代单条贪婪的思维链路径。其直觉很简洁:一个困难的推理问题通常有一个正确答案,但有多条有效路径可以到达;错误答案更可能来自特殊的错误,而这些错误不会都汇聚到同一个错误上。
该方法是即插即用的。拿你已有的任何思维链(CoT)提示,在非零温度下采样N条补全,从每条中提取最终答案,然后返回多数答案。无需微调、无需额外模型、无需额外的人工标注。
关键思想
- 采样规模与温度:论文对每个问题使用40条推理路径,温度为0.7。这不是超参数搜索得出的神奇数字——消融实验显示收益在20–30个样本左右趋于平稳,所以40是一个保守的选择。
- 相对于标准CoT的主要提升:GSM8K +17.9%,SVAMP +11.0%,AQuA +12.2%,StrategyQA +6.4%,ARC-challenge +3.9%——在相同模型和提示下的绝对准确率提升。
- GSM8K按模型的结果:在text-davinci-002(GPT-3)上,自洽性将准确率从78.7%提升到86.5%。在Codex上,从74.5%提升到82.3%。收益在不同模型家族中保持一致。
- 无训练成本:一切都在推理时发生。该方法适用于任何可以在温度>0下采样的黑盒API。
- 可提取答案的多数投票:当答案是离散的(数字、字母选项)时,聚合是干净的。对于开放式生成,论文对定义“最一致”不够具体——这是作者承认的一个局限。
哪些成立——哪些不成立
经验上的收益是真实的、被广泛复现的,而且该方法确实有用。但几个结构性弱点值得关注。
首先,成本随样本数量线性增长。在推理时采样40条路径的token预算是单条路径的40倍。对于延迟和API成本重要的任务——比如一个代理每晚处理数百笔交易——这不是免费的。后续工作(早停自洽性,ICLR 2024)解决了这个问题:一旦投票达到置信度阈值就停止,可以在GSM8K上减少80%的样本且没有可测量的准确率损失。基础论文完全没有讨论成本,这是一个奇怪的遗漏。
其次,当模型系统性错误时,多数投票假设会崩溃。如果模型在所有40条路径中都一致地误读货币换算或误用税务规则,错误答案就会赢得投票。自洽性放大的是最常见的错误,而不是正确的那个。这是核心的认识论缺口:该方法提高了模型信念分布内部的精确度,但当该分布以错误答案为中心时,对校准毫无帮助。
第三,Wang & Wang(2025,arXiv:2503.16974)在50次独立运行中直接研究了LLM在金融和会计任务上的一致性。他们发现二分类和情感分析在单次采样下已经几乎完全可复现,而复杂任务(预测、生成)表现出真实的变异性。他们的实用发现:聚合仅3–5次运行就能显著提高复杂任务的一致性——这是同一自洽性思想的一个更便宜的版本。
为什么这对金融AI很重要
涉及多步算术的Beancount账本操作——税务计算、外汇调整后的成本基础、摊销计划、发票匹配——正是单次贪婪解码不可靠的任务,而正确答案是唯一且可验证的。自洽性是一种廉价的干预措施,对于任何输出可以被检查的金融代理任务(余额是否仍然为零?),它都应该是标准做法。
更有趣的含义是架构性的。自洽性将推理变成了一个投票集成。对于写回安全——代理将日记账分录过账到账本中——我会以多数置信度为门槛:只有40条路径中的35条一致时才过账。分歧是代理应该升级给人类而不是写入的信号。这是一个具体、可实施的安全过滤器,消耗的是推理预算,而不是工程复杂度。
系统性偏差的失败模式在税务和监管规则中尤其重要,因为已知模型会幻觉出特定司法管辖区的细节。在这些情况下,PAL(LOG-009)是正确的修复方法:完全外包计算。自洽性和PAL互为补充——PAL处理算术正确性;自洽性处理模糊性和推理可靠性。
接下来读什么
- 思维树:用大型语言模型进行深思熟虑的问题解决(Yao等人,2023,arXiv:2305.10601)——将自洽性从对路径的投票扩展到对路径的搜索,这在推理空间分支而非并行运行时很重要。
- 逃离天价成本:多步推理的早停自洽性(Lei等人,ICLR 2024)——成本问题的修复方案;在GSM8K上减少超过80%的采样同时保持准确率。
- 大型语言模型的通用自洽性(Chen等人,arXiv:2311.17311)——用LLM评判器将多数投票扩展到开放式生成,填补了原始论文留下的聚合空白。





