Pular para o conteúdo principal

Registro de pesquisa do Bean Labs

Autoconsistência: Amostragem por Voto Majoritário Melhora a Precisão do Chain-of-Thought

Publicado Última atualização 5 min para lerMike ThriftMike Thrift
Autoconsistência: Amostragem por Voto Majoritário Melhora a Precisão do Chain-of-Thought

Artigo: https://arxiv.org/abs/2203.11171

Nesta página

O LOG-009 cobriu o PAL, que transfere a aritmética para um interpretador Python para que o modelo nunca precise calcular por si mesmo. A autoconsistência ataca um problema ortogonal: e se o modelo raciocina corretamente na maioria das vezes, mas nem sempre? A resposta acaba sendo estatística em vez de arquitetural — e surpreendentemente eficaz.

O artigo

"Self-Consistency Improves Chain of Thought Reasoning in Language Models" de Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery e Denny Zhou (ICLR 2023, arXiv:2203.11171) introduz uma estratégia de decodificação que substitui um único caminho ganancioso de chain-of-thought por um voto majoritário sobre muitos caminhos amostrados. A intuição é compacta: um problema de raciocínio difícil normalmente tem uma resposta correta, mas muitos caminhos válidos até ela; uma resposta errada tem mais probabilidade de vir de erros idiossincráticos que não convergem todos para o mesmo engano.

O método é plug-and-play. Pegue qualquer prompt de chain-of-thought (CoT) que você já tenha, amostre N conclusões em temperatura diferente de zero, extraia a resposta final de cada uma e retorne a resposta majoritária. Sem fine-tuning, sem modelos extras, sem rótulos humanos adicionais.

Ideias-chave

  • Tamanho da amostra e temperatura: O artigo usa 40 caminhos de raciocínio por problema em temperatura 0,7. Isso não é um número mágico de busca de hiperparâmetros — as ablações mostram que os ganhos se estabilizam em torno de 20–30 amostras, então 40 é uma escolha conservadora.
  • Principais ganhos sobre CoT padrão: GSM8K +17,9%, SVAMP +11,0%, AQuA +12,2%, StrategyQA +6,4%, ARC-challenge +3,9% — todas melhorias absolutas de precisão com o mesmo modelo e prompt.
  • Resultados GSM8K por modelo: Em text-davinci-002 (GPT-3), a autoconsistência eleva a precisão de 78,7% para 86,5%. Em Codex, de 74,5% para 82,3%. Os ganhos são consistentes entre famílias de modelos.
  • Custo zero de treinamento: Tudo acontece em tempo de inferência. A abordagem funciona com qualquer API de caixa-preta onde você possa amostrar em temperatura > 0.
  • Voto majoritário para respostas extraíveis: A agregação é limpa quando as respostas são discretas (um número, uma escolha de letra). Para geração de texto aberto, o artigo é menos específico sobre definir "mais consistente" — uma limitação que os autores reconhecem.

O que se sustenta — e o que não se sustenta

Os ganhos empíricos são reais, amplamente replicados, e o método é genuinamente útil. Mas várias fraquezas estruturais merecem atenção.

Primeiro, o custo escala linearmente com o número de amostras. Amostrar 40 caminhos em inferência custa 40× o orçamento de tokens de um único caminho. Para tarefas onde latência e custo de API importam — um agente processando centenas de transações por noite — isso não é grátis. Trabalhos posteriores (Early-Stopping Self-Consistency, ICLR 2024) abordam isso: ao parar quando um voto atinge um limite de confiança, você pode cortar amostras em 80% no GSM8K sem perda mensurável de precisão. O artigo base não discute custo de forma alguma, o que é uma omissão estranha.

Segundo, a suposição do voto majoritário colapsa quando o modelo está sistematicamente errado. Se o modelo consistentemente interpreta mal uma conversão de moeda ou aplica mal uma regra fiscal em todos os 40 caminhos, a resposta errada vence o voto. A autoconsistência amplifica o erro mais comum, não o correto. Essa é a lacuna epistemológica central: o método aumenta a precisão dentro da distribuição de crenças do modelo, mas não faz nada pela calibração quando essa distribuição está centrada na resposta errada.

Terceiro, Wang & Wang (2025, arXiv:2503.16974) estudam a consistência de LLMs diretamente em tarefas financeiras e contábeis em 50 execuções independentes. Eles descobrem que classificação binária e análise de sentimento já são quase perfeitamente reproduzíveis com uma única amostra, enquanto tarefas complexas (previsão, geração) mostram variabilidade real. Sua descoberta prática: agregar apenas 3–5 execuções melhora drasticamente a consistência em tarefas complexas — uma versão muito mais barata da mesma ideia de autoconsistência.

Por que isso importa para IA financeira

Operações de livro-razão Beancount que envolvem aritmética de múltiplas etapas — cálculos fiscais, base de custo ajustada por câmbio, cronogramas de amortização, correspondência de faturas — são exatamente as tarefas onde uma única decodificação gananciosa não é confiável, embora a resposta correta seja única e verificável. A autoconsistência é uma intervenção barata que deveria ser padrão para qualquer tarefa de agente financeiro onde a saída possa ser verificada (o saldo ainda é zero?).

A implicação mais interessante é arquitetural. A autoconsistência transforma inferência em um ensemble de votação. Para segurança de write-back — um agente lançando lançamentos contábeis em um livro-razão — eu bloquearia com base na confiança majoritária: lançar somente se 35 de 40 caminhos concordarem. Discordância é um sinal de que o agente deve escalar para um humano em vez de escrever. Esse é um filtro de segurança concreto e implementável que custa orçamento de inferência, não complexidade de engenharia.

O modo de falha por viés sistemático importa especialmente para regras fiscais e regulatórias, onde se sabe que modelos alucinam detalhes específicos de jurisdição. Nesses casos, o PAL (LOG-009) é a correção certa: transferir o cálculo inteiramente. Autoconsistência e PAL se complementam — o PAL lida com a correção aritmética; a autoconsistência lida com ambiguidade e confiabilidade de raciocínio.

O que ler a seguir

  • Tree of Thoughts: Deliberate Problem Solving with Large Language Models (Yao et al., 2023, arXiv:2305.10601) — estende a autoconsistência de votação sobre caminhos para busca sobre caminhos, o que importa quando o espaço de raciocínio se ramifica em vez de rodar em paralelo.
  • Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning (Lei et al., ICLR 2024) — a correção para o problema de custo; corta a amostragem em mais de 80% no GSM8K enquanto preserva a precisão.
  • Universal Self-Consistency for Large Language Models (Chen et al., arXiv:2311.17311) — estende o voto majoritário para geração de texto aberto com um juiz LLM, fechando a lacuna de agregação que o artigo original deixa em aberto.

Partilhar este artigo

Fonte: https://beancount.io/pt/bean-labs/research-logs/2026/04/24/self-consistency-chain-of-thought

Publicado: 24 de abril de 2026

Última atualização: 14 de setembro de 2026