Le LOG-009 couvrait PAL, qui délègue l'arithmétique à un interpréteur Python afin que le modèle n'ait jamais à calculer lui-même. L'auto-cohérence attaque un problème orthogonal : que faire si le modèle raisonne correctement la plupart du temps, mais pas toujours ? La réponse s'avère être statistique plutôt qu'architecturale — et étonnamment efficace.
L'article
« Self-Consistency Improves Chain of Thought Reasoning in Language Models » de Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery et Denny Zhou (ICLR 2023, arXiv:2203.11171) introduit une stratégie de décodage qui remplace un unique chemin glouton en chaîne de pensée par un vote majoritaire sur de nombreux chemins échantillonnés. L'intuition est concise : un problème de raisonnement difficile possède généralement une seule réponse correcte mais de nombreuses voies valides pour y parvenir ; une réponse erronée provient plus probablement d'erreurs idiosyncrasiques qui ne convergent pas toutes vers la même faute.
La méthode est prête à l'emploi. Prenez n'importe quelle invite en chaîne de pensée (CoT) que vous avez déjà, échantillonnez N complétions à température non nulle, extrayez la réponse finale de chacune, et renvoyez la réponse majoritaire. Pas de fine-tuning, pas de modèles supplémentaires, pas de nouvelles étiquettes humaines.
Idées clés
- Taille d'échantillon et température : L'article utilise 40 chemins de raisonnement par problème à une température de 0,7. Ce n'est pas un nombre magique issu d'une recherche d'hyperparamètres — les ablations montrent que les gains plafonnent autour de 20 à 30 échantillons, donc 40 est un choix conservateur.
- Principaux gains par rapport au CoT standard : GSM8K +17,9 %, SVAMP +11,0 %, AQuA +12,2 %, StrategyQA +6,4 %, ARC-challenge +3,9 % — toutes des améliorations absolues de précision avec le même modèle et la même invite.
- Résultats GSM8K par modèle : Sur text-davinci-002 (GPT-3), l'auto-cohérence améliore la précision de 78,7 % à 86,5 %. Sur Codex, de 74,5 % à 82,3 %. Les gains sont cohérents entre les familles de modèles.
- Aucun coût d'entraînement : Tout se passe au moment de l'inférence. L'approche fonctionne avec n'importe quelle API en boîte noire où vous pouvez échantillonner à température > 0.
- Vote majoritaire pour les réponses extractibles : L'agrégation est propre lorsque les réponses sont discrètes (un nombre, un choix de lettre). Pour la génération en texte libre, l'article est moins précis sur la définition du « plus cohérent » — une limitation que les auteurs reconnaissent.
Ce qui tient — et ce qui ne tient pas
Les gains empiriques sont réels, largement répliqués, et la méthode est véritablement utile. Mais plusieurs faiblesses structurelles méritent l'attention.
Premièrement, le coût augmente linéairement avec le nombre d'échantillons. Échantillonner 40 chemins lors de l'inférence coûte 40 fois le budget de tokens d'un chemin unique. Pour les tâches où la latence et le coût API importent — un agent traitant des centaines de transactions par nuit — cela n'est pas gratuit. Des travaux ultérieurs (Early-Stopping Self-Consistency, ICLR 2024) abordent cela : en s'arrêtant dès qu'un vote atteint un seuil de confiance, vous pouvez réduire les échantillons de 80 % sur GSM8K sans perte mesurable de précision. L'article de base ne discute pas du coût du tout, ce qui est une omission étrange.
Deuxièmement, l'hypothèse du vote majoritaire s'effondre lorsque le modèle est systématiquement erroné. Si le modèle méinterprète constamment une conversion de devise ou applique mal une règle fiscale sur les 40 chemins, la réponse fausse remporte le vote. L'auto-cohérence amplifie l'erreur la plus courante, pas la correcte. C'est la lacune épistémologique centrale : la méthode améliore la précision dans la distribution de croyance du modèle, mais ne fait rien pour la calibration lorsque cette distribution est centrée sur la mauvaise réponse.
Troisièmement, Wang & Wang (2025, arXiv:2503.16974) étudient directement la cohérence des LLM sur des tâches financières et comptables à travers 50 exécutions indépendantes. Ils constatent que la classification binaire et l'analyse de sentiment sont déjà presque parfaitement reproductibles avec un seul échantillon, tandis que les tâches complexes (prévision, génération) montrent une réelle variabilité. Leur conclusion pratique : agréger seulement 3 à 5 exécutions améliore considérablement la cohérence sur les tâches complexes — une version bien moins coûteuse de la même idée d'auto-cohérence.
Pourquoi cela importe pour l'IA financière
Les opérations de grand livre Beancount impliquant une arithmétique multi-étapes — calculs fiscaux, base de coût ajustée pour le change, échéanciers d'amortissement, rapprochement de factures — sont exactement les tâches où un décodage glouton unique n'est pas fiable, alors que la réponse correcte est unique et vérifiable. L'auto-cohérence est une intervention peu coûteuse qui devrait être standard pour toute tâche d'agent financier où la sortie peut être vérifiée (le solde est-il toujours à zéro ?).
L'implication la plus intéressante est architecturale. L'auto-cohérence transforme l'inférence en un ensemble de vote. Pour la sécurité des écritures — un agent enregistrant des écritures de journal dans un grand livre — je conditionnerais sur la confiance majoritaire : n'enregistrer que si 35 des 40 chemins s'accordent. Le désaccord est un signal que l'agent doit escalader vers un humain plutôt que d'écrire. C'est un filtre de sécurité concret et implémentable qui coûte du budget d'inférence, pas de la complexité technique.
Le mode de défaillance du biais systématique importe particulièrement pour les règles fiscales et réglementaires, où l'on sait que les modèles hallucinent des détails spécifiques à la juridiction. Dans ces cas, PAL (LOG-009) est la bonne solution : décharger entièrement le calcul. L'auto-cohérence et PAL se complètent — PAL gère la correction arithmétique ; l'auto-cohérence gère l'ambiguïté et la fiabilité du raisonnement.
Que lire ensuite
- Tree of Thoughts : Deliberate Problem Solving with Large Language Models (Yao et al., 2023, arXiv:2305.10601) — étend l'auto-cohérence du vote sur les chemins à la recherche sur les chemins, ce qui importe lorsque l'espace de raisonnement bifurque plutôt que de s'exécuter en parallèle.
- Escape Sky-high Cost : Early-stopping Self-Consistency for Multi-step Reasoning (Lei et al., ICLR 2024) — la solution au problème de coût ; réduit l'échantillonnage de plus de 80 % sur GSM8K tout en préservant la précision.
- Universal Self-Consistency for Large Language Models (Chen et al., arXiv:2311.17311) — étend le vote majoritaire à la génération en texte libre avec un juge LLM, comblant la lacune d'agrégation que l'article original laisse ouverte.





