LOG-009 cubrió PAL, que descarga la aritmética a un intérprete de Python para que el modelo nunca tenga que calcular por sí mismo. La autoconsistencia ataca un problema ortogonal: ¿qué pasa si el modelo razona correctamente la mayoría de las veces, pero no siempre? La respuesta resulta ser estadística en lugar de arquitectónica — y sorprendentemente efectiva.
El artículo
"Self-Consistency Improves Chain of Thought Reasoning in Language Models" de Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery y Denny Zhou (ICLR 2023, arXiv:2203.11171) introduce una estrategia de decodificación que reemplaza una única ruta codiciosa de cadena de pensamiento con un voto mayoritario sobre muchas rutas muestreadas. La intuición es compacta: un problema de razonamiento difícil típicamente tiene una respuesta correcta pero muchas rutas válidas hacia ella; una respuesta incorrecta es más probable que provenga de errores idiosincrásicos que no convergen todos en el mismo error.
El método es plug-and-play. Toma cualquier prompt de cadena de pensamiento (CoT) que ya tengas, muestrea N completaciones a temperatura distinta de cero, extrae la respuesta final de cada una, y devuelve la respuesta mayoritaria. Sin fine-tuning, sin modelos adicionales, sin etiquetas humanas extra.
Ideas clave
- Tamaño de muestra y temperatura: El artículo usa 40 rutas de razonamiento por problema a temperatura 0.7. Este no es un número mágico de búsqueda de hiperparámetros — las ablaciones muestran que las ganancias se estabilizan alrededor de 20–30 muestras, así que 40 es una elección conservadora.
- Ganancias principales sobre CoT estándar: GSM8K +17.9%, SVAMP +11.0%, AQuA +12.2%, StrategyQA +6.4%, ARC-challenge +3.9% — todas mejoras absolutas de precisión con el mismo modelo y prompt.
- Resultados GSM8K por modelo: En text-davinci-002 (GPT-3), la autoconsistencia eleva la precisión del 78.7% al 86.5%. En Codex, del 74.5% al 82.3%. Las ganancias son consistentes entre familias de modelos.
- Sin costo de entrenamiento: Todo ocurre en tiempo de inferencia. El enfoque funciona con cualquier API de caja negra donde puedas muestrear a temperatura > 0.
- Votación mayoritaria para respuestas extraíbles: La agregación es limpia cuando las respuestas son discretas (un número, una opción de letra). Para generación de texto abierta, el artículo es menos específico sobre cómo definir "lo más consistente" — una limitación que los autores reconocen.
Qué se sostiene — y qué no
Las ganancias empíricas son reales, ampliamente replicadas, y el método es genuinamente útil. Pero varias debilidades estructurales merecen atención.
Primero, el costo escala linealmente con el número de muestras. Muestrear 40 rutas en inferencia cuesta 40× el presupuesto de tokens de una sola ruta. Para tareas donde la latencia y el costo de API importan — un agente procesando cientos de transacciones por noche — esto no es gratis. Trabajo de seguimiento (Early-Stopping Self-Consistency, ICLR 2024) aborda esto: al detenerse una vez que un voto alcanza un umbral de confianza, puedes reducir las muestras en un 80% en GSM8K sin pérdida medible de precisión. El artículo base no discute el costo en absoluto, lo cual es una omisión extraña.
Segundo, el supuesto de voto mayoritario se colapsa cuando el modelo está sistemáticamente equivocado. Si el modelo consistentemente malinterpreta una conversión de moneda o aplica mal una regla fiscal en las 40 rutas, la respuesta incorrecta gana el voto. La autoconsistencia amplifica el error más común, no el correcto. Esa es la brecha epistemológica central: el método mejora la precisión dentro de la distribución de creencias del modelo, pero no hace nada por la calibración cuando esa distribución está centrada en la respuesta incorrecta.
Tercero, Wang & Wang (2025, arXiv:2503.16974) estudian la consistencia de LLM directamente en tareas financieras y contables en 50 ejecuciones independientes. Encuentran que la clasificación binaria y el análisis de sentimiento ya son casi perfectamente reproducibles con una sola muestra, mientras que las tareas complejas (pronóstico, generación) muestran variabilidad real. Su hallazgo práctico: agregar solo 3–5 ejecuciones mejora dramáticamente la consistencia en tareas complejas — una versión mucho más económica de la misma idea de autoconsistencia.
Por qué esto importa para la IA financiera
Las operaciones de contabilidad Beancount que involucran aritmética de múltiples pasos — cálculos de impuestos, base de costo ajustada por FX, cronogramas de amortización, conciliación de facturas — son exactamente las tareas donde una única decodificación codiciosa no es confiable, sin embargo, la respuesta correcta es única y verificable. La autoconsistencia es una intervención económica que debería ser estándar para cualquier tarea de agente financiero donde la salida pueda verificarse (¿el saldo sigue en cero?).
La implicación más interesante es arquitectónica. La autoconsistencia convierte la inferencia en un conjunto de votación. Para seguridad de escritura — un agente publicando asientos de diario en un libro mayor — yo limitaría según la confianza mayoritaria: publicar solo si 35 de 40 rutas coinciden. El desacuerdo es una señal de que el agente debería escalar a un humano en lugar de escribir. Ese es un filtro de seguridad concreto e implementable que cuesta presupuesto de inferencia, no complejidad de ingeniería.
El modo de fallo de sesgo sistemático importa especialmente para reglas fiscales y regulatorias, donde se sabe que los modelos alucinan detalles específicos de jurisdicción. En esos casos, PAL (LOG-009) es el arreglo correcto: descargar el cálculo por completo. La autoconsistencia y PAL se complementan — PAL maneja la corrección aritmética; la autoconsistencia maneja la ambigüedad y la confiabilidad del razonamiento.
Qué leer a continuación
- Tree of Thoughts: Deliberate Problem Solving with Large Language Models (Yao et al., 2023, arXiv:2305.10601) — extiende la autoconsistencia de votar sobre rutas a buscar sobre rutas, lo cual importa cuando el espacio de razonamiento se ramifica en lugar de ejecutarse en paralelo.
- Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning (Lei et al., ICLR 2024) — el arreglo para el problema de costo; reduce el muestreo en más del 80% en GSM8K mientras preserva la precisión.
- Universal Self-Consistency for Large Language Models (Chen et al., arXiv:2311.17311) — extiende la votación mayoritaria a la generación de texto abierta con un juez LLM, cerrando la brecha de agregación que el artículo original deja abierta.





