پرش به محتوای اصلی

وبلاگ پژوهش Bean Labs

خودسازگاری: نمونهبرداری با رأی اکثریت دقت زنجیرهٔ اندیشه را بهبود میبخشد

منتشر شده آخرین بهروزرسانی زمان مطالعه 5 دقیقهMike ThriftMike Thrift
خودسازگاری: نمونهبرداری با رأی اکثریت دقت زنجیرهٔ اندیشه را بهبود میبخشد

مقاله: https://arxiv.org/abs/2203.11171

فهرست مطالب این صفحه

LOG-009 پال (PAL) را پوشش داد، که محاسبات را به یک مفسر پایتون واگذار می‌کند تا مدل هرگز مجبور به محاسبه نباشد. خودسازگاری به یک مشکل متعامد حمله می‌کند: چه می‌شود اگر مدل در بیشتر مواقع درست استدلال کند، اما نه همیشه؟ پاسخ آماری به نظر می‌رسد تا معماری — و به‌طور شگفت‌آوری مؤثر است.

مقاله​

«خودسازگاری استدلال زنجیرهٔ اندیشه را در مدل‌های زبانی بهبود می‌بخشد» نوشتهٔ ژوژی وانگ، جیسون وی، دیل شورمانس، کوک له، اد چی، شاران نارانگ، آکانکشا چودری و دنی ژو (ICLR ۲۰۲۳، arXiv:2203.11171) یک استراتژی رمزگشایی معرفی می‌کند که یک مسیر زنجیرهٔ اندیشهٔ حریصانهٔ واحد را با رأی اکثریت بر بسیاری از مسیرهای نمونه‌برداری‌شده جایگزین می‌کند. شهود آن فشرده است: یک مسئلهٔ استدلال سخت معمولاً یک پاسخ درست دارد اما مسیرهای معتبر بسیاری به آن می‌رسد؛ پاسخ اشتباه به احتمال بیشتر از خطاهای خاص نشأت می‌گیرد که همگی به یک اشتباه واحد همگرا نمی‌شوند.

این روش آمادهٔ استفاده است. هر درخواست زنجیرهٔ اندیشه (CoT) را که دارید بردارید، N تکمیل را با دمای غیرصفر نمونه‌برداری کنید، پاسخ نهایی را از هر کدام استخراج کنید و پاسخ اکثریت را برگردانید. هیچ تنظیم دقیقی، هیچ مدل اضافه، هیچ برچسب انسانی اضافه‌ای لازم نیست.

ایده‌های کلیدی​

  • اندازهٔ نمونه و دما: مقاله از ۴۰ مسیر استدلال برای هر مسئله با دمای ۰/۷ استفاده می‌کند. این عدد جادویی از جستجوی فراپارامتر نیست — حذف‌ها نشان می‌دهند که بهبودها در حدود ۲۰ تا ۳۰ نمونه به فلات می‌رسند، پس ۴۰ یک انتخاب محافظه‌کارانه است.
  • بهبودهای اصلی نسبت به CoT استاندارد: GSM8K +17.9٪، SVAMP +11.0٪، AQuA +12.2٪، StrategyQA +6.4٪، ARC-challenge +3.9٪ — همه بهبودهای دقت مطلق با همان مدل و درخواست.
  • نتایج GSM8K بر اساس مدل: روی text-davinci-002 (GPT-3)، خودسازگاری دقت را از ۷۸/۷٪ به ۸۶/۵٪ می‌برد. روی Codex، از ۷۴/۵٪ به ۸۲/۳٪. بهبودها در خانواده‌های مدل سازگار است.
  • هزینهٔ بدون آموزش: همه‌چیز در زمان استنتاج اتفاق می‌افتد. این رویکرد با هر API جعبه سیاهی که می‌توانید در دمای > ۰ نمونه‌برداری کنید کار می‌کند.
  • رأی اکثریت برای پاسخ‌های قابل استخراج: تجمیع زمانی تمیز است که پاسخ‌ها گسسته باشند (یک عدد، یک انتخاب حرفی). برای تولید متن‌باز مقاله در تعریف «سازگارترین» کمتر مشخص است — محدودیتی که نویسندگان اذعان می‌کنند.

چه چیزی پایدار است — و چه چیزی نه​

بهبودهای تجربی واقعی هستند، به‌طور گسترده تکرار شده‌اند، و روش واقعاً مفید است. اما چند ضعف ساختاری شایستهٔ توجه هستند.

اول، هزینه به‌صورت خطی با تعداد نمونه‌ها افزایش می‌یابد. نمونه‌برداری ۴۰ مسیر در استنتاج ۴۰ برابر بودجهٔ توکن یک مسیر واحد هزینه دارد. برای کارهایی که تأخیر و هزینهٔ API مهم است — عاملی که شبانه صدها تراکنش پردازش می‌کند — این رایگان نیست. کارهای دنباله‌دار (خودسازگاری با توقف زودهنگام، ICLR ۲۰۲۴) به این می‌پردازند: با توقف یک‌بار که رأی به آستانهٔ اطمینان برسد، می‌توانید نمونه‌ها را ۸۰٪ در GSM8K بدون از دست دادن دقت قابل اندازه‌گیری کاهش دهید. مقالهٔ اصلی اصلاً هزینه را بحث نمی‌کند، که یک غفلت عجیب است.

دوم، فرض رأی اکثریت زمانی فرو می‌ریزد که مدل به‌طور سیستماتیک اشتباه کند. اگر مدل به‌طور مداوم یک تبدیل ارز را اشتباه بخواند یا یک قانون مالیاتی را در همهٔ ۴۰ مسیر اشتباه اعمال کند، پاسخ اشتباه در رأی برنده می‌شود. خودسازگاری رایج‌ترین خطا را تقویت می‌کند، نه خطای درست را. این شکاف معرفت‌شناختی مرکزی است: روش دقت را در توزیع باور مدل افزایش می‌دهد، اما برای کالیبراسیون وقتی آن توزیع بر پاسخ اشتباه متمرکز است هیچ کاری نمی‌کند.

سوم، وانگ و وانگ (۲۰۲۵، arXiv:2503.16974) سازگاری مدل زبانی بزرگ را مستقیماً بر وظایف مالی و حسابداری در ۵۰ اجرای مستقل مطالعه می‌کنند. آن‌ها می‌یابند که طبقه‌بندی دودویی و تحلیل احساسات در حال حاضر با یک نمونه تقریباً کاملاً تکرارپذیرند، در حالی که وظایف پیچیده (پیش‌بینی، تولید) تنوع واقعی نشان می‌دهند. یافتهٔ عملی آن‌ها: تجمیع فقط ۳ تا ۵ اجرا به‌طور چشمگیری سازگاری وظایف پیچیده را بهبود می‌بخشد — نسخهٔ بسیار ارزان‌تری از همان ایدهٔ خودسازگاری.

چرا برای هوش مصنوعی مالی اهمیت دارد​

عملیات دفتر کل Beancount که شامل محاسبات چندمرحله‌ای هستند — محاسبات مالیات، مبنای هزینهٔ تعدیل‌شده با ارز، برنامه‌های استهلاک، تطبیق فاکتور — دقیقاً کارهایی هستند که رمزگشایی حریصانهٔ واحد غیرقابل‌اعتماد است، با این حال پاسخ درست یکتا و قابل بررسی است. خودسازگاری یک مداخلهٔ ارزان است که باید برای هر وظیفهٔ عامل مالی که خروجی آن قابل بررسی است استاندارد باشد (آیا موجودی هنوز صفر است؟).

پیامد جالب‌تر معماری است. خودسازگاری استنتاج را به یک مجموعه رأی‌گیری تبدیل می‌کند. برای ایمنی نوشتن مجدد — عاملی که ورودی‌های دفتر را در یک دفتر کل ثبت می‌کند — من بر اطمینان اکثریت دروازه می‌گذارم: فقط ثبت کن اگر ۳۵ از ۴۰ مسیر موافق باشند. اختلاف یک سیگنال است که عامل باید به جای نوشتن به انسان ارجاع دهد. این یک فیلتر ایمنی مشخص و قابل پیاده‌سازی است که بودجهٔ استنتاج هزینه دارد، نه پیچیدگی مهندسی.

حالت شکست سوگیری سیستماتیک به‌ویژه برای قوانین مالیات و نظارتی مهم است، جایی که مدل‌ها شناخته‌شده‌اند جزئیات مختص حوزهٔ قضایی را توهم می‌زنند. در آن موارد پال (LOG-009) راه‌حل درست است: محاسبه را کاملاً واگذار کن. خودسازگاری و پال مکمل یکدیگرند — پال درستی محاسبات را مدیریت می‌کند؛ خودسازگاری ابهام و قابلیت اطمینان استدلال را مدیریت می‌کند.

چه چیزی بعد بخوانید​

  • درخت اندیشه‌ها: حل مسئلهٔ عمدی با مدل‌های زبانی بزرگ (یائو و همکاران، ۲۰۲۳، arXiv:2305.10601) — خودسازگاری را از رأی‌گیری بر مسیرها به جستجو بر مسیرها گسترش می‌دهد، که زمانی مهم است که فضای استدلال شاخه می‌شود به جای موازی اجرا شود.
  • فرار از هزینهٔ سرسام‌آور: خودسازگاری با توقف زودهنگام برای استدلال چندمرحله‌ای (لی و همکاران، ICLR ۲۰۲۴) — راه‌حل مشکل هزینه؛ نمونه‌برداری را بیش از ۸۰٪ در GSM8K کاهش می‌دهد در حالی که دقت حفظ می‌شود.
  • خودسازگاری جهانی برای مدل‌های زبانی بزرگ (چن و همکاران، arXiv:2311.17311) — رأی اکثریت را به تولید متن‌باز با یک داور مدل زبانی بزرگ گسترش می‌دهد، شکاف تجمیع را که مقالهٔ اصلی باز می‌گذارد می‌بندد.

منبع: https://beancount.io/fa/bean-labs/research-logs/2026/04/24/self-consistency-chain-of-thought

منتشر شده: ۴ اردیبهشت ۱۴۰۵

آخرین بهروزرسانی: ۲۳ شهریور ۱۴۰۵