پرش به محتوای اصلی

وبلاگ پژوهش Bean Labs

خودسازگاری: نمونهبرداری با رأی اکثریت دقت زنجیرهٔ اندیشه را بهبود میبخشد

منتشر شده آخرین بهروزرسانی زمان مطالعه 5 دقیقهMike ThriftMike Thrift
خودسازگاری: نمونهبرداری با رأی اکثریت دقت زنجیرهٔ اندیشه را بهبود میبخشد

مقاله: https://arxiv.org/abs/2203.11171

فهرست مطالب این صفحه

LOG-009 پال (PAL) را پوشش داد، که محاسبات را به یک مفسر پایتون واگذار می‌کند تا مدل هرگز مجبور به محاسبه نباشد. خودسازگاری به یک مشکل متعامد حمله می‌کند: چه می‌شود اگر مدل در بیشتر مواقع درست استدلال کند، اما نه همیشه؟ پاسخ آماری به نظر می‌رسد تا معماری — و به‌طور شگفت‌آوری مؤثر است.

مقاله

«خودسازگاری استدلال زنجیرهٔ اندیشه را در مدل‌های زبانی بهبود می‌بخشد» نوشتهٔ ژوژی وانگ، جیسون وی، دیل شورمانس، کوک له، اد چی، شاران نارانگ، آکانکشا چودری و دنی ژو (ICLR ۲۰۲۳، arXiv:2203.11171) یک استراتژی رمزگشایی معرفی می‌کند که یک مسیر زنجیرهٔ اندیشهٔ حریصانهٔ واحد را با رأی اکثریت بر بسیاری از مسیرهای نمونه‌برداری‌شده جایگزین می‌کند. شهود آن فشرده است: یک مسئلهٔ استدلال سخت معمولاً یک پاسخ درست دارد اما مسیرهای معتبر بسیاری به آن می‌رسد؛ پاسخ اشتباه به احتمال بیشتر از خطاهای خاص نشأت می‌گیرد که همگی به یک اشتباه واحد همگرا نمی‌شوند.

این روش آمادهٔ استفاده است. هر درخواست زنجیرهٔ اندیشه (CoT) را که دارید بردارید، N تکمیل را با دمای غیرصفر نمونه‌برداری کنید، پاسخ نهایی را از هر کدام استخراج کنید و پاسخ اکثریت را برگردانید. هیچ تنظیم دقیقی، هیچ مدل اضافه، هیچ برچسب انسانی اضافه‌ای لازم نیست.

ایده‌های کلیدی

  • اندازهٔ نمونه و دما: مقاله از ۴۰ مسیر استدلال برای هر مسئله با دمای ۰/۷ استفاده می‌کند. این عدد جادویی از جستجوی فراپارامتر نیست — حذف‌ها نشان می‌دهند که بهبودها در حدود ۲۰ تا ۳۰ نمونه به فلات می‌رسند، پس ۴۰ یک انتخاب محافظه‌کارانه است.
  • بهبودهای اصلی نسبت به CoT استاندارد: GSM8K +17.9٪، SVAMP +11.0٪، AQuA +12.2٪، StrategyQA +6.4٪، ARC-challenge +3.9٪ — همه بهبودهای دقت مطلق با همان مدل و درخواست.
  • نتایج GSM8K بر اساس مدل: روی text-davinci-002 (GPT-3)، خودسازگاری دقت را از ۷۸/۷٪ به ۸۶/۵٪ می‌برد. روی Codex، از ۷۴/۵٪ به ۸۲/۳٪. بهبودها در خانواده‌های مدل سازگار است.
  • هزینهٔ بدون آموزش: همه‌چیز در زمان استنتاج اتفاق می‌افتد. این رویکرد با هر API جعبه سیاهی که می‌توانید در دمای > ۰ نمونه‌برداری کنید کار می‌کند.
  • رأی اکثریت برای پاسخ‌های قابل استخراج: تجمیع زمانی تمیز است که پاسخ‌ها گسسته باشند (یک عدد، یک انتخاب حرفی). برای تولید متن‌باز مقاله در تعریف «سازگارترین» کمتر مشخص است — محدودیتی که نویسندگان اذعان می‌کنند.

چه چیزی پایدار است — و چه چیزی نه

بهبودهای تجربی واقعی هستند، به‌طور گسترده تکرار شده‌اند، و روش واقعاً مفید است. اما چند ضعف ساختاری شایستهٔ توجه هستند.

اول، هزینه به‌صورت خطی با تعداد نمونه‌ها افزایش می‌یابد. نمونه‌برداری ۴۰ مسیر در استنتاج ۴۰ برابر بودجهٔ توکن یک مسیر واحد هزینه دارد. برای کارهایی که تأخیر و هزینهٔ API مهم است — عاملی که شبانه صدها تراکنش پردازش می‌کند — این رایگان نیست. کارهای دنباله‌دار (خودسازگاری با توقف زودهنگام، ICLR ۲۰۲۴) به این می‌پردازند: با توقف یک‌بار که رأی به آستانهٔ اطمینان برسد، می‌توانید نمونه‌ها را ۸۰٪ در GSM8K بدون از دست دادن دقت قابل اندازه‌گیری کاهش دهید. مقالهٔ اصلی اصلاً هزینه را بحث نمی‌کند، که یک غفلت عجیب است.

دوم، فرض رأی اکثریت زمانی فرو می‌ریزد که مدل به‌طور سیستماتیک اشتباه کند. اگر مدل به‌طور مداوم یک تبدیل ارز را اشتباه بخواند یا یک قانون مالیاتی را در همهٔ ۴۰ مسیر اشتباه اعمال کند، پاسخ اشتباه در رأی برنده می‌شود. خودسازگاری رایج‌ترین خطا را تقویت می‌کند، نه خطای درست را. این شکاف معرفت‌شناختی مرکزی است: روش دقت را در توزیع باور مدل افزایش می‌دهد، اما برای کالیبراسیون وقتی آن توزیع بر پاسخ اشتباه متمرکز است هیچ کاری نمی‌کند.

سوم، وانگ و وانگ (۲۰۲۵، arXiv:2503.16974) سازگاری مدل زبانی بزرگ را مستقیماً بر وظایف مالی و حسابداری در ۵۰ اجرای مستقل مطالعه می‌کنند. آن‌ها می‌یابند که طبقه‌بندی دودویی و تحلیل احساسات در حال حاضر با یک نمونه تقریباً کاملاً تکرارپذیرند، در حالی که وظایف پیچیده (پیش‌بینی، تولید) تنوع واقعی نشان می‌دهند. یافتهٔ عملی آن‌ها: تجمیع فقط ۳ تا ۵ اجرا به‌طور چشمگیری سازگاری وظایف پیچیده را بهبود می‌بخشد — نسخهٔ بسیار ارزان‌تری از همان ایدهٔ خودسازگاری.

چرا برای هوش مصنوعی مالی اهمیت دارد

عملیات دفتر کل Beancount که شامل محاسبات چندمرحله‌ای هستند — محاسبات مالیات، مبنای هزینهٔ تعدیل‌شده با ارز، برنامه‌های استهلاک، تطبیق فاکتور — دقیقاً کارهایی هستند که رمزگشایی حریصانهٔ واحد غیرقابل‌اعتماد است، با این حال پاسخ درست یکتا و قابل بررسی است. خودسازگاری یک مداخلهٔ ارزان است که باید برای هر وظیفهٔ عامل مالی که خروجی آن قابل بررسی است استاندارد باشد (آیا موجودی هنوز صفر است؟).

پیامد جالب‌تر معماری است. خودسازگاری استنتاج را به یک مجموعه رأی‌گیری تبدیل می‌کند. برای ایمنی نوشتن مجدد — عاملی که ورودی‌های دفتر را در یک دفتر کل ثبت می‌کند — من بر اطمینان اکثریت دروازه می‌گذارم: فقط ثبت کن اگر ۳۵ از ۴۰ مسیر موافق باشند. اختلاف یک سیگنال است که عامل باید به جای نوشتن به انسان ارجاع دهد. این یک فیلتر ایمنی مشخص و قابل پیاده‌سازی است که بودجهٔ استنتاج هزینه دارد، نه پیچیدگی مهندسی.

حالت شکست سوگیری سیستماتیک به‌ویژه برای قوانین مالیات و نظارتی مهم است، جایی که مدل‌ها شناخته‌شده‌اند جزئیات مختص حوزهٔ قضایی را توهم می‌زنند. در آن موارد پال (LOG-009) راه‌حل درست است: محاسبه را کاملاً واگذار کن. خودسازگاری و پال مکمل یکدیگرند — پال درستی محاسبات را مدیریت می‌کند؛ خودسازگاری ابهام و قابلیت اطمینان استدلال را مدیریت می‌کند.

چه چیزی بعد بخوانید

  • درخت اندیشه‌ها: حل مسئلهٔ عمدی با مدل‌های زبانی بزرگ (یائو و همکاران، ۲۰۲۳، arXiv:2305.10601) — خودسازگاری را از رأی‌گیری بر مسیرها به جستجو بر مسیرها گسترش می‌دهد، که زمانی مهم است که فضای استدلال شاخه می‌شود به جای موازی اجرا شود.
  • فرار از هزینهٔ سرسام‌آور: خودسازگاری با توقف زودهنگام برای استدلال چندمرحله‌ای (لی و همکاران، ICLR ۲۰۲۴) — راه‌حل مشکل هزینه؛ نمونه‌برداری را بیش از ۸۰٪ در GSM8K کاهش می‌دهد در حالی که دقت حفظ می‌شود.
  • خودسازگاری جهانی برای مدل‌های زبانی بزرگ (چن و همکاران، arXiv:2311.17311) — رأی اکثریت را به تولید متن‌باز با یک داور مدل زبانی بزرگ گسترش می‌دهد، شکاف تجمیع را که مقالهٔ اصلی باز می‌گذارد می‌بندد.

این مقاله را به‌اشتراک بگذارید

منبع: https://beancount.io/fa/bean-labs/research-logs/2026/04/24/self-consistency-chain-of-thought

منتشر شده: ۴ اردیبهشت ۱۴۰۵

آخرین بهروزرسانی: ۲۳ شهریور ۱۴۰۵

زمان مطالعه 5 دقیقه

درخواست‌دهی زنجیره اندیشه: موازنه‌های دقت-بازیابی در هوش مصنوعی مالی

یک بررسی دقیق بر روی مقاله زنجیره اندیشه سال ۲۰۲۲ Wei و همکاران و پیامدهای آن…

ai
llm
زمان مطالعه 5 دقیقه

OmniEval: بنچمارک ارزیابی همه‌جانبه RAG برای حوزه مالی

OmniEval (EMNLP 2025) سیستم‌های RAG را در ۵ نوع تسک × ۱۶ موضوع مالی با استفاده…

ai
machine-learning
زمان مطالعه 6 دقیقه

گمشده در میان: سوگیری موقعیتی در مدل‌های زبانی بزرگ و تأثیر آن بر هوش مصنوعی مالی

مقاله TACL 2024 توسط لیو و همکاران نشان می‌دهد که مدل‌های زبانی بزرگ در…

llm
ai
زمان مطالعه 5 دقیقه

M3MAD-Bench: آیا مباحثات چند-عاملی واقعاً در حوزه‌ها و مدالیته‌های مختلف موثر هستند؟

M3MAD-Bench مباحثه چند-عاملی را در ۹ مدل، ۵ حوزه و تنظیمات بینایی-زبانی مورد…

ai
llm
زمان مطالعه 5 دقیقه

اطلس: پیش‌آموزش مشترک بازیاب-خوانشگر مدل‌های زبانی بزرگ ۵۴۰ میلیارد پارامتری را با ۱۱ میلیارد پارامتر شکست می‌دهد

اطلس (JMLR 2023) با استفاده از تنها ۶۴ نمونه آموزشی به دقت ۴۲.۴٪ در Natural…

ai
machine-learning