پرش به محتوای اصلی

#technology

فناوری

موضوعات پژوهشی فناوری و مهندسی نرم‌افزار مرتبط با سیستم‌های هوش مصنوعی مالی

WildToolBench: چرا هیچ مدل زبانی بزرگی در دقت جلسات استفاده از ابزار در دنیای واقعی از ۱۵٪ فراتر نمی‌رود

WildToolBench می‌یابد هیچ LLM از ۱۵٪ دقت نشست در ۱,۰۲۴ وظیفه کاربران واقعی فراتر نمی‌رود و قصد پنهان و گذارهای دستور، تیزترین حالت‌های شکست‌اند.

OSWorld: موفقیت عامل‌های هوش مصنوعی دسکتاپ در ۱۲٪ از وظایفی که انسان‌ها در ۷۲٪ آن‌ها موفق می‌شوند

OSWorld نشان می‌دهد عامل‌های هوش مصنوعی دسکتاپ در 12.24% وظایف واقعی موفق می‌شوند در برابر 72.36% برای انسان‌ها، با 75% شکست‌ها ناشی از زمین‌گیری بینایی-حرکتی، نه استدلال.

تک‌عاملی: در توکن‌های برابر، عملکرد برابر با MAS در استدلال چندمرحله‌ای دارد

در بودجه‌های برابر توکن تفکر، مدل‌های زبانی تک‌عاملی در استدلال چندمرحله‌ای با سیستم‌های چندعاملی برابری یا برتری دارند—طراحی‌های ساده‌تر عامل مالی را ترجیح دهید.