
M3MAD-Bench: آیا مباحثات چند-عاملی واقعاً در حوزهها و مدالیتههای مختلف موثر هستند؟
M3MAD-Bench دریافت که توهم جمعی عامل ۶۵٪ شکستهای مناظره چندعاملی است و مناظره تخاصمی دقت را تا ۱۲.۸٪ کاهش میدهد.
#multi-agent
چارچوبها و معماریهای LLM چندعاملی برای اتوماسیون مالی مشارکتی

M3MAD-Bench دریافت که توهم جمعی عامل ۶۵٪ شکستهای مناظره چندعاملی است و مناظره تخاصمی دقت را تا ۱۲.۸٪ کاهش میدهد.

مکالمه دو عاملی AutoGen دقت MATH را از ۵۵٪ به ۶۹٪ میرساند و عامل SafeGuard آن تا ۳۵ امتیاز F1 در تشخیص کد ناایمن اضافه میکند.