
M3MAD-Bench: Чи справді багатоагентні дебати ефективні в різних доменах та модальностях?
M3MAD-Bench виявляє, що колективна омана спричиняє 65% невдач дебатів кількох агентів, а змагальні дебати знижують точність до 12.8%.
#multi-agent
Мультиагентні фреймворки LLM та архітектури для спільної фінансової автоматизації

M3MAD-Bench виявляє, що колективна омана спричиняє 65% невдач дебатів кількох агентів, а змагальні дебати знижують точність до 12.8%.

Двоагентна розмова AutoGen підвищує точність MATH з 55% до 69%, а його агент SafeGuard додає до 35 балів F1 у виявленні небезпечного коду.