
M3MAD-Bench: Действительно ли многоагентные дебаты эффективны в различных областях и модальностях?
M3MAD-Bench обнаруживает, что коллективная иллюзия вызывает 65% неудач дебатов мультиагентов, а состязательные дебаты снижают точность до 12.8%.
#multi-agent
Мультиагентные LLM-фреймворки и архитектуры для совместной финансовой автоматизации

M3MAD-Bench обнаруживает, что коллективная иллюзия вызывает 65% неудач дебатов мультиагентов, а состязательные дебаты снижают точность до 12.8%.

Диалог двух агентов AutoGen повышает точность на MATH с 55% до 69%, а его агент SafeGuard добавляет до 35 баллов F1 в обнаружении небезопасного кода.