
M3MAD-Bench: ¿Son los debates multi-agente realmente efectivos en todos los dominios y modalidades?
M3MAD-Bench encuentra que la Ilusión Colectiva impulsa el 65% de los fallos del debate multiagente, y el debate adversarial reduce la precisión hasta un 12,8%.
