M3MAD-Bench: I dibattiti multi-agente sono davvero efficaci tra domini e modalità?
M3MAD-Bench mette sotto stress il Dibattito Multi-Agente su 9 modelli, 5 domini e impostazioni visione-linguaggio, scoprendo che il Delirio Collettivo causa il 65% dei fallimenti, il dibattito avversario riduce l'accuratezza fino al 12,8% e l'Auto-Consistenza generalmente eguaglia l'accuratezza del dibattito a un costo di token inferiore.