
M3MAD-Bench: Sind Multi-Agenten-Debatten über Domänen und Modalitäten hinweg wirklich effektiv?
M3MAD-Bench stellt fest, dass Collective Delusion 65% der Multi-Agenten-Debattenfehler verursacht, und adversariale Debatte senkt die Genauigkeit um bis zu 12,8%.
