
M3MAD-Bench: Són realment eficaços els debats multiagent en diferents dominis i modalitats?
M3MAD-Bench troba que la il·lusió col·lectiva causa el 65% de les fallades del debat multiagent, i el debat adversarial retalla la precisió fins a un 12,8%.
#multi-agent
Marcs de treball i arquitectures multiagent LLM per a automatització financera col·laborativa

M3MAD-Bench troba que la il·lusió col·lectiva causa el 65% de les fallades del debat multiagent, i el debat adversarial retalla la precisió fins a un 12,8%.

La conversa de dos agents d'AutoGen eleva la precisió en MATH del 55% al 69%, i el seu agent SafeGuard afegeix fins a 35 punts F1 en la detecció de codi insegur.