
M3MAD-Bench: Os Debates Multi-Agente São Realmente Eficazes em Diferentes Domínios e Modalidades?
O M3MAD-Bench descobriu que a Ilusão Coletiva causa 65% das falhas em debates multiagente, e o debate adversarial reduz a precisão em até 12,8%.
#multi-agent
Frameworks multi-agente com LLMs para automação financeira colaborativa

O M3MAD-Bench descobriu que a Ilusão Coletiva causa 65% das falhas em debates multiagente, e o debate adversarial reduz a precisão em até 12,8%.

A conversa de dois agentes do AutoGen eleva a precisão do MATH de 55% para 69%, e seu agente SafeGuard adiciona até 35 pontos F1 na detecção de código inseguro.