2026年5月30日阅读需 2 分钟M3MAD-Bench:多智能体辩论在不同领域和模态下真的有效吗?M3MAD-Bench 发现集体妄想驱动了 65% 的多智能体辩论失败,对抗性辩论最多使准确率下降 12.8%。Mike Thriftaillmmachine-learning
2026年5月4日阅读需 1 分钟AutoGen:金融 AI 的多智能体对话框架AutoGen 的双智能体对话把 MATH 准确率从 55% 提升到 69%,其 SafeGuard 智能体在不安全代码检测上最多提升 35 个 F1 点。Mike Thriftaillmautomation