2026년 5월 30일약 5분M3MAD-Bench: 멀티 에이전트 토론은 도메인과 모달리티 전반에서 정말로 효과적인가?M3MAD-Bench는 집단 망상이 다중 에이전트 토론 실패의 65%를 유발하고, 적대적 토론이 정확도를 최대 12.8% 떨어뜨린다는 것을 밝혔다.Mike Thriftaillmmachine-learning
2026년 5월 4일약 5분AutoGen: 금융 AI를 위한 멀티 에이전트 대화 프레임워크AutoGen의 두 에이전트 대화는 MATH 정확도를 55%에서 69%로 끌어올리고, SafeGuard 에이전트는 안전하지 않은 코드 탐지에서 최대 35 F1 포인트를 더한다.Mike Thriftaillmautomation