2026年5月30日約1分M3MAD-Bench:マルチエージェント討論はドメインやモダリティを越えて真に有効なのか?M3MAD-Benchは、集合的妄想がマルチエージェント討論の失敗の65%を引き起こし、敵対的討論が精度を最大12.8%低下させることを明らかにする。Mike Thriftaillmmachine-learning
2026年5月4日約1分AutoGen: 金融AIのためのマルチエージェント対話フレームワークAutoGenの2エージェント会話はMATH精度を55%から69%に引き上げ、SafeGuardエージェントは安全でないコードの検出で最大35 F1ポイントを追加する。Mike Thriftaillmautomation