2026年7月8日約1分JSONSchemaBench: 現実世界のスキーマの複雑さがLLMの構造化出力の保証を破壊するJSONSchemaBenchは、カバレッジが単純スキーマの86%から複雑なものでは3%へ崩壊し、LLMの構造化出力が非準拠JSONを静かに出力しうると判明。Mike Thriftllmaimachine-learning
2026年5月31日約1分シングルエージェント:同等トークンでマルチホップにおいてMASに匹敵等しい思考トークン予算の下では、シングルエージェントLLMはマルチホップ推論においてマルチエージェントシステムに匹敵するかそれを上回り、よりシンプルな金融エージェント設計が有利です。Mike Thriftaillmmachine-learning