2026年7月8日JSONSchemaBench:真实世界的模式复杂度打破了大语言模型结构化输出的保证JSONSchemaBench 对 9,558 个真实世界的 JSON 模式进行了针对六种约束解码框架的测试,发现模式复杂度导致覆盖率从简单模式的 86% 崩塌至复杂模式的 3%,其中 XGrammar 静默输出了 38 个不合规结果,且没有任何框架能够涵盖所有 45 个 JSON Schema 特征类别。mikellmaimachine-learning
2026年5月31日单代理:在相同预算下,多跳任务上等于多智能体系统在相同的思考预算下,单代理LLM在多跳推理上等同于或超越多智能体系统——更倾向于简单的金融代理设计。mikeaillmmachine-learning