Import AI 470:机器无权利;用 SPADE 自动化环境生成;用 Hawkeye 构建更好的 GPU 内核
30B 规模的 Qwen3 模型配合 SPADE 框架,通过自我博弈生成可执行环境,使 AIME、GPQA、LCB 等基准上性能分别提升 58.3(+8.1 over base)。该 30B-A3B 模型经 GRPO 优化 400 次 rollouts 完成训练。研究来自华盛顿大学、斯坦福等九校合作团队。
30B 规模的 Qwen3 模型配合 SPADE 框架,通过自我博弈生成可执行环境,使 AIME、GPQA、LCB 等基准上性能分别提升 58.3(+8.1 over base)。该 30B-A3B 模型经 GRPO 优化 400 次 rollouts 完成训练。研究来自华盛顿大学、斯坦福等九校合作团队。
Hugging Face 研究发现智能体记忆不是简单开关,正确剂量取决于模型能力。在 AppWorld 评测中,DeepSeek-V3.2(671B MoE)获得全量准则集后任务完成率提升 9.5pp;gpt-oss-120b(117B MoE)通过定制检索提升 16.1pp,且仅增加 5% token。