Google Research·· 2026-06-27精选AI 评分70
谷歌研究:冻结多 Token 预测加速 Pixel 端侧 Gemini Nano 推理
Accelerating Gemini Nano models on Pixel with frozen Multi-Token Prediction
AI 导读
谷歌研究博客发文介绍将多 Token 预测(MTP)改造并部署到 Pixel 9 和 10 系列的 frozen Gemini Nano v3 模型上。方案在模型最终层附加轻量 Transformer 头,直接 cross-attend 主模型 KV 缓存,避免独立 Draft 模型带来的双倍内存开销;主模型参数冻结,不改变输出语义和对齐结果。
推荐理由
谷歌公布端侧推理优化方案,在冻结的 Gemini Nano 模型上叠加 MTP 头,实测 Pixel 提速 50% 以上。
来源:Google Research · research.google