跳到正文
原文
Google Research·· 2026-06-27精选AI 评分70

谷歌研究:冻结多 Token 预测加速 Pixel 端侧 Gemini Nano 推理

Accelerating Gemini Nano models on Pixel with frozen Multi-Token Prediction

AI 导读

谷歌研究博客发文介绍将多 Token 预测(MTP)改造并部署到 Pixel 9 和 10 系列的 frozen Gemini Nano v3 模型上。方案在模型最终层附加轻量 Transformer 头,直接 cross-attend 主模型 KV 缓存,避免独立 Draft 模型带来的双倍内存开销;主模型参数冻结,不改变输出语义和对齐结果。

推荐理由

谷歌公布端侧推理优化方案,在冻结的 Gemini Nano 模型上叠加 MTP 头,实测 Pixel 提速 50% 以上。

来源:Google Research · research.google