跳到正文
原文
Google DeepMind·· 2026-06-09精选AI 评分80

Google DeepMind 发布 Gemma 4 12B 多模态模型

Introducing Gemma 4 12B: a unified, encoder-free multimodal model

AI 导读

Google DeepMind 发布 Gemma 4 12B,这是首款支持原生音频输入的中规模模型。它采用无编码器架构,视觉和音频输入直接流入LLM骨干网络。模型可在16GB VRAM的笔记本上运行,性能接近更大的26B MoE模型,并配备MTP草稿器以降低延迟。该模型以Apache 2.0许可证开源,Hugging Face和Kaggle已提供权重下载。

推荐理由

原生音频输入和无编码器架构让它在16GB显存的笔记本上即可运行,适合本地Agent开发。

来源:Google DeepMind · deepmind.google