page contents

谷歌发布并开源Gemma 4 12B版多模态模型 可在16GB内存/显存上运行

谷歌日前发布并开源 Gemma 4 12B 版多模态模型,该模型的开发目标是让消费级设备也可以在本地运行 AI 模型,根据谷歌的测试,该模型可以在 16GB 内存 / 显存的笔记本电脑和台式机上运行,这得益于 12B 的小规模参数,但该模型的智能化程度比肩 Gemma 26B 版模型。

attachments-2026-07-XQmv282o6a5596ec15efe.png谷歌日前发布并开源 Gemma 4 12B 版多模态模型,该模型的开发目标是让消费级设备也可以在本地运行 AI 模型,根据谷歌的测试,该模型可以在 16GB 内存 / 显存的笔记本电脑和台式机上运行,这得益于 12B 的小规模参数,但该模型的智能化程度比肩 Gemma 26B 版模型。 

模型优势包括:

全新统一架构:无需多模态编码器,直接支持文本、图片、视频和音频输入。

高级推理功能:基准性能接近 Gemma 26B 版混合专家架构模型,可以在本地提供多步骤推理。

内存要求较低:只需要 16GB 的内存或显存即可在本地运行,当然内存越大性能也会更好。

模型开源发布:该模型采用 Apache 2.0 许可证发布,谷歌和社区也提供完善的开发者生态系统支持。

预测选型器:Gemma 4 12B 版配备多种 Token 预测选型器,可以有效减少延迟。

有关模型的更多介绍:

Gemma 4 12B 在标注基准测试中的智能化程度接近谷歌此前开源发布的 26B MoE 混合架构模型,但 12B 版内存要求非常低,可以直接在配备 16GB 内存或显存的消费级笔记本电脑和台式机上运行,让用户可以在本地体验强大的多模态和智能体交互体验。 

该模型的突出优势还包括简化图片、视频、音频输入处理方式,传统的多模态模型通常依赖独立的编码器来转换图像和音频,然后再将转换后的表示传递给语言模型,由于这些分离式编码器会增加延迟和内存占用,所以谷歌使用无编码器架构训练 Gemma 4 12B 模型,让模型可以直接整合音频和视觉输入。

视觉方面:使用轻量级的嵌入模块替换 Gemma 4 视觉编码器,该模块仅包含 1 次矩阵乘法、位置嵌入和归一化操作,这让模型主干网络可以直接接管视觉处理。

音频方面:谷歌完全移除了音频编码器,将原始音频信号投射到与文本标记相同的维度空间中。

体验和下载模型:

目前 Gemma 4 12B 版已经在多个平台提供,有兴趣的开发者可以在 Ollama 等中直接体验,也可以前往 HuggingFace 或 Kaggle 下载模型权重文件,开发者还可以使用 Unsloth 进行高效微调定制自己需要的版本。

更多相关技术内容咨询欢迎前往并持续关注好学星城论坛了解详情。

想高效系统的学习Python编程语言,推荐大家关注一个微信公众号:Python编程学习圈。每天分享行业资讯、技术干货供大家阅读,关注即可免费领取整套Python入门到进阶的学习资料以及教程,感兴趣的小伙伴赶紧行动起来吧。

attachments-2022-05-rLS4AIF8628ee5f3b7e12.jpg

  • 发表于 2026-07-14 09:55
  • 阅读 ( 36 )
  • 分类:行业资讯

你可能感兴趣的文章

相关问题

0 条评论

请先 登录 后评论
Pack
Pack

2251 篇文章

作家榜 »

  1. 轩辕小不懂 2403 文章
  2. Pack 2251 文章
  3. 小柒 2228 文章
  4. Nen 576 文章
  5. 王昭君 209 文章
  6. 文双 71 文章
  7. 小威 64 文章
  8. Cara 36 文章