Google 正式发布 Gemma 4 12B,一款采用免编码器统一架构、可在 16GB 显存笔记本上本地运行的多模态模型,性能接近 26B MoE 模型。
📝 详细摘要
本文是 Google 官方对 Gemma 4 12B 模型的发布公告。该模型采用创新的免编码器架构,直接处理视觉和音频输入,无需传统多模态编码器,从而降低延迟和内存占用。在标准基准测试中,其性能接近体量更大的 26B MoE 模型,但所需内存不到后者一半。模型仅需 16GB 显存即可在消费级笔记本上本地运行,支持多步骤推理和智能体工作流。文章还介绍了其支持多 Token 预测草稿模型以降低推理延迟,并提供了在 LM Studio、Ollama、Hugging Face 等平台上的使用指南和开发者资源。
💡 主要观点
- Gemma 4 12B 采用免编码器统一架构,直接处理视觉和音频输入。 传统多模态模型依赖独立编码器转换图像和音频,而 Gemma 4 12B 通过轻量级嵌入模块和直接投影,将多模态输入直接汇入 LLM 主干,降低了延迟和内存占用。
💬 文章金句
- Gemma 4 12B 填补了适用于边缘设备的 E4B 模型与更先进的 26B 混合专家模型 (MoE) 之间的空白,在缩减内存占用的同时,集成了强大的功能。
- 我们采用了一种免编码器 (encoder-free) 架构来训练 Gemma 4 12B,从而直接整合音频和视觉输入。
📊 文章信息
AI 初评:82
来源:谷歌开发者
作者:谷歌开发者
分类:人工智能
语言:中文
阅读时间:7 分钟
字数:1526
标签: 模型发布, 多模态 AI, LLM, 端侧 AI, Gemma