← 回總覽

正式推出 Gemma 4 12B: 一款统一、免编码器的多模态模型

📅 2026-06-08 18:50 谷歌开发者 人工智能 2 分鐘 1341 字 評分: 82
模型发布 多模态 AI LLM 端侧 AI Gemma
📌 一句话摘要 Google 正式发布 Gemma 4 12B,一款采用免编码器统一架构、可在 16GB 显存笔记本上本地运行的多模态模型,性能接近 26B MoE 模型。 📝 详细摘要 本文是 Google 官方对 Gemma 4 12B 模型的发布公告。该模型采用创新的免编码器架构,直接处理视觉和音频输入,无需传统多模态编码器,从而降低延迟和内存占用。在标准基准测试中,其性能接近体量更大的 26B MoE 模型,但所需内存不到后者一半。模型仅需 16GB 显存即可在消费级笔记本上本地运行,支持多步骤推理和智能体工作流。文章还介绍了其支持多 Token 预测草稿模型以降低推理延迟,并提供

📌 一句话摘要

Google 正式发布 Gemma 4 12B,一款采用免编码器统一架构、可在 16GB 显存笔记本上本地运行的多模态模型,性能接近 26B MoE 模型。

📝 详细摘要

本文是 Google 官方对 Gemma 4 12B 模型的发布公告。该模型采用创新的免编码器架构,直接处理视觉和音频输入,无需传统多模态编码器,从而降低延迟和内存占用。在标准基准测试中,其性能接近体量更大的 26B MoE 模型,但所需内存不到后者一半。模型仅需 16GB 显存即可在消费级笔记本上本地运行,支持多步骤推理和智能体工作流。文章还介绍了其支持多 Token 预测草稿模型以降低推理延迟,并提供了在 LM Studio、Ollama、Hugging Face 等平台上的使用指南和开发者资源。

💡 主要观点

- Gemma 4 12B 采用免编码器统一架构,直接处理视觉和音频输入。 传统多模态模型依赖独立编码器转换图像和音频,而 Gemma 4 12B 通过轻量级嵌入模块和直接投影,将多模态输入直接汇入 LLM 主干,降低了延迟和内存占用。

性能接近 26B MoE 模型,但内存需求不到一半。 在标准基准测试中,12B 参数量的模型表现接近 26B 混合专家模型,而所需总内存占用显著降低,仅需 16GB 显存即可在消费级笔记本上本地运行。
支持多 Token 预测草稿模型,降低推理延迟。 配备 MTP 草稿模型,能够在保持推理质量的同时显著减少生成延迟,提升本地运行时的响应速度。
以 Apache 2.0 许可发布,获得广泛开发者生态支持。 模型权重可在 Hugging Face、Kaggle 下载,支持 LM Studio、Ollama、llama.cpp、vLLM 等多种推理框架,并提供了 Skills Repository 支持智能体开发。

💬 文章金句

- Gemma 4 12B 填补了适用于边缘设备的 E4B 模型与更先进的 26B 混合专家模型 (MoE) 之间的空白,在缩减内存占用的同时,集成了强大的功能。

  • 我们采用了一种免编码器 (encoder-free) 架构来训练 Gemma 4 12B,从而直接整合音频和视觉输入。

📊 文章信息

AI 初评:82

来源:谷歌开发者

作者:谷歌开发者

分类:人工智能

语言:中文

阅读时间:7 分钟

字数:1526

标签: 模型发布, 多模态 AI, LLM, 端侧 AI, Gemma

阅读完整文章

查看原文 → 發佈: 2026-06-08 18:50:00 收錄: 2026-06-09 02:00:22

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。