谷歌 Gemma 4 开源发布,端侧 31B 模型通过无编码器架构实现原生多模态与深度思考,媲美闭源云端 AI,预示端侧智能将取代高昂云端 API。
📝 详细摘要
谷歌 DeepMind 于 2026 年 7 月初发布 Gemma 4 系列模型,全系采用 Apache 2.0 协议开源。该系列最大模型为 31B 参数,创新性地移除了传统多模态架构中的视觉与音频编码器,仅保留一个极小的投影层,将原始图像块和音频波形直接投射入统一的 Transformer 嵌入空间,实现端到端的‘看、听、想’一体化处理。此外,Gemma 4 在所有边缘尺寸模型中原生引入了 Thinking Mode,通过简单的 控制令牌触发高密度推理,使得即使在 2.3B 或 4.5B 的微型模型上也能展现深度思考能力。技术报告表明,Gemma 4 31B Thinking 在复杂数学、前沿科学及 Agent 工具调用等任务上,优于前代更大的 27B 模型,甚至能够在某些高难度基准上挑战闭源巨头的模型。得益于开源和端侧部署,开发者可在普通笔记本、手机或单板电脑上实现低延迟、零 API 费用且数据完全本地化的多模态交互,这正在削弱云端 AI 的溢价模式。文章最后指出,真正的技术普惠应让每个人、每个设备拥有属于自己的智能,而非依赖遥远的云端神经网络。
💡 主要观点
- 无编码器统一架构 Gemma 4 移除了传统多模态模型中的视觉与音频编码器,仅保留一个极小的投影层,将原始图像块和音频波形直接投射入统一 Transformer 嵌入空间,实现端到端的‘看、听、想’一体化处理,显著降低显存占用并提升协同效率。
💬 文章金句
- 它直接把这两个翻译官砍掉了
- 端侧部署带来的改变是结构性的:
- 当开发者发现:自己的手机里已经驻留着一个能实时听懂环境音、看懂代码、还能在毫秒级做出深度思考的模型时,他们还有什么理由继续向云端缴纳智商税?
📊 文章信息
AI 初评:84
来源:新智元
作者:新智元
分类:人工智能
语言:中文
阅读时间:10 分钟
字数:2335
标签: LLM, 多模态 AI, 深度思考, 开源模型, 端侧部署