← 回總覽

谷歌 Gemma 4 论文深夜解封!31B 直逼闭源前沿,敲响云端 AI 丧钟

📅 2026-07-11 12:30 新智元 人工智能 2 分鐘 1544 字 評分: 84
LLM 多模态 AI 深度思考 开源模型 端侧部署
📌 一句话摘要 谷歌 Gemma 4 开源发布,端侧 31B 模型通过无编码器架构实现原生多模态与深度思考,媲美闭源云端 AI,预示端侧智能将取代高昂云端 API。 📝 详细摘要 谷歌 DeepMind 于 2026 年 7 月初发布 Gemma 4 系列模型,全系采用 Apache 2.0 协议开源。该系列最大模型为 31B 参数,创新性地移除了传统多模态架构中的视觉与音频编码器,仅保留一个极小的投影层,将原始图像块和音频波形直接投射入统一的 Transformer 嵌入空间,实现端到端的‘看、听、想’一体化处理。此外,Gemma 4 在所有边缘尺寸模型中原生引入了 Thinking M

📌 一句话摘要

谷歌 Gemma 4 开源发布,端侧 31B 模型通过无编码器架构实现原生多模态与深度思考,媲美闭源云端 AI,预示端侧智能将取代高昂云端 API。

📝 详细摘要

谷歌 DeepMind 于 2026 年 7 月初发布 Gemma 4 系列模型,全系采用 Apache 2.0 协议开源。该系列最大模型为 31B 参数,创新性地移除了传统多模态架构中的视觉与音频编码器,仅保留一个极小的投影层,将原始图像块和音频波形直接投射入统一的 Transformer 嵌入空间,实现端到端的‘看、听、想’一体化处理。此外,Gemma 4 在所有边缘尺寸模型中原生引入了 Thinking Mode,通过简单的 控制令牌触发高密度推理,使得即使在 2.3B 或 4.5B 的微型模型上也能展现深度思考能力。技术报告表明,Gemma 4 31B Thinking 在复杂数学、前沿科学及 Agent 工具调用等任务上,优于前代更大的 27B 模型,甚至能够在某些高难度基准上挑战闭源巨头的模型。得益于开源和端侧部署,开发者可在普通笔记本、手机或单板电脑上实现低延迟、零 API 费用且数据完全本地化的多模态交互,这正在削弱云端 AI 的溢价模式。文章最后指出,真正的技术普惠应让每个人、每个设备拥有属于自己的智能,而非依赖遥远的云端神经网络。

💡 主要观点

- 无编码器统一架构 Gemma 4 移除了传统多模态模型中的视觉与音频编码器,仅保留一个极小的投影层,将原始图像块和音频波形直接投射入统一 Transformer 嵌入空间,实现端到端的‘看、听、想’一体化处理,显著降低显存占用并提升协同效率。

Thinking Mode 原生下放 通过简单的 控制令牌,Gemma 4 在所有边缘尺寸模型(2.3B/4.5B)中启用慢思考机制,使微型模型也能进行深度推理,缩小与云端大模型的性能差距。
开源与端侧部署的经济学影响 Apache 2.0 许可证使模型免费可修改;端侧运行带来数据主权、零延迟、零边际成本,削弱云端 AI 的 Token 付费模式,使普通硬件即可成为原生 AI 服务器。
性能基准与挑战闭源巨头 技术报告显示 Gemma 4 31B Thinking 在复杂数学、前沿科学及 Agent 工具调用上优于前代更大的 27B 模型,并在某些高难度基准上开始正面挑战体积更大的闭源模型,表明端侧模型已具备与前沿闭源模型竞争的能力。

💬 文章金句

- 它直接把这两个翻译官砍掉了

  • 端侧部署带来的改变是结构性的:
  • 当开发者发现:自己的手机里已经驻留着一个能实时听懂环境音、看懂代码、还能在毫秒级做出深度思考的模型时,他们还有什么理由继续向云端缴纳智商税?

📊 文章信息

AI 初评:84

来源:新智元

作者:新智元

分类:人工智能

语言:中文

阅读时间:10 分钟

字数:2335

标签: LLM, 多模态 AI, 深度思考, 开源模型, 端侧部署

阅读完整文章

查看原文 → 發佈: 2026-07-11 12:30:00 收錄: 2026-07-11 22:00:46

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。