Google 为开源模型 Gemma 4 发布了 MTP drafter,通过推测解码技术将推理速度提升最高 3 倍,且输出质量不变。
📝 详细摘要
这篇推文详细介绍了 Google 为其开源模型 Gemma 4 推出的 MTP drafter(多 token 预测草稿模型)。该技术利用 speculative decoding(推测解码),让一个轻量级小模型先预测多个 token,再由大模型并行验证,从而大幅提升推理速度。在 Apple Silicon 上运行 26B MoE 模型时,本地可获得约 2.2 倍提速。Drafter 沿用 Apache 2.0 协议,权重已上传至 Hugging Face 和 Kaggle,并已获得 transformers、MLX、vLLM、SGLang、Ollama 等主流框架的支持。作者还解释了 LLM 推理的瓶颈在于内存带宽,而推测解码能有效利用闲置算力。
📊 文章信息
AI 初评:88
来源:X · @dotey
作者:宝玉
分类:人工智能
语言:中文
阅读时间:3 分钟
字数:637
标签: Gemma 4, MTP Drafter, 推测解码, 推理加速, Google