← 回總覽

极致量化,近三千亿参数 Hy3 单卡即可部署

📅 2026-07-14 16:56 腾讯混元 人工智能 2 分鐘 1546 字 評分: 91
人工智能 大模型 模型量化 llama.cpp 腾讯混元
📌 一句话摘要 腾讯混元将 Hy3 模型进行 1bit 和 4bit 量化并适配 llama.cpp,使 295B 参数模型能在单卡或低资源设备上运行,同时保持接近满血性能。 📝 详细摘要 腾讯混元团队针对社区对旗舰模型 Hy3(295B 参数)在资源受限设备上的运行需求,将其权重分别量化为 1bit(IQ1_M)和 4bit(Q4_K_M)并打包为 GGUF 格式,配合 llama.cpp 实现。1bit 版本将模型权重从约 598 GB 压缩至约 85.5 GiB,可在单张 96GB 推理显卡上运行;4bit 版本约 169.9 GiB,需两张推理卡。实验表明,4bit 版本在输出分布

📌 一句话摘要

腾讯混元将 Hy3 模型进行 1bit 和 4bit 量化并适配 llama.cpp,使 295B 参数模型能在单卡或低资源设备上运行,同时保持接近满血性能。

📝 详细摘要

腾讯混元团队针对社区对旗舰模型 Hy3(295B 参数)在资源受限设备上的运行需求,将其权重分别量化为 1bit(IQ1_M)和 4bit(Q4_K_M)并打包为 GGUF 格式,配合 llama.cpp 实现。1bit 版本将模型权重从约 598 GB 压缩至约 85.5 GiB,可在单张 96GB 推理显卡上运行;4bit 版本约 169.9 GiB,需两张推理卡。实验表明,4bit 版本在输出分布和实际任务(Agent 能力、多语言代码、工具调用、长文理解)上与原始 BF16 模型保持高度一致,掉点可接受;令人惊讶的是 1bit 版本在多数主流任务上表现同样稳健,仅小幅回落。此外,团队为 llama.cpp 开发了 MTP 投机解码补丁,开启后 1bit 版本解码速度提升约 50%,4bit 版本提升约 60%,接受率稳定在 60% 左右,交互体验流畅。文中还给出了模型和对应量化版本的 HuggingFace 下载链接以及补丁地址。

💡 主要观点

- 1bit 量化将 Hy3 权重从 ~598 GB 压至 ~85.5 GiB,可在单卡 96GB 显卡上运行。 压缩比达 6.7 倍,显著降低硬件门槛,使旗舰模型在本地或资源受限设备上成为可能。

4bit 量化版本在输出分布和实际任务上与 BF16 模型保持高度一致,掉点在可接受范围内。 实验表明 4bit 量化几乎未牺牲模型能力,适合对精度要求较高的场景。
1bit 版本在主流任务上表现稳健,仅小幅回落,足以满足日常编码辅助、工具调用和长文档处理等需求。 尽管理论上极低比特会导致性能下降,但实际测试显示其在多项基准上仍保持较高水平。
针对 llama.cpp 开发的 MTP 投机解码补丁使解码速度提升 50%-60%,接受率稳定约 60%。 MTP 技术显著提升交互流畅度,进一步降低了延迟,提升了实际使用体验。

💬 文章金句

- 1bit 塞进单卡,4bit 接近满血

  • 判断量化好不好,最直接的是看它和原始模型的输出分布有多接近。4bit 版本在这方面表现得相当出色
  • 真正让我们有些意外的是 1bit 版本。按直觉,压到 1bit 附近模型多少会变笨,但我们的 Hy3 1bit 版本在主流任务上依然站得很稳
  • 要让 Hy3 真正跑顺,MTP 投机解码必不可少。开启 MTP 后,接受率稳定在 60% 左右,1bit 版本的解码速度提升约 50%,4bit 版本提升接近 60%

📊 文章信息

AI 初评:91

精选文章:是

来源:腾讯混元

作者:腾讯混元

分类:人工智能

语言:中文

阅读时间:5 分钟

字数:1151

标签: 人工智能, 大模型, 模型量化, llama.cpp, 腾讯混元

阅读完整文章

查看原文 → 發佈: 2026-07-14 16:56:00 收錄: 2026-07-14 22:00:38

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。