腾讯混元将 Hy3 模型进行 1bit 和 4bit 量化并适配 llama.cpp,使 295B 参数模型能在单卡或低资源设备上运行,同时保持接近满血性能。
📝 详细摘要
腾讯混元团队针对社区对旗舰模型 Hy3(295B 参数)在资源受限设备上的运行需求,将其权重分别量化为 1bit(IQ1_M)和 4bit(Q4_K_M)并打包为 GGUF 格式,配合 llama.cpp 实现。1bit 版本将模型权重从约 598 GB 压缩至约 85.5 GiB,可在单张 96GB 推理显卡上运行;4bit 版本约 169.9 GiB,需两张推理卡。实验表明,4bit 版本在输出分布和实际任务(Agent 能力、多语言代码、工具调用、长文理解)上与原始 BF16 模型保持高度一致,掉点可接受;令人惊讶的是 1bit 版本在多数主流任务上表现同样稳健,仅小幅回落。此外,团队为 llama.cpp 开发了 MTP 投机解码补丁,开启后 1bit 版本解码速度提升约 50%,4bit 版本提升约 60%,接受率稳定在 60% 左右,交互体验流畅。文中还给出了模型和对应量化版本的 HuggingFace 下载链接以及补丁地址。
💡 主要观点
- 1bit 量化将 Hy3 权重从 ~598 GB 压至 ~85.5 GiB,可在单卡 96GB 显卡上运行。 压缩比达 6.7 倍,显著降低硬件门槛,使旗舰模型在本地或资源受限设备上成为可能。
💬 文章金句
- 1bit 塞进单卡,4bit 接近满血
- 判断量化好不好,最直接的是看它和原始模型的输出分布有多接近。4bit 版本在这方面表现得相当出色
- 真正让我们有些意外的是 1bit 版本。按直觉,压到 1bit 附近模型多少会变笨,但我们的 Hy3 1bit 版本在主流任务上依然站得很稳
- 要让 Hy3 真正跑顺,MTP 投机解码必不可少。开启 MTP 后,接受率稳定在 60% 左右,1bit 版本的解码速度提升约 50%,4bit 版本提升接近 60%
📊 文章信息
AI 初评:91
精选文章:是
来源:腾讯混元
作者:腾讯混元
分类:人工智能
语言:中文
阅读时间:5 分钟
字数:1151
标签: 人工智能, 大模型, 模型量化, llama.cpp, 腾讯混元