📌 一句话摘要 腾讯混元开源新一代 Hy3 模型,295B MoE 激活 21B,在推理、智能体、长上下文任务上比肩参数规模 2-5 倍旗舰模型,工具调用错误恢复与多脚手架泛化性显著提升。 📝 详细摘要 腾讯混元团队正式开源新一代大模型 Hy3,采用 Apache 2.0 协议。总参数量 295B,激活 21B,基于 preview 版本在 50 多个业务场景反馈上迭代。文章从智能体能力、产品体验、性能表现、本地部署四方面展开:在软件开发、办公生产、金融建模等任务上显著进步,内部专家盲测均分优于 GLM5.1;工具调用稳定性、跨脚手架泛化性大幅改善,幻觉率从 12.5%降至 5.4%,常识
📌 一句话摘要
腾讯混元开源新一代 Hy3 模型,295B MoE 激活 21B,在推理、智能体、长上下文任务上比肩参数规模 2-5 倍旗舰模型,工具调用错误恢复与多脚手架泛化性显著提升。
📝 详细摘要
腾讯混元团队正式开源新一代大模型 Hy3,采用 Apache 2.0 协议。总参数量 295B,激活 21B,基于 preview 版本在 50 多个业务场景反馈上迭代。文章从智能体能力、产品体验、性能表现、本地部署四方面展开:在软件开发、办公生产、金融建模等任务上显著进步,内部专家盲测均分优于 GLM5.1;工具调用稳定性、跨脚手架泛化性大幅改善,幻觉率从 12.5%降至 5.4%,常识错误率从 25.4%降至 12.7%;多轮问题率从 17.4%降至 7.9%,MRCR 从 42.9%升至 75.1%。文中还提供了 WorkBuddy、元宝、ima 等内部产品接入后的实测数据,并附 vLLM 和 SGLang 部署指南。
💡 主要观点
-
Hy3 以 295B MoE、21B 激活参数量实现了小激活、强性能的架构设计。
相比参数规模 2-5 倍的旗舰模型,Hy3 在推理、智能体、长上下文任务上比肩甚至超越,展现出高性价比优势。
工具调用稳定性与多脚手架泛化性显著提升,是智能体落地的关键改善。
模型在不同脚手架(如 Codebuddy、Cline、KiloCode)上 SWE Bench Verified 分数标准差控制在 4 个百分点以内,工具调用错误恢复能力大幅提高。
内部多家产品实测显示任务解决率、效率与 Token 消耗均有显著优化。
WorkBuddy 任务解决率从 72%升至 90%,平均耗时缩短 34%;文档处理 Token 消耗比 GLM5.2 低 47.4%;腾讯游戏助手幻觉率从 4.5%降至 2.8%。
提供详细的 vLLM 和 SGLang 部署方案,支持 MTP 投机采样与 EAGLE 算法。
文章给出了从源码构建到服务启动的完整命令,推荐 8 卡 H20-3e 部署,并说明了 temperature、top_p、reasoning_effort 等参数配置。
📊 文章信息
AI 初评:79
来源:魔搭ModelScope社区
作者:魔搭ModelScope社区
分类:人工智能
语言:中文
阅读时间:11 分钟
字数:2721
标签:
LLM, MoE, 开源模型, 模型部署, AI Agent
阅读完整文章