📌 一句话摘要 本文报道浪潮信息在 2026 开放计算大会上发布的两大 Agent 基础设施方案:支持单柜 4 万+ Agent 运行的 CPU 原生液冷整机柜服务器,以及实现多模型协同的多模融合 API 与元脑 SD200 超节点。 📝 详细摘要 文章报道浪潮信息针对 Agent 时代基础设施需求发布的最新方案。核心内容分两部分:一是业界首款 CPU 原生液冷整机柜服务器,单柜最大支持 384 颗 CPU,可支撑 4 万+个 Agent 协同运行,是此前方案的 40 倍;二是元脑企智 EPAI 平台上线多模融合 API,通过让多个候选模型独立生成答案再由评审模型融合,在 DRACO 测试
📌 一句话摘要
本文报道浪潮信息在 2026 开放计算大会上发布的两大 Agent 基础设施方案:支持单柜 4 万+ Agent 运行的 CPU 原生液冷整机柜服务器,以及实现多模型协同的多模融合 API 与元脑 SD200 超节点。
📝 详细摘要
文章报道浪潮信息针对 Agent 时代基础设施需求发布的最新方案。核心内容分两部分:一是业界首款 CPU 原生液冷整机柜服务器,单柜最大支持 384 颗 CPU,可支撑 4 万+个 Agent 协同运行,是此前方案的 40 倍;二是元脑企智 EPAI 平台上线多模融合 API,通过让多个候选模型独立生成答案再由评审模型融合,在 DRACO 测试中取得 53.9%成绩,超越任何单模型。配套的元脑 SD200 超节点将首 Token 延迟压至 4.77 毫秒,为国内首个进入 5 毫秒的方案。文章还分析了 Agent 时代基础设施竞争重点的转变——从单模型支持能力转向系统级协同能力。
💡 主要观点
-
Agent 时代基础设施需求发生根本性变化,CPU 重要性显著提升。
与一次输入一次输出的大模型推理不同,Agent 需要任务拆解、工具调用、多轮协作和持续运行,这些整型运算和逻辑推理主要运行在 CPU 上,且 Agent 常年在线,运行时间被大幅拉长。
浪潮信息发布 CPU 原生液冷整机柜,单柜可支撑 4 万+ Agent 协同运行。
该服务器采用 OCM 开放架构,单柜最大支持 384 颗 CPU,兼容 x86 和 ARM。散热思路完全重构,计算和散热协同设计,将内存、网卡、光模块、SSD 等所有发热部件一并纳入液冷体系,实现整机柜无线缆设计,运维效率提升 100%以上。
多模融合 API 让多个大模型协同完成复杂任务,超越单模型表现。
系统将同一任务同时分配给多个候选模型独立生成答案,再由评审融合模型比较共识、分歧、遗漏和独特观点,最终拼出统一输出。简单任务直接路由给轻量单模型,避免小题大做。
元脑 SD200 超节点首 Token 延迟压至 4.77 毫秒,为国内首个进入 5 毫秒的方案。
背后是软硬协同优化:多 Token 预测减少逐字生成轮次,W4A8 精度方案降低访存带宽压力,JIT 即时编译动态生成专用 GPU 内核。已适配 Kimi K2.6、DeepSeek V4、GLM 5.2 等主流开源模型。
Agent 基础设施竞争重点从单点能力转向系统级协同能力。
软件平台负责模型接入与资源调度,CPU 承载 Agent 实例与业务交互,GPU 负责模型推理,三者缺一不可。整条链路跑得顺不顺、协不协同成为关键。
💬 文章金句
- AI 基础设施的核心任务,已经从支撑大模型推理,转向支撑海量智能体的规模化运行与高质量 Token 的持续生产。
- 单点强已经不够,整条链路跑不跑得顺、协不协同才是关键。
📊 文章信息
AI 初评:81
来源:量子位
作者:克雷西
分类:人工智能
语言:中文
阅读时间:13 分钟
字数:3010
标签:
AI基础设施, AI Agent, 液冷服务器, 多模融合, 大模型协同
阅读完整文章