← 回總覽

Agent 要数量也要脑子!浪潮信息一边单柜养 4 万 Agent,一边让大模型组队答题

📅 2026-07-13 19:59 克雷西 人工智能 2 分鐘 1618 字 評分: 81
AI基础设施 AI Agent 液冷服务器 多模融合 大模型协同
📌 一句话摘要 本文报道浪潮信息在 2026 开放计算大会上发布的两大 Agent 基础设施方案:支持单柜 4 万+ Agent 运行的 CPU 原生液冷整机柜服务器,以及实现多模型协同的多模融合 API 与元脑 SD200 超节点。 📝 详细摘要 文章报道浪潮信息针对 Agent 时代基础设施需求发布的最新方案。核心内容分两部分:一是业界首款 CPU 原生液冷整机柜服务器,单柜最大支持 384 颗 CPU,可支撑 4 万+个 Agent 协同运行,是此前方案的 40 倍;二是元脑企智 EPAI 平台上线多模融合 API,通过让多个候选模型独立生成答案再由评审模型融合,在 DRACO 测试

📌 一句话摘要

本文报道浪潮信息在 2026 开放计算大会上发布的两大 Agent 基础设施方案:支持单柜 4 万+ Agent 运行的 CPU 原生液冷整机柜服务器,以及实现多模型协同的多模融合 API 与元脑 SD200 超节点。

📝 详细摘要

文章报道浪潮信息针对 Agent 时代基础设施需求发布的最新方案。核心内容分两部分:一是业界首款 CPU 原生液冷整机柜服务器,单柜最大支持 384 颗 CPU,可支撑 4 万+个 Agent 协同运行,是此前方案的 40 倍;二是元脑企智 EPAI 平台上线多模融合 API,通过让多个候选模型独立生成答案再由评审模型融合,在 DRACO 测试中取得 53.9%成绩,超越任何单模型。配套的元脑 SD200 超节点将首 Token 延迟压至 4.77 毫秒,为国内首个进入 5 毫秒的方案。文章还分析了 Agent 时代基础设施竞争重点的转变——从单模型支持能力转向系统级协同能力。

💡 主要观点

- Agent 时代基础设施需求发生根本性变化,CPU 重要性显著提升。 与一次输入一次输出的大模型推理不同,Agent 需要任务拆解、工具调用、多轮协作和持续运行,这些整型运算和逻辑推理主要运行在 CPU 上,且 Agent 常年在线,运行时间被大幅拉长。

浪潮信息发布 CPU 原生液冷整机柜,单柜可支撑 4 万+ Agent 协同运行。 该服务器采用 OCM 开放架构,单柜最大支持 384 颗 CPU,兼容 x86 和 ARM。散热思路完全重构,计算和散热协同设计,将内存、网卡、光模块、SSD 等所有发热部件一并纳入液冷体系,实现整机柜无线缆设计,运维效率提升 100%以上。
多模融合 API 让多个大模型协同完成复杂任务,超越单模型表现。 系统将同一任务同时分配给多个候选模型独立生成答案,再由评审融合模型比较共识、分歧、遗漏和独特观点,最终拼出统一输出。简单任务直接路由给轻量单模型,避免小题大做。
元脑 SD200 超节点首 Token 延迟压至 4.77 毫秒,为国内首个进入 5 毫秒的方案。 背后是软硬协同优化:多 Token 预测减少逐字生成轮次,W4A8 精度方案降低访存带宽压力,JIT 即时编译动态生成专用 GPU 内核。已适配 Kimi K2.6、DeepSeek V4、GLM 5.2 等主流开源模型。
Agent 基础设施竞争重点从单点能力转向系统级协同能力。 软件平台负责模型接入与资源调度,CPU 承载 Agent 实例与业务交互,GPU 负责模型推理,三者缺一不可。整条链路跑得顺不顺、协不协同成为关键。

💬 文章金句

- AI 基础设施的核心任务,已经从支撑大模型推理,转向支撑海量智能体的规模化运行与高质量 Token 的持续生产。

  • 单点强已经不够,整条链路跑不跑得顺、协不协同才是关键。

📊 文章信息

AI 初评:81

来源:量子位

作者:克雷西

分类:人工智能

语言:中文

阅读时间:13 分钟

字数:3010

标签: AI基础设施, AI Agent, 液冷服务器, 多模融合, 大模型协同

阅读完整文章

查看原文 → 發佈: 2026-07-13 19:59:57 收錄: 2026-07-14 04:00:38

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。