← 回總覽

114B 参数、6B 激活,Sand.ai 开源全球首个千亿 MoE 视频生成模型

📅 2026-08-05 15:05 鹭羽 人工智能 1 分鐘 1230 字 評分: 84
视频生成 MoE 开源模型 AI 基础设施 多模态 AI
📌 一句话摘要 清华系团队 Sand.ai 开源全球首个千亿参数 MoE 视频生成模型 MAGI-2-preview,通过自研架构与底层优化大幅降低推理成本。 📝 详细摘要 本文报道了清华系团队 Sand.ai 开源的全球首个千亿参数 MoE 视频生成模型 MAGI-2-preview。该模型总参数达 114B,单次前向仅激活约 6B,生成成本仅为行业主流模型的十分之一。技术上,模型延续了音画协同建模的单流架构,并创新性地采用 Multi-Head LatentMoE 设计,配合自研 MagiMoE 算子库与 Head Parallel 并行策略,有效解决了视频 MoE 的通信与 Scal

📌 一句话摘要

清华系团队 Sand.ai 开源全球首个千亿参数 MoE 视频生成模型 MAGI-2-preview,通过自研架构与底层优化大幅降低推理成本。

📝 详细摘要

本文报道了清华系团队 Sand.ai 开源的全球首个千亿参数 MoE 视频生成模型 MAGI-2-preview。该模型总参数达 114B,单次前向仅激活约 6B,生成成本仅为行业主流模型的十分之一。技术上,模型延续了音画协同建模的单流架构,并创新性地采用 Multi-Head LatentMoE 设计,配合自研 MagiMoE 算子库与 Head Parallel 并行策略,有效解决了视频 MoE 的通信与 Scaling 瓶颈。该模型的开源为学术界研究超大视频模型提供了宝贵资产,也为企业私有化部署提供了全新选择。

💡 主要观点

- MAGI-2-preview 实现了千亿参数视频 MoE 模型的开源,大幅降低了视频生成成本。 模型总参数 114B,单次前向仅激活 6B,生成 10 秒 1080P 视频的成本仅需 5 毛钱,约为行业主流模型的十分之一,且在 AA 视频生成榜单中排名第六。

采用单流架构与 Multi-Head LatentMoE 设计,重构了视频模型的 Scaling 路径。 文本、视频和音频在单流架构中共同建模,音画同步更自然;Multi-Head LatentMoE 将隐藏表示拆分并独立路由,每层拥有超 3000 个独立专家单元,提升了能力组合的多样性。
自研 MagiMoE 算子库与 Head Parallel 并行策略,攻克了视频 MoE 的通信瓶颈。 通过在路由前按 head 分配计算,使设备间传输形状固定的表示,通信量不再随激活专家数波动,从而解决了视频长序列带来的通信开销问题。

💬 文章金句

- 单纯迁移 MoE 不管用,还要扛得住超长序列和跨卡通信,同时保证音频、视频、文本在同一套系统里顺畅协作。

  • 千亿级 MoE,不只属于语言模型。

📊 文章信息

AI 初评:84

来源:量子位

作者:鹭羽

分类:人工智能

语言:中文

阅读时间:15 分钟

字数:3632

标签: 视频生成, MoE, 开源模型, AI 基础设施, 多模态 AI

阅读完整文章

查看原文 → 發佈: 2026-08-05 15:05:41 收錄: 2026-08-05 18:00:57

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。