对话生数科技张金涛,深度拆解 Vidu S1 实时交互视频模型背后的全栈推理加速技术,以及他对 AI 视频未来趋势与创业管理的思考。
📝 详细摘要
本期节目,26 岁的清华在读博士、生数科技推理加速负责人张金涛,分享了从学术研究(SageAttention)到 Vidu S1 实时交互视频产品落地的完整技术路径。他详细阐述了实现“快到能实时生成”的三层加速架构:算子层(如 SageAttention 利用 GPU 更低比特单元加速 Attention)、模型层(通过步数蒸馏和稀疏 Attention 将 Diffusion 去噪步数从 50 步降至 4 步)和部署层(TurboServe 解决多卡并行与流式用户调度)。此外,他还探讨了硬件与算法协同设计(Co-Design)作为推理加速未来核心方向的观点,分析了中国视频生成模型因数据质量和文化需求而领先的原因,并分享了他从科研到带团队的成长经历与对创业热潮的看法。节目兼具硬核技术干货、行业格局判断与个人成长洞察。
💡 主要观点
- 推理加速需要算子、模型、部署三层全栈协同优化 仅做算子层优化(如让 Attention 算得更快)是不够的,还需在模型层通过蒸馏、稀疏化降低计算复杂度,并在部署层解决集群调度和通信问题,S1 实时视频正是这三层合力的结果。
💬 文章金句
- 生成速度需要大于播放速度,它才能做到实时生成。
- 硬件上明明还有更快的计算单元……为什么没有人做?这是很明显的一个收益。
- 我坚信未来我们的视觉娱乐信号会被 AI 生成的内容充斥掉,替换掉。
- 知道世界上最正确、最领先的方法是什么,然后把它正确实现出来。
- 两行有问题的代码就足以让实验失败。
📊 文章信息
AI 初评:92
来源:十字路口Crossing
作者:十字路口Crossing
分类:人工智能
语言:中文
阅读时间:57 分钟
字数:14227
标签: 视频生成, 推理加速, Vidu S1, SageAttention, 实时交互