← 回總覽

快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频

📅 2026-07-20 00:00 十字路口Crossing 人工智能 2 分鐘 1468 字 評分: 92
视频生成 推理加速 Vidu S1 SageAttention 实时交互
📌 一句话摘要 对话生数科技张金涛,深度拆解 Vidu S1 实时交互视频模型背后的全栈推理加速技术,以及他对 AI 视频未来趋势与创业管理的思考。 📝 详细摘要 本期节目,26 岁的清华在读博士、生数科技推理加速负责人张金涛,分享了从学术研究(SageAttention)到 Vidu S1 实时交互视频产品落地的完整技术路径。他详细阐述了实现“快到能实时生成”的三层加速架构:算子层(如 SageAttention 利用 GPU 更低比特单元加速 Attention)、模型层(通过步数蒸馏和稀疏 Attention 将 Diffusion 去噪步数从 50 步降至 4 步)和部署层(Tur

📌 一句话摘要

对话生数科技张金涛,深度拆解 Vidu S1 实时交互视频模型背后的全栈推理加速技术,以及他对 AI 视频未来趋势与创业管理的思考。

📝 详细摘要

本期节目,26 岁的清华在读博士、生数科技推理加速负责人张金涛,分享了从学术研究(SageAttention)到 Vidu S1 实时交互视频产品落地的完整技术路径。他详细阐述了实现“快到能实时生成”的三层加速架构:算子层(如 SageAttention 利用 GPU 更低比特单元加速 Attention)、模型层(通过步数蒸馏和稀疏 Attention 将 Diffusion 去噪步数从 50 步降至 4 步)和部署层(TurboServe 解决多卡并行与流式用户调度)。此外,他还探讨了硬件与算法协同设计(Co-Design)作为推理加速未来核心方向的观点,分析了中国视频生成模型因数据质量和文化需求而领先的原因,并分享了他从科研到带团队的成长经历与对创业热潮的看法。节目兼具硬核技术干货、行业格局判断与个人成长洞察。

💡 主要观点

- 推理加速需要算子、模型、部署三层全栈协同优化 仅做算子层优化(如让 Attention 算得更快)是不够的,还需在模型层通过蒸馏、稀疏化降低计算复杂度,并在部署层解决集群调度和通信问题,S1 实时视频正是这三层合力的结果。

实时交互是未来视觉娱乐的主流形态 金涛将视觉内容分为离线(电影/短视频)和在线交互(聊天/游戏)两种,并认为人类对实时、个性化交互娱乐的需求远超离线内容,而 AI 实时生成将满足这一海量需求。
推理加速的未来在于软硬件协同设计(Co-Design) 中间的算子优化层将随工具进步而收敛,未来的核心壁垒在于更底层的专用/通用芯片设计,以及更上层的算法减负,且两者必须紧密结合,单做一层难以形成有效的加速方案。
打造世界领先技术的关键在于将每个环节都做到极致 受导师朱军启发,金涛认为 GPT-3 式的成功并非依赖单一神秘技巧,而是需要清楚地知道最正确的方法,并确保从模型、数据到代码实现的每一个环节都正确无误地执行。

💬 文章金句

- 生成速度需要大于播放速度,它才能做到实时生成。

  • 硬件上明明还有更快的计算单元……为什么没有人做?这是很明显的一个收益。
  • 我坚信未来我们的视觉娱乐信号会被 AI 生成的内容充斥掉,替换掉。
  • 知道世界上最正确、最领先的方法是什么,然后把它正确实现出来。
  • 两行有问题的代码就足以让实验失败。

📊 文章信息

AI 初评:92

来源:十字路口Crossing

作者:十字路口Crossing

分类:人工智能

语言:中文

阅读时间:57 分钟

字数:14227

标签: 视频生成, 推理加速, Vidu S1, SageAttention, 实时交互

收听完整播客

查看原文 → 發佈: 2026-07-20 00:00:00 收錄: 2026-07-20 02:00:27

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。