虎牙推出基于 DiT 架构的实时多模态数字人基础模型 VAM 1.0,仅需一张照片即可生成能聊天、唱跳、玩游戏且连续运行 24 小时不掉线的 AI 数字人,并通过三阶段训练和全链路工程优化解决了行业长期稳定性、实时交互和规模化部署三大难题。
📝 详细摘要
文章以第一人称体验方式,全面展示了虎牙最新发布的 VAM 1.0(Vivid Avatar Model)实时多模态数字人基础模型。该模型基于 DiT 架构,仅需一张照片即可生成 480×832 分辨率、28 帧实时流式输出的 AI 数字人,支持连续 24 小时以上直播互动。实际体验显示,数字人具备自然流畅的聊天、唱歌、跳舞、换装以及玩塔罗、狼人杀等游戏的能力,并能通过文字和语音两种方式实时互动,支持打断、话题切换、称呼记忆等全双工交互,面部表情与肢体动作自然同步。文章深入剖析了 AI 数字人行业面临的「三堵墙」:长时间运行的累积误差导致画面崩坏、缺乏真正的双向交互能力、规模化上线的工程挑战,并详细解读了虎牙的解决方案——三阶段训练(锚定形象、多目标偏好优化、模型蒸馏与自纠错)以及从底层算子到权重的全链路工程优化。最终在 8 块 H200 集群上实现 36.4fps 推理速度、0.77 秒片段延迟和 1.3 秒首帧延迟,在多项 benchmark 中领先。文章还指出,虎牙拥有超过十年的直播场景积累,弹幕与语音双链路、全双工能力等设计直接来自真实直播需求,使其在 AI 数字人落地方面具备独特优势。
💡 主要观点
- 虎牙 VAM 1.0 仅需一张照片即可生成实时互动的 AI 数字人,支持聊天、唱歌、跳舞、游戏等多种交互形式。 该模型基于 DiT 架构,通过三阶段训练(锚定形象、多目标优化、蒸馏加速)实现 480×832 分辨率、28 帧流式输出,连续运行 24 小时不崩,首帧延迟仅 1.3 秒。
💬 文章金句
- 数字人到底是「内容生产工具」,还是「实时交互主体」?
- 有模型的人不少,但有模型、有场景、场景还是 7×24 小时运转的直播平台,这个组合,现在确实比较稀缺。
- 能互动,才有真实的用户粘性和商业价值。
- AI 正从外挂变成直播系统的一部分。
📊 文章信息
AI 初评:87
来源:量子位
作者:一水
分类:人工智能
语言:中文
阅读时间:23 分钟
字数:5541
标签: AI 数字人, 实时交互, 多模态 AI, 虚拟主播, DiT 架构