Xmax AI 发布全球首个实时交互视频模型 X2.0,支持毫秒级响应的实时换人、异次元召唤与触屏交互,并可在消费级显卡和 iPhone 上本地运行,开放 API 面向电商、虚拟陪伴、直播等行业。
📝 详细摘要
Xmax AI 于今日凌晨全球首发实时交互视频模型 X2.0,主推三大能力:实时渲染(CharX/ClothX/VibeX 实现帧级换人换装)、次元交互(以现实物体为锚点召唤虚拟角色并支持抚摸、对视等深度互动)、触屏交互(拖拽静态图像使其「复活」)。技术层面,Xmax 采用流式生成架构,将响应时间压缩至毫秒级,通过多阶段蒸馏、上下文持久化与极致压缩打破速度、成本、质量的「不可能三角」,单张消费级显卡可达 960p@24fps,iPhone 端可达 384p@16fps。团队提出「统一交互架构」,支持文字、屏幕、空间等多种交互模式。文章展望了电商虚拟试穿、IP 活化、直播范式重构等产业应用,并开放 API 接入 B 端,定价为同类竞品 Decart 的十分之一。
💡 主要观点
- X2.0 实现毫秒级实时交互,突破传统视频模型数秒延迟瓶颈。 采用流式生成架构(双工结构),模型持续计算的同时用户端已看到画面流出,结合蒸馏与量化压缩,单卡可达 960p@24fps,iPhone 可达 384p@16fps。
💬 文章金句
- 打开摄像头。世界,就在那里。你口袋里那个每天都带着的设备,可以是一扇随时能通往异世界的门。
- 一百多年来,视频的载体换了无数副面孔……但有一件事,从未被真正打破:屏幕里发生的一切,和屏幕前的你,始终隔着一道看不见的墙。你能看,但你不能碰。你能消费,但你无法介入。
📊 文章信息
AI 初评:77
来源:量子位
作者:Jay
分类:人工智能
语言:中文
阅读时间:18 分钟
字数:4445
标签: AI视频生成, 实时交互, 视频模型, AIGC, 虚拟形象