Title: PixVerse 29.8 亿融资后,正在押注一个更大的故事 | BestBlogs.dev
URL Source: https://www.bestblogs.dev/article/ae91da34a5?amp%3Butm_medium=feed&%3Butm_campaign=resources&%3Bentry=rss_article_item
Published Time: 2026-07-16 17:00:00
Markdown Content: 过去,视频是一个结果;未来,视频是一个入口。
👦🏻 作者: GaKi
🥷 编辑: Koji
🧑🎨 排版: NCon
2026 年上半年,世界模型方向上的钱很「热」。
Forbes 6 月底有过一篇报道,标题是:
「VCs Pour $3 Billion Into AI's Next Big Bet: World Models」。
在这个方向上,World Labs(李飞飞创办)完成 10 亿美元融资,估值 54 亿美元;LeCun 离开 Meta 后创办的 AMI Labs,种子轮拿了 10.3 亿美元,创下欧洲 AI 种子轮历史纪录;Decart 完成 3 亿美元 B 轮,估值 40 亿;Runway 完成 3.15 亿美元 E 轮,估值 53 亿。
但仔细看这份名单会发现,相当一部分拿到大额融资的公司,原来是做 AI 视频模型的。
Runway 在 2025 年底发布自己的世界模型 GWM-1 之后,就把公司定位从「AI 视频」改成了「世界模型」。可灵的拆分融资也在讲世界模型的故事。OpenAI 今年 3 月关停了 Sora 的消费端产品,但保留了 Sora 团队,方向也指向世界模型。 AI 视频公司集体转向世界模型,是因为对视频模型厂商来说,在这条路径上,通往世界模型最顺畅的一步,就是互动游戏。
在这个背景下,AI 视频公司爱诗科技(PixVerse)近期完成了整体 C 轮融资,累计 29.8 亿元,C+ 轮由阿里巴巴领投。同期发布了 PixVerse Game,一个用实时视频模型驱动的游戏引擎。
🚥
下面聊聊我们对这个方向的观察,以及对产品的实际体验。
实测:目前能做到什么
我们实际体验了 PixVerse Game 平台,并试着制作了一个叫「Whispering Woods Romance」的游戏,奇幻森林背景,画风偏日系。
PixVerse Game 的操作入口和常规 AI 视频工具有一定相似性,进来是一个提示词输入框。区别在于,这里不需要写很长的提示词来约束生成方向,一句话就可以。
平台目前提供三种游戏模式:探索、策略、对战。输入框旁边还有参考图上传和提示词灵感推荐:
每种游戏类型都带有完整的数值系统,包括能力值面板、任务系统、角色升级、道具收集和历史记录。
输入提示词之后,大约 10 到 15 秒就能进入游戏。首先是角色选择界面,PixVerse Game 自动生成了三个角色,每个角色有不同的属性分配和数值面板:
选定角色之后,画面开始实时生成。下面是角色在森林场景中行进时的画面。游戏全程配有字幕和语音旁白。
因为画面由视频模型实时生成,视觉质感和传统游戏引擎渲染的效果有明显区别,整体偏柔和,画面确实还比较 AI:
下面是一段完整的游玩录屏。
界面左侧是角色的功能模块和属性面板,右侧是任务面板,游戏过程中会不断弹出道具收集提示,引导玩家推进下一步任务。整局游戏有一条完整的故事线,目前单局时长在 10 分钟以内:
这一局的剧情没有做详细设定,系统自动生成了一条故事线,角色在森林中解锁谜题,最终找到了一个孪生姐妹。游戏结束后,历史道具、属性变化和任务进展都有完整的结算展示:
平台上也能看到其他玩家制作的游戏。比如下面这个 CyberRun,赛博朋克风格:
整体玩法框架和我们制作的游戏类似,系统会根据故事线和游戏风格,自动决定每一次升级方向、剧情走向和画面逻辑:
除了探索模式,PixVerse Game 也支持策略类游戏,玩法有所不同:
对战模式下,界面会切换为 HP 血条和战斗选项,交互方式和探索模式有明显区分:
画面目前还处在比较早期的状态,但游戏要素的完整度已经有了基本保证:
一次生成的游戏难免会有各种问题,玩家也需要对细节做调整。PixVerse Game 内置了一个叫 Game Composer 的编辑工具,可以自定义游戏中的各项参数和内容。除了在数值面板上直接操作,也可以通过左侧的 Agent 对话框用自然语言来修改:
比如通过对话,可以直接为游戏新增一套资源系统:
同样的流程也可以用来调整一个全新的项目。下面是一个编辑过后的中世纪骑士游戏的游戏界面:
体验下来,几个比较直观的感受。
画面确实是实时生成的视频流,能感觉到和传统游戏渲染的差别。
交互方式和传统游戏完全不同,可以用自然语言来驱动角色行为,意味着玩家能做的事情理论上是开放式的,不受预设选项的限制。
当然,PixVerse Game 目前本身不是一个游戏,而更偏向一次探索。
但如果只把它看作一个「AI 游戏产品」,可能低估了 PixVerse 真正想做的事情。对于 PixVerse 来说,游戏更像是实时世界模型的一次落地实验。
比如,利用实时世界模型持续生成的画面世界,替换传统游戏中繁重的渲染与内容生产管线,并将实时视频模型、游戏机制工具链和用户自定义世界观结合起来。
这背后则涉及到了视频模型、游戏引擎、世界模型,这三者的「特殊站位」。
视频模型、游戏引擎和世界模型
PixVerse Game 在做的事情,放在整个技术演进的脉络里会更容易看懂。
在早期阶段,Sora、Veo、可灵、Seedance,这些模型基本都是给一段文字或一张图片,生成一段固定长度的视频。生成完就结束了,用户无法对画面做任何改变。但在训练过程中,这些模型已经在学习物理世界的规律,比如光影怎么变化、物体怎么运动、遮挡关系怎么处理。
模型没有被显式地教过物理,但它从大量视频数据里自己学到了。
之后就是加入交互,这一步催生了所谓的「神经游戏引擎」。模型开始逐帧生成,每一帧都参考用户当前的输入。
这个阶段有几个标志性的节点。 2024 年,Google 研究团队发布了 GameNGen,第一次用扩散模型实时运行了经典游戏 DOOM,在单块 TPU 上达到 20fps。画面的视觉质量已经高到让人来分辨哪段是真实游戏、哪段是 AI 生成的,准确率只比随机猜测好一点。
几乎同一时期,以色列公司 Decart 发布了 Oasis,第一个完全由 AI 生成的可以玩的游戏。它看起来像 Minecraft,但背后没有任何传统游戏引擎和代码,完全依靠「下一帧预测」来运行。
Decart 在今年 5 月完成了 3 亿美元 B 轮,投资人包括 Nvidia、Sequoia、前 OpenAI 联合创始人 Andrej Karpathy,以及任天堂创始家族成员。
最新的阶段是通用世界模型,DeepMind 的 Genie 3 可以从文字描述生成可以导航的三维动态世界,24fps、720p。Runway 的 GWM-1 分出了 Worlds(交互式环境生成)、Robotics(机器人训练仿真)、Avatars(数字人行为模拟)几个方向。
来源:@ MinChoi
到了这一步,一个模型同时处理内容生成、行为建模和渲染,产出的东西已经更接近一个有规律的数字世界。
在这条路径上,PixVerse 的位置逐渐可以被清晰地确定。
年初,PixVerse 发布了 R1,一个支持 1080P 的实时世界模型,也就是此次支持 PixVerse Game 的模型。
和传统视频模型不同的是,R1 生成的是一段可以持续的、能实时响应用户指令的视频流。用户可以在视频持续生成的过程中,用自然语言改变画面,比如指定「让天空变成黄昏」,或者「角色向左移动」。
进一步的,我们在上面实测的案例中,PixVerse Game 做的事情,是把实时视频生成的能力接入游戏创作。传统游戏引擎(比如 Unity、Unreal)是用预先制作的美术资产和代码来构建游戏世界,
PixVerse Game Engine 则是用实时视频模型来生成游戏世界。创作者定义规则、目标、玩法和世界观,角色、场景和画面在玩家交互的过程中实时产生。
据 PixVerse 官方,他们用一句话概括这个理念: 「To Create is to Play」。
意思是创作本身就是游戏体验的一部分,这有点类似 Roblox 或 Minecraft 的创作者生态,但底层驱动力从引擎和代码变成了 AI 模型。
而支撑这一整套路径都顺利走下去,至少不会遇到太大阻力的事实是 AI 视频赛道真的「很具有商业想象力」。
AI 视频赛道的商业想象力
PixVerse 联合创始人谢旭璋在今年 6 月的联合国 AI for Good 峰会上曾判断:
「过去,视频是一个结果;未来,视频是一个入口,通向游戏、直播、叙事、社交和创作者经济。」
AI 视频已经是 Coding 之外,AI 行业里另一条获得了真实商业验证的路径,这个背景很重要。
2026 年中国 AI 短剧市场规模预计 300 亿元,海外 AI 短剧市场从去年的 1 亿美元增长到今年预计的 6.5 亿美元,同比增长 550%。YouTube 上头部短剧频道中,使用 AI 内容的占比已经超过 63%。
YouTube 大中华 AI 业务负责人的说法是: 「去年下半年 AI 内容的营收只有实拍短剧的 10%,今年已经接近 40%。」
以 PixVerse 自己为例, 其在 2025 年底的年度经常性收入(ARR)超过 4000 万美元,全球用户 1.5 亿,覆盖 177 个国家和地区。
做一个对比,OpenAI 的 Sora 在今年 3 月正式关停。这个产品的日运营成本约 100 万美元,上线以来的总收入只有 210 万美元。
!Image 22: 图片 Sora 的退出说明了这个赛道的竞争已经到了淘汰阶段,纯技术展示和品牌效应不够用了,需要有真实的用户量和收入。
与之相对,根据晚点与谢旭璋在 3 月的一次采访,PixVerse APP 和网站的留存率相当高,用户并不是一次性体验后离开。
这背后反映的是,AI 视频已经从早期的技术展示阶段,逐渐进入真实生产和创作场景。用户愿意反复使用、愿意为生成内容付费,才是支撑下一阶段发展的基础。
AI 视频在「生成画面」这个层面上的商业价值已经被验证,但如果视频模型的能力继续向前延伸,从生成一段固定画面到生成一个可以交互的世界,那带来的商业想象力会大很多。
传统游戏制作需要完整的内容生产管线:3D 建模、动画制作、美术渲染、音效设计、叙事脚本,一个中型项目需要几十人团队工作几个月甚至几年。AI 实时游戏可以把这条管线大幅压缩。
世界和画面由模型实时生成,创作者只需要定义规则和世界观。
这会带来几个值得关注的变化。
最直接的一个是每个玩家体验到的游戏内容可以完全不同。画面由模型实时生成,同一个游戏在不同玩家手中可以展开出不同的画面和故事走向。
同时,创作门槛大幅降低,不需要 3D 建模能力,不需要编程经验,用自然语言描述想要什么样的游戏世界就能开始创作。而且游戏内容可以持续延展。传统游戏的内容量取决于团队能力和预算,AI 生成的游戏世界理论上可以持续产生新的场景和叙事分支。
一个值得关注的案例,是最近在小红书和 B 站上获得不少关注的一个项目。 三个女生组成的独立工作室,制作了一个快穿风格的乙女游戏 PV,爱诗科技作为整个项目背后的技术支持。这个 PV 在两个平台发布后获得了超过 1 万赞。
对于一个 AI 生成的游戏 PV 来说,这个互动量已经不低了。说明玩家群体对 AI 制作的游戏内容有接受度,前提是内容本身有足够的吸引力。
AI 游戏的能力在快速提升,但离让玩家完全满意还有距离,这两件事同时成立。
但是,需要注意的是其创作者「北北」提到过去制作一个男主角的 3D 模型需要 3 到 6 个月,使用视频模式之后,3 周就达到了同样的影视级画面效果。 继影视之后,游戏可能是下一个被 AI 视频技术大幅度改变的创意行业。
🚥
今年 6 月 17 日,Koji 曾与 PixVerse 联合创始人谢旭璋进行过一次深度对谈,其中聊到了 PixVerse R1 这一实时世界模型。
在谈到这个模型时,谢旭璋提到,当实时世界模型的响应时间趋近于 0,用户就可以通过键盘、鼠标或者摇杆,对视频生成过程中的方向、角度和深度进行实时控制,从而尝试打造一个 AI 原生的互动游戏引擎。 「创作即消费」也将成为可能。
再往远看,是通用世界模型正在迅速吸引注意力。
一个模型同时处理内容生成、行为建模和环境渲染,应用范围从游戏延伸到机器人仿真(Runway 的 GWM-Robotics 在做)、自动驾驶模拟(Waymo 基于 Genie 3 做了专门的驾驶场景仿真模型)、数字人互动(PixVerse 也在用实时交互技术做 AI 虚拟主播)。
AI 视频模型验证了「从数据中学习世界」是可行的,短剧市场证明了这个能力的第一层价值,就是更好的视频画面。当这个能力继续延伸到交互、到实时生成、到可以参与的环境时,它能支撑的商业空间会比短剧大得多。
PixVerse 从视频生成做到 1.5 亿用户,从实时世界模型做到游戏引擎。这条路径上的每一步都有对应的产品和数据。
整个 AI 视频行业都在经历类似的方向选择,最终哪条路能走到足够远,还要看接下来一两年的产品验证。
!Image 26: 图片 十字路口正在寻找独立撰稿人,撰写 AI 产品和模型评测。
如果你写过类似文章:《实测 PixVerse C1[1]》、《实测 LibTV[2]》,请联系 zeo0811@gmail.com ,邮件内容请包括:① 个人介绍、② 你写过的 AI 评测文章。
我们会提供有竞争力的稿酬。期待与你一起观察与记录 AI 时代 🎪