Portfolio News

启明星 | 生数科技骆怡航:从理解语言到理解世界,通用世界模型开启AI发展新主线 | WAIC 2026

24/08/2026

启明创投主办的2026世界人工智能大会(WAIC)“启明创投·创业与投资论坛——从算力原点到应用落地的进化征程”于7月19日在上海世博中心成功举办。

作为全球领先的多模态模型与世界模型研发团队,生数科技在2025年开源了首个基于视频生成大模型的统一架构的世界行动模型。生数科技联合创始人、首席执行官骆怡航在《通用世界模型:打通虚实边界,筑基物理智能》主旨演讲中,分享了团队在多模态生成和世界模型方面的最新探索。


生数科技联合创始人、首席执行官骆怡航

他表示“AI正在从理解与生成数字世界,走向理解并行动于真实的物理世界,世界模型正是这场变革的核心基座。生数科技是全球首个实现数字世界和物理世界统一的通用世界模型公司,构建起从理解到生成到行动的通用世界模型,为数字生成和物理行动提供智能。”

01/
世界模型:让AI从解读信息,走向参与真实世界

世界模型并不是一个全新的概念,但随着视频生成、多模态模型和具身智能快速发展,它正在从学术研究走向产业中心。在骆怡航看来,语言模型主要处理人与语言、知识和信息之间的关系,而世界模型面向的,是智能体与整个世界的交互。

他指出,人类智能并不只体现在语言处理上,人脑中大量区域都在参与视觉感知、行动规划和决策。这种智能的核心,是对物理世界的感知,以及基于环境变化作出动作决策。

“如果只依靠大语言模型理解世界,相当于只使用了人类智能中很小的一部分。大模型时代,还需要一个达到LLM范式级别的世界模型。”

视频模型需要理解人物和物体如何运动,机器人需要预测一个动作可能产生的结果,自动驾驶系统则需要在复杂环境中持续感知和实时决策。不同场景背后,依赖的是相似的底层能力:感知环境、预测变化并采取行动。

因此,世界模型并不等同于视频生成、三维重建或机器人控制中的某一项单点技术。一个完整的世界模型,需要形成持续运行的动态闭环。

感知、预测和行动不是三个彼此割裂的模块,而应当建立在统一的世界表征之上。模型不仅要知道世界是什么样,还要理解世界如何变化,以及行动如何改变世界。

02/
走向通用化:世界模型规模化落地的必经之路

当前,不少世界模型仍围绕家庭机器人、工业操作、自动驾驶等特定场景构建。但如果一种机器人、一个场景就需要训练一套模型,数据采集、训练和部署成本将难以规模化。

大语言模型带给行业的重要启示,是先通过大规模预训练建立通用能力,再迁移到不同任务和场景。世界模型也需要经历类似的演进。

它需要从海量视觉和交互数据中学习空间结构、运动规律、因果关系和行动逻辑,再将这些能力迁移到不同数字内容、机器人本体和现实任务中。

“世界模型不仅要形成感知、预测与行动的闭环,还要像语言模型一样,足够通用、足够泛化。”

不同智能体可以拥有不同形态,数字世界与物理世界也有不同的输出方式,但驱动它们运行的底层智能,应当是统一的。世界模型真正的竞争,不只是谁能在单项任务中取得更高成功率,更在于谁能建立具有规模效应、迁移能力和智能涌现潜力的通用基础模型。

03/
视频,正在成为理解世界的重要入口

构建世界模型,首先需要让AI看到并理解世界。文字是对现实的抽象表达,图像呈现的是某一时刻的状态,而视频则连续记录了世界如何发生变化。人物如何行动、物体如何受力、空间如何变化、一个行为如何引发后续结果,这些信息都蕴含在连续画面之中。

当视频模型预测下一帧画面时,它学习的不只是像素生成,也是在学习世界状态之间的转换关系。因此,视频模型的价值正在超越内容生产本身。它对时空结构、运动规律和物理一致性的建模能力,也在成为世界模型的重要基础。

在此基础上,世界模型还需要进一步吸收仿真数据、第一人称数据、人类操作数据和机器人真机数据,将对世界的理解转化为真实行动。生数科技由此构建统一的通用世界模型基座:先建立对世界的理解和预测能力,再面向数字与物理两个空间进行不同解码。

04/
一体两翼:同一通用基座,驱动数字生成与物理行动

围绕统一的世界模型基座,生数科技形成了覆盖世界生成、实时交互和世界行动的产品体系。

Vidu Q系列面向数字内容生成,持续提升模型对人物、场景、运动和物理规律的理解与预测能力,并增加内容创意和想象演绎能力;Vidu S系列推动视频从离线生成走向实时、连续交互,解锁人在物理空间与数字内容进行实时互动的场景,比如陪伴、互动、游戏等;Motubrain则面向物理世界,将模型对环境和任务的理解转化为机器人动作,实现物理世界中的实时交互。

三条产品路线面向不同场景,但背后共享的是对时空、因果和行动的统一建模能力。这也意味着,视频生成和具身智能并不是两条彼此独立的技术路线。

“数字世界和物理世界的Agent可以千差万别,但它们背后的智能应该是通用的、泛化的、统一的。”

在数字世界,世界模型可以推动视频、游戏和虚拟角色从静态内容,走向实时、连续、可交互的动态环境;在物理世界,它则可以推动机器人摆脱固定指令和预设流程,升级为能够理解目标、自主规划,并适应环境变化的智能体。

无论是虚拟角色、游戏智能体和内容 Agent,还是现实环境中的机器人,都需要理解所处环境、持续更新状态,并根据反馈作出决策。区别在于,前者将这种认知转化为内容生成与实时交互,后者则进一步将其转化为对行动结果的预测和可执行的物理动作。

它们最终指向的是同一个核心问题:机器如何建立对世界的认知,并基于这种认知完成生成、交互与行动。

05/
从生成世界,到行动于世界

大语言模型让机器开始理解和使用语言,视频生成模型让机器具备视觉创作能力,而通用世界模型所要推动的,是让机器进一步理解世界、预测世界并行动于世界。

在骆怡航看来,未来不同形态的机器人,都将成为物理世界中的Agent,像数字世界中的Agent一样实现自主规划与执行。而实现这一目标,真正的破局点仍然是模型。

“通用世界模型是物理智能最具潜力的技术路径。未来,数字世界和物理世界的Agent会是多样化的,但它们背后的智能是通用的——像人一样交流,像人一样创意,也像人一样行动。”

从处理信息,到理解变化;从生成内容,到作出行动,人工智能正在进入一个新的发展阶段。而通用世界模型,正是连接数字智能与物理智能、推动AI真正进入现实世界的关键基础设施。