当人工智能从屏幕中的对话、创作与编程,走向真实环境中的感知、决策与行动,它需要面对一套更复杂的考验。无论是自动驾驶车辆应对动态路况,还是机器人完成取物、洗衣等日常任务,都要求AI理解空间关系、预测行动后果,并根据环境变化及时调整。
正因如此,世界模型被寄予厚望。它有望为AI提供在行动之前,推演未来的能力。从生成逼真的视频,到预测行动后果,再到驱动机器人完成真实任务,世界模型正在连接数字空间与物理世界。
但模型能否真正理解环境、在变化中可靠执行,并以可承受的成本实现落地,仍有待进一步探索,这也是行业近段时间讨论的重点。
9月10日下午2026 Inclusion·外滩大会上,由香港大学计算与数据科学学院主办、香港大学上海智能计算研究院协办的, “世界模型是AI走向物理世界的新大陆吗”见解论坛正式举行。来自高校与企业的嘉宾围绕世界模型的能力边界、具身智能的技术路径及商业化挑战展开交流。

马毅:人工智能时代的产学研融合
香港大学计算与数据科学学院创始院长马毅教授在开幕致辞中,介绍了港大计算与数据科学领域的学科建设及在上海的教学科研布局。他表示,人工智能的快速发展正在改变人才培养、科学研究与产业转化之间的关系。过去相对分离的教学、科研和成果应用,如今越来越需要在同一创新过程中紧密结合。

香港大学计算与数据科学学院创始院长马毅教授
马毅指出,香港大学希望发挥国际化教育及学术研究优势,结合上海的产业、人才和创新资源,探索适应人工智能时代的产学研协同模式,并推动AI在医疗、健康、能源、材料等领域的应用。他也鼓励高校教师将前沿研究转化为创业实践,增强高校与产业的联系。
谈及世界模型,马毅表示,三维与四维世界的感知和建模一直是计算机视觉研究的重要问题。今天的世界模型已经超出传统三维重建和物体识别的范畴,进一步指向机器人在开放物理环境中的感知、认知、学习与交互。这一变化也为高校研究与产业合作带来了新的空间。
王晓刚:物理AI的开悟时刻
大晓机器人董事长、商汤科技联合创始人兼执行董事、香港中文大学电子工程系教授王晓刚,以《物理AI的开悟时刻》为题,分享了世界模型、高质量数据与机器人场景落地相结合的实践。

大晓机器人董事长、商汤科技联合创始人兼执行董事、香港中文大学电子工程系教授王晓刚
王晓刚认为,具身智能要从特定任务走向更广泛的应用,需要同时突破数据与模型两方面的限制。围绕单一任务反复采集真机数据、训练模型的方式,难以经济地覆盖真实世界中不断变化的需求。大晓提出的ACE研发范式,强调通过穿戴式传感设备,在真实生产生活环境中采集人类行为数据,并与真机数据融合,减少新任务和新本体适配对大量专门采集数据的依赖。
在模型方面,王晓刚介绍了开悟世界模型“理解、生成、预测”一体化的架构:通过理解判断环境和任务状态,通过生成推演不同动作可能产生的后果,再通过预测支持机器人控制,三种能力共享特征并形成反馈闭环。他以洗衣等长程任务为例指出,机器人不仅需要识别空间关系、分解任务,还要判断每一步是否完成,并据此调整后续动作。
数据质量是这一路径的重要基础。王晓刚表示,真实场景中包含多视角、力触觉和交互反馈的数据,有助于模型学习物体属性与物理规律。相比在固定环境中重复执行相同任务,开放环境中的多样化行为及失败案例,对提升模型泛化能力更有价值。他同时介绍了环境式数据采集设备、自动化数据生产平台、ACE-Data-0开源数据及相关评测建设。
在产业应用方面,大晓正通过“一脑多形”适配不同机器人本体,并围绕即时零售、酒店洗衣及开放场景自主作业推进落地。王晓刚表示,商业部署既是模型能力的检验,也是持续获得真实数据、推动模型迭代的途径。
骆怡航:通用世界模型的探索与实践
生数科技联合创始人兼CEO骆怡航以《在行动前,看见未来:从世界模型第一性原理出发》为题发表演讲。他认为,AI要在物理世界中行动,需要先感知环境、推演未来,再根据行动结果持续修正决策。通用世界模型应当具备理解、预测与行动的完整闭环,单独的视频生成、空间重建或策略控制,只覆盖了其中的部分能力。

生数科技联合创始人兼CEO骆怡航
围绕这一判断,骆怡航介绍了生数科技提出的五级演进路线:从模拟和生成世界,到实时交互,再到驱动物理行动,进一步发展为能够自主规划和迭代的世界智能体,最终探索多智能体自主协同。他结合Vidu Q、Vidu S、Motus及Motubrain的实践,介绍了团队从数字内容生成向具身行动延伸的过程,以及在跨本体适配、长程任务执行和动态决策方面的探索。
在现场,骆怡航发布了面向灵巧操作的通用世界模型Motus2。据其介绍,新模型将触觉信息纳入统一建模,并将动作采样、后果预测、价值评估与策略改进结合起来,使成功、次优和失败的动作都能够成为学习依据。同时,模型引入记忆机制,以应对遮挡、环境变化及连续操作中的状态保持问题。
骆怡航强调,灵巧操作是世界模型进入物理世界的一项严苛考验。机器人接触物体之后,需要判断用力大小、调整方向及可能产生的后果,这要求模型形成更完整的反馈闭环。他也表示,目前相关探索仍存在不足,长期记忆、在线学习、联合评测和高效部署等问题,仍是迈向自主智能体需要解决的挑战。
圆桌对话:世界模型是AI走向物理世界的新大陆吗?
圆桌环节由香港大学计算与数据科学学院副院长(AI研究与技术转移)、副教授罗平主持,忆生科技联合创始人兼CTO、香港大学计算与数据科学学院助理教授杨言超,瞬适科技创始人、上海科技大学研究员、助理教授、YesAI实验室负责人石野,极佳视界联合创始人、首席科学家、通用世界模型北京市重点实验室主任朱政,以及源策未来联合创始人兼CEO李天羽,参与讨论。
嘉宾围绕世界模型的定义、研究动因、潜在风险、适用场景及大模型发展带来的影响,交流了各自判断。

什么样的系统才算世界模型?
针对世界模型与视频生成、物理仿真器及视觉语言动作模型(VLA)的区别,一套系统至少要具备什么能力,才真正算是具身智能的世界模型,嘉宾给出了不同侧重的解释。
李天羽从广义和狭义两个层面作出区分:广义上,编码物理世界认知的模型都可以纳入讨论;狭义上,面向具身应用,则更应关注策略或机器人能否与模型形成交互。
朱政看好视频生成路线在数据、架构和训练方法上的积累,同时指出,人形机器人的世界模型还需要考虑大脑、小脑与灵巧手的协同。
石野认为,传统物理仿真与数据驱动的世界模型具有互补性:前者包含明确的物理规律,后者能够从数据中吸收更多环境变化与交互经验。
杨言超则提出三个关键条件,即理解和预测未来、从数据中提取可预测的结构并形成记忆,以及依赖记忆持续学习和进化。
哪些现实问题推动AI从生成走向理解?
结合对大语言模型以及自动驾驶的观察,李天羽强调,物理AI的容错空间很小,真实部署对持续运行的可靠性提出了更高要求,这需要模型对环境形成更深入的理解。
朱政结合创业实践表示,世界模型虽然受到广泛关注,但距离通用可用仍有差距。数据和模型规模的扩展必须同时考虑算力开支与商业可行性。
石野则以机器人倒水、倒茶的任务为例指出,在固定数据上学会动作,并不意味着能够理解新的任务要求。一旦目标或环境变化,依赖既有轨迹的系统可能继续执行错误动作。
杨言超用儿童学习新玩具作比喻:模型可以生成逼真的图像,却未必能够像孩子一样,通过观看一次演示、进行少量尝试就学会新技能。在他看来,面对不断变化的家庭环境,这种快速理解和学习的能力尤为重要。
世界模型最可能被高估在哪里?
对于技术路线的风险,杨言超提醒,不能把生成准确等同于理解正确。他结合研究经验指出,画面的逼真程度并不必然对应机器人交互能力的提升,模型是否学到了对行动有用的结构,更值得关注。
石野认为,世界模型的内涵和技术范式还会持续演变。引入更多模态可能提升能力上限,也会带来计算、数据和架构设计上的额外负担。
朱政则将商业闭环视为关键挑战:世界模型能否找到明确的付费需求,并用收入和融资支持下一代研发,关系到这条路线能否持续推进。
李天羽关注高质量训练信息的获得成本。他指出,视频、三维、深度和触觉等表征并非天然低成本,如何规模化获得低噪声、富含物理信息的数据,是需要长期解决的问题。
哪些场景更需要世界模型?
围绕世界模型是否是所有任务的必选项,杨言超提出,应重点考察试错代价和训练数据获取成本。当现实试错昂贵、数据难以获得时,在执行前预测行动后果更有价值;而对于成本较低的简单任务,未必需要每次决策都调用世界模型。
石野补充,一些工业任务不仅采集数据昂贵,重置环境也需要较高成本,世界模型可以在这些环节发挥作用。同时,它也有望支持机器人部署后的反馈学习与持续迭代。
朱政更看重家庭等开放环境的需求。他认为,家庭任务和操作对象变化较多,更需要模型通过少量演示快速适应;对于短期内相对固定的工业或零售任务,VLA结合预训练与后训练已有一定解决能力,世界模型的必要性需要具体判断。
李天羽则指出,视觉世界模型在简单、干扰较少的环境中更容易发挥优势,复杂背景下的可靠性仍需提升。
大语言模型的泛化进展会带来怎样的冲击?
针对大语言模型在三维理解、编程和工具调用方面的进展,杨言超认为,这为物理智能带来了新的可能,关键在于如何将相关能力与记忆、持续学习机制结合。
石野表示,更强的大模型和智能体工具有望提高数据处理、研发和自动化流程的效率,但工具调用能力与机器人直接理解并执行物理任务之间,仍存在距离。
朱政从产业竞争角度指出,基础模型企业拥有较强的人才和资源积累,世界模型及具身智能创业公司需要尽快兑现技术与产品价值。
李天羽认为,三维资产生成和数据清洗是大模型能够直接提供帮助的方向。不过,机器人端侧算力需要与其创造的价值相匹配,云端大模型的技术路径不能简单照搬到具身系统中。
让模型能力在真实场景中接受检验
本场论坛呈现了世界模型从研究概念走向产业实践的多条路径,也保留了不同技术路线之间尚未解决的分歧。生成能力如何转化为行动能力,数据规模如何转化为泛化能力,以及技术投入如何转化为可持续业务,是贯穿讨论的核心问题。
在论坛总结中,罗平表示,世界模型未必是通往物理智能的唯一路径,但在赋予机器空间想象、常识推演与行动预测能力方面具有重要潜力。他代表香港大学计算与数据科学学院,邀请产业界围绕场景验证、联合研发、技术转移和生态共建开展合作,推动科研成果进入生产线和日常生活。
从预测世界到可靠地参与世界,世界模型的价值最终需要在真实任务中得到证明。能否降低新场景的适配成本、从失败中持续学习,并在长期运行中创造可衡量的效益,将成为检验这一方向的重要尺度。
