![]()
“知识不是静态的库,而是持续生长的本体网络。
9月,具身智能圈发生了两件大家耳熟能详的大事。
一件是大洋彼岸的李飞飞联合创办的World Labs正式发布了“全球首个多模态世界模型”,成功把文本、图像、视频、相机位姿和三维深度信息塞进同一个框架,既能生成画面、又能重建空间、还能给机器人做仿真训练。
另一件是首钢园内那个占地3000平方米的北京市石景山具身智能训练中心完成了一次从底层逻辑到技术架构的彻底升级,将在服贸会期间正式亮相。操盘这次升级的核心技术方,正是凌云光·元客视界,一家三度荣获国家科技发明奖的视觉龙头企业。
更有意思的是,这次升级的技术路线,恰好与李飞飞Atlas所代表的“世界模型”方向不谋而合。两个事件指向了同一个方向:具身智能的竞争,正在从“让机器人模仿动作”转向“让机器人理解世界”。只是一个在硅谷发布论文和Demo,一个在首钢园搭建真实的数据采集基础设施。一个在“想”,一个在“做”。
今天这篇文章,我们独家拿到了北京市石景山具身智能训练中心这次升级的资料。从100多台真机遥操,到4D光场80视点矩阵+Ego+高精度光学运动捕捉采集HOI真人和物体环境交互数据,这场技术路线的“换脑手术”,到底在换什么?
![]()
01.
“停运”到底是怎么回事?
在聊北京市石景山具身智能训练中心的升级之前,先回答一个更根本的问题:为什么机器人训练这么难?
过去两年,具身智能赛道的热度肉眼可见。但到了真正的工厂产线、仓储物流、家庭服务场景,机器人的表现往往大打折扣。泛化能力差、可靠性不足、作业节拍跟不上,这背后的问题在于,大多数机器人,还停留在“模仿动作”的阶段,缺少对物理世界的自主理解能力。
传统训练场以2D视频、动作轨迹数据为主,本质上是在让机器人“看录像学动作”,光照固定、场景单一、没有真实世界的随机扰动。机器人学到的只是“在特定环境下做特定动作”的模板,换个场景立刻失灵。更准确地说,传统数据只能回答“这个动作怎么做”,无法解决环境变化后“该做什么决策”的问题。
而解决这个问题的关键,行业内外越来越达成共识。那就是数据维度必须从2D视频→3D静态空间→4D动态世界全面升级。因为机器人需要的不是更多动作片段,而是一个可以被反复训练、推演、验证的“世界模型”,在这个模型里,必须有三维空间、有时间维度、有物理规律、有因果关系。
但世界模型的构建,卡在一个最底层的问题上:数据从哪里来?仿真数据脱离了真实的物理场景,单视点实拍数据维度单一,高质量的真实4D数据采集成本极高、标准化极差。世界模型的算法在飞速迭代,能喂给它的数据却远远跟不上。
所以当李飞飞说“机器人最大的瓶颈是数据”时,她说的不是“数据不够多”,而是“能够匹配世界模型训练需求的数据,近乎空白”。
![]()
这正是石景山训练场升级要解决的核心命题。2025年3月,北京首个人形机器人数据训练中心在石景山首钢园揭牌,占地3000平方米,部署了100多台机器人,搭建了家庭康养、汽车装配、3C电子工厂等十大实景场景。作为国内首个规模化数据训练场,它完成了从0到1的验证,积累了千万级的轨迹片段数据。
但运营过程中,一个问题越来越清晰:这个模式虽然迈出了第一步,但离真正的产业需求还有距离。
问题出在哪?核心瓶颈有两个。
瓶颈一是环境太“干净”。实验室场景毕竟不是真实产线。光照是恒定的,物料是标准的,干扰是可预期的,而真实世界充满了物料公差、光线干扰、场地不平等不可预知的物理变量。数据干净是好事,但太干净反而是问题。模型在这样的数据上训练出来,到了真实场景泛化能力严重不足。
瓶颈二是成本难以下沉。根据行业测算,真机直接采集一小时交互数据的成本约200元,完成100万小时采集总成本高达2亿元。而要训练出真正通用的具身智能模型,至少需要数千万小时级别的数据,目前缺口超过99%。
这两个瓶颈本质上指向同一个结论,那就是用“真机遥操+实验室场景”的模式,无法规模化产出训练世界模型所需的海量高质量数据。于是,今年8月,运营方作出一个关键决定,原地启动一次彻底的技术升级。不再是简单地增加更多机器人、搭建更多场景,而是从采集范式到技术架构的全面重构。
升级的核心思路不再是让机器人“模仿动作”,而是让数据系统“理解世界”。这次升级的技术总操盘手,正是凌云光·元客视界。
02.
一次技术底层逻辑的重构
升级前后的差别,绝不只是换了几台设备那么简单。这是一次从数据采集哲学到技术架构的彻底重构。
旧模式是让机器人模仿动作。在实验室里,操作员操控机器人完成一个动作,相机录下来,模型照着学。问题是机器人学到的只是“在特定光照、特定角度、特定环境下做特定动作”的模板。换个场景,立刻失灵。
新模式是让机器人理解世界。升级后的训练场不再依赖100多台真机遥操,而是新建多视点4D高斯光场采集系统,真实还原物体的运动轨迹、形变过程及光影变化。输出的不再是静态截图式的2D视频,而是高保真的4D动态素材,包括三维空间+时间维度信息。
这背后的技术支撑,正是元客视界的LuStage-RoboX多视点场景数据采集系统+80台全域4K同步相机密集视点阵列。
![]()
这套系统能干什么?在家庭场景下,它能复现从家务清洁到烹饪备餐、照护老人的全流程动作;尤其是工业场景的极致可靠性要求场景和物体结构建模数据Chamfer≤2mm,人体动作原语标注身体PVE≤20mm, 手部≤5mm。
80台4K相机全域分布式布控,实现场景360°无死角密集采样的同时各有分工,部分相机阵列完成人物场原生世界模型数据采集,部分相机阵列针对手部和物体灵巧操作、精细交互特写输出高精度高写实数据。
此外,这套模式借鉴开放世界游戏LOD(Level of Detail)细节层次技术,细节处数据精度高;全局场景切换成相对精度更低的数据,降低 存储、CPU、GPU和网络传输开销,节省数据采集成本与耗时,兼顾高精度、高效率和低成本;采集速度毫秒级时间同步,从源头杜绝多视角数据时空错位;4DGS高精度高斯溅射渲染,突破传统点云、网格建模的细节瓶颈。
更关键的是世界模型的引入。该模式基于真实采集到的4D数据,能自动推演生成海量多样化的仿真场景,把数据规模化扩充。不再靠人工在封闭实验室里一帧一帧攒数据,而是用真实数据做种子,让AI自己长出更多训练素材。
这与李飞飞Atlas正在做的事无疑有着异曲同工之处。Atlas的核心能力正是“将文本、图像、视频、相机位姿和三维深度信息纳入同一个模型框架”。而石景山训练场,正在同样用真实的物理采集设施,为这类世界模型提供最稀缺的原生4D基座数据。
03.
覆盖机器人的“全生命周期”
机器人大讲堂独家了解到,升级后的训练场,围绕机器人的训练需求设计了四个核心区域。
区域一是4DGS世界模型基座数据采集区。其主要依托LuStage-RoboX多视点场景数据采集系统 80台4K相机阵列,为世界模型提供高保真4D时空基座数据,同时还可以根据采集场景和精度要求,减少到4/8/16/32等稀疏视点规格,选择和场景匹配的最优系统,解决的是“机器人怎么看世界”的问题。
区域二是机器人通用运控模型基座数据采集区,主要依托FZMotion光惯融合动捕系统,覆盖标准基座运动、机器人组装实操运动、出厂偏差运动、小脑模型验证运动全场景数据。解决的是“机器人怎么动”的问题。
![]()
区域三是通用大脑精细操作场景预训练数据区,这片区域主要针对第一人称Ego视角手部数据采集的遮挡、精度、泛化难题,采用多视点三维重建真值反向标注Ego视角的方案,官方透露能将遮挡工况数据完整率从传统60%提升至99.5%以上,解决的是“精细操作怎么学”的问题。
![]()
区域四是典型工业场景后训练数据采集区。其通过采用非侵入采集,无需工位改造、无需暂停量产,工人保持原生作业姿态,产线节拍影响率为0。解决的是“怎么在真实产线落地”的问题。
![]()
这四大区域形成一个完整的数据金字塔结构,其底层是4D世界模型的通用基座数据,中间是机器人运控的通用能力数据,上层是精细操作的专项能力数据,顶层是面向具体工业场景的后训练数据。
04.
全新训练场的双引擎
这次升级的背后,元客视界拿出的正是它的两把“杀手锏”,FZMotion光学惯性融合运动捕捉系统与LuStage-RoboX多视点场景数据采集系统。两套系统一套提供人体精运动的数据(主要负责小脑),另外一套实现人物场建模和运动(主要负责大脑),两者形成了较好互补,共同构成4D世界模型数据采集的技术闭环。
引擎一:FZMotion光学惯性融合运动捕捉系统
机器人要动得稳、动得准,靠的是“小脑”,也就是运控模型。而小脑训练最缺的,是高精度、带误差、连续动态的真实运动数据。FZMotion光学惯性融合运动捕捉系统,采用光学高精度定位+惯性连续补帧的光惯融合架构,在工业复杂遮挡场景下仍可保持全程连续跟踪。毫米级动态量测能精准捕捉机器人出厂个体误差、关节运动间隙、负载形变偏差。这套系统此前服务过国家拳击队,用来捕捉运动员的出拳轨迹、速度、角度,同样的技术,现在被迁移到机器人训练中。
![]()
引擎二:LuStage-RoboX多视点场景数据采集系统
如果说FZMotion解决的是“动”的问题,那LuStage-RoboX解决的是“看”和“理解”的问题。机器人要理解世界,不能靠单视角的平面图像,而需要完整、连续、时空一致的四维信息,例如物体在三维空间中如何运动、形变、与周围环境交互,随时间如何演化。
LuStage-RoboX多视点场景数据采集系统,核心是一套“相机矩阵”——80台4K同步相机全域分布式布控,实现场景360°无死角密集采样,毫秒级时间同步,从源头杜绝多视角数据时空错位。这套系统的输出,不再是零散的2D视频片段,而是高保真的4D动态场景数据,包括人物走动、物体交互、环境变化、光影流转,全部能被精确数字化,还原为真实物理世界的动态三维模型。
这套系统此前最著名的实战,是2026年央视春晚。创意节目《梦底》中,演员刘浩存的数字分身以亚毫米级精度呈现,发丝与服饰动态1:1还原,背后的技术正是LuStage+4DGS(4D高斯溅射)的融合应用。通过70路4K高清视频实现360°高密度多视角同步采集,构建了全球首例4K超高清4D光场重建直播工程。
从春晚舞台到机器人训练场,从拳击台到具身智能数据底座,两套系统共享同一套底层哲学——以人为中心的数据采集。
![]()
元客视界总经理李淼对此有过清晰的阐述:“过去的数据采集逻辑是以机器为核心,人操控机器,不仅效率低,数据质量也达不到要求,数据与机器人绑定,复用性不足;现在是以人为核心,即以人类动作数据为样本构建通用模型,赋能多种机器人共用。”
这个转变看似简单,实则颠覆了行业多年的惯性思维。过去大家想的是怎么让机器人动起来然后录下来,现在想的是怎么把人类最自然的行为数字化,然后教会机器人,FZMotion捕捉人的运动,LuStage记录人所在的世界,二者合一,才构成一个完整的“人在世界中行动”的数字样本。
这也是为什么这套双引擎方案能够支撑4D世界模型训练的根本原因:世界模型要学的不仅是“世界长什么样”,还包括“人在这个世界里怎么行动”。 FZMotion教小脑“动”,LuStage教大脑“看”,动与场结合,机器人才能真正学会“看见世界、理解世界、进入世界”。
05.
回到开头:Atlas与石景山,两条腿走路
在全球范围内,产业圈和学术圈一直认为李飞飞的Atlas证明了一件事,那就是世界模型或许将是具身智能的必经之路。
但Atlas目前仍处于面向少数合作伙伴的早期访问阶段,World Labs尚未公开完整的模型参数、训练数据、推理成本及第三方测试结果。它更应被视作一个值得跟踪的技术方向,而非一款已经成熟的产品。
而北京市石景山具身智能训练中心的升级,做的是另一件事,他们试图为这个世界模型的时代,铺设数据采集的新一代基础设施。
![]()
当全行业都在讨论“世界模型”的时候,谁在为世界模型提供真实、高精度、可规模化的训练数据?谁在解决“数据从哪来”这个最底层的问题?
北京市石景山具身智能训练中心,给出了一个中国答案。
这个答案并不完美。经历了一次技术路线的选择与重构。但正是这种敢于承认“旧路走不通”、敢于推倒重来的勇气,让这个项目有机会走向真正的产业价值。
从“动作模仿”到“世界理解”,从“实验室遥操”到“4D世界模型”,石景山的这次升级,或许本质上是一场关于“机器人如何学习”的认知革命。
而元客视界,正站在这场革命的最前线。正如元客视界副总经理杜华所言:“光学运动捕捉技术是唯一能够在每个环节做到毫米级精度的数据采集方式,也是具身智能从研发到量产不可替代的基础设施。”
当李飞飞的Atlas在硅谷定义“世界模型应该长什么样”的时候,北京市石景山具身智能训练中心正在用FZMotion和LuStage,一帧一帧地采集这个世界真实的样子。
一个在“想”,一个在“做”。两条腿走路,才能让机器人真正“进入世界”。
