![]()
“首次将动作光流引入具身动作表征。
2026年,具身智能赛道正处在从演示走向量产的关键转折点。
过去一年,人形机器人出货量增长近300%,但生产级场景占比不足两成。行业融资总额逼近千亿,研发投入和验证转化的速度却远远跟不上。资本催熟了“表演期”,却还没有催熟“打工期”。
问题出在哪里?
从技术路径看,大模型已经能较好地解决高层任务:语义理解、任务拆解、长程规划等数字世界里被反复验证的能力,正在快速外溢到具身领域。但底层动作生成始终是一道绕不过去的坎。宇树科技创始人王兴兴在2026年世界机器人大会上指出,机器人每次输入输出都伴随物理世界的偏差,最后几厘米甚至几毫米的触觉修正无法完成,成功率因此大幅下降。星动纪元创始人陈建宇则更直接:主流VLA本质是模仿学习,泛化能力存在天然瓶颈,面对全新场景和任务很难自主生成合理动作。多位业内人士的判断因此指向同一个结论:具身智能的“GPT时刻”不会卡在理解层,而是卡在动作层。
![]()
动作层的核心矛盾集中在数据效率,更深层的问题则在架构。
复旦深度学习实验室主任陈涛认为,具身底层模型架构急需突破,两年内很难实现具身模型的“GPT时刻”。问题未必只在数据规模或算力大小,更在于底层表征:现有表征难以让感知、物理反馈与动作序列高效流转,也难以支撑跨场景泛化。
针对行业现状,在多数厂商仍基于传统坐标点表征架构做工程迭代时,中科第五纪推出FAM 2.0具身基模,行业首次将光流引入具身动作表征,形成以动作光流与热力图为核心的差异化技术路线。该架构曾在4月份与8月中旬的WorldArena 1.0、2.0评测中击败多家头部具身企业。其背后的技术逻辑、数据体系与落地路径,也为行业提供了一种可参考的解题思路。
01.
FAM 2.0 核心架构:双路并行的表征革新
FAM 2.0 具身操作模型的核心,是如何表征机器人的动作。传统 WAM 的通用做法,是将动作直接表征为空间中的 XYZ 坐标点序列,模型输入与行为相关的坐标 token,直接输出末端执行器的坐标轨迹。这种方式的问题在于,坐标点与特定机器人的构型、自由度强绑定,不同本体之间的数据无法通用,每换一种机械臂都需要重新采集大量数据训练,数据复用性极低。
FAM 2.0 的核心突破,是引入动作光流(ActionFlow)作为动作的中间表征,同时并行输出热力图(Heatmap)辅助空间理解,二者融合后共同预测最终动作。
![]()
1. 动作光流 :解耦本体依赖的关键
光流原本是视频处理领域的概念,用于刻画相邻两帧视频之间的运动信息。中科第五纪将其引入具身动作建模,把第一视角视频作为输入,模型先预测光流序列,再从动作光流中解算 XYZ 坐标行为,其关键是建立一种能够跨越本体差异的动作表征。
中科第五纪青年首席科学家黄岩在机器人大讲堂的采访中解释了这一选择的底层逻辑:动作光流是一种统一的空间行为表征方式,它以类似视频帧的形式呈现动作,而非一串离散的坐标序列。这意味着,不同本体的动作都可以被编码到统一的光流空间中,模型可以利用不同本体的数据进行统一训练,从根本上解决了传统架构中数据与本体强绑定的问题。
这一技术路线并非一蹴而就,团队先后探索过三种表征方案:第一代是基于末端轨迹点的本体流表征,第二代是偏向静态表征的本体掩码(Mask)。但前者表征维度有限,后者缺乏动作连贯性。最终选择动作光流路线,是因为动作光流是一种随时间演变的动态表征,既保留了空间结构信息,又强调运动的连续性,对动作的刻画精度更高。
2. 热力图技术:无损空间信息,提升数据效率
如果说动作光流解决的是跨本体的数据复用问题,热力图技术解决的则是单一本体下的数据利用效率问题。
传统具身模型通常会将二维、三维的视觉信息压缩到一维特征向量中,这一过程会损失大量空间结构信息,导致模型需要海量数据才能学习到有效的空间交互逻辑。FAM 2.0 采用热力图架构,模型从视觉输入中直接预测三维空间的热力分布,引导模型关注与行为交互相关的区域,过滤复杂背景的干扰。
这是业内首个无损空间信息的模型架构。由于没有压缩过程,空间结构信息被完整保留,模型可以更高效地从数据中学习交互逻辑,直接带来小样本学习能力的提升。FAM 2.0已在多种机器人本体上完成验证:在单臂机械臂任务中,仅需数十条示范轨迹,平均成功率达到80%以上,超越π0.5等基线模型;在双臂轮式机器人的工业任务中,操作成功率超过97%。
动作光流与热力图在模型中是并行输出、联合预测的关系。热力图侧重提升单一本体的数据利用效率,动作光流侧重实现跨本体的数据复用,二者优势互补,共同构成了 FAM 2.0 的核心技术底座。
02.
AgesForge 数据平台:打通第一视角跨本体数据链路
模型架构的创新,需要配套的数据体系支撑。中科第五纪搭建的 AgesForge 数据平台,围绕第一视角(Ego-view)数据,构建了从人类操作示范到多本体机器人数据的完整生成链路。
1. 为什么是第一视角数据?
当前具身行业的数据来源主要分为三类:真机采集、仿真生成、人类视频。中科第五纪选择以人类第一视角视频为核心数据源,核心考量是数据的可扩展性。
团队深度思考后判断,第一视角数据的积累速度最快:一方面,可以通过给工厂操作人员佩戴头戴式采集设备,快速在全球各地的工业场景批量采集;另一方面,互联网上存在大量公开的第一视角操作视频,可以转化为模型训练资源。相比之下,真机采集成本高、周期长,仿真数据则存在质量瓶颈,在数据扩展速度上都弱于第一视角方案。
目前,AgesForge 平台已储备上万小时人类第一视角源视频,数据来源包括公开数据集与团队自采,首批生成的机器人第一视角数据达到 15 万小时,覆盖 15 种主流机械臂本体,目标是建成百万小时级的机器人数据集群。
![]()
2. 跨本体数据生成全链路
那么单份人类动作数据如何扩展到多种机器人本体?AgesForge 平台形成了六大核心环节的标准化链路:视觉分割、度量几何、动作映射、物理约束、视觉合成、数据封装。
第一步是视觉分割,通过分割模型从人类第一视角视频中分割出手与前臂区域,提取手部运动轨迹; 第二步是度量几何,结合深度信息重建手部三维姿态,将像素坐标转换为空间坐标; 第三步是动作映射,这是跨本体的核心环节 —— 团队没有直接做坐标点的拓扑映射,而是以动作光流为中间媒介,将人类动作的光流表征适配到不同机械臂的构型上,保留动作语义的同时匹配机械臂的运动学特性; 第四步是物理约束,针对不同机械臂的自由度、运动范围,做碰撞检测与可达性校验,过滤掉机械臂无法执行的动作; 第五步是视觉合成,在仿真环境中生成机械臂执行动作的第一视角视频,匹配真实场景的光照、遮挡与构图; 第六步是数据封装,输出标准化的机器人 RGB 视频、关节动作、夹爪状态等数据,支持 LeRobot、MP4、HDF5 等多种格式。
![]()
整个过程在同一帧轴上完成视觉理解、3D 重建、动作映射与质量审计,最终实现 “同源动作跨本体扩展”,一份人类操作示范,可以生成多种不同机械臂的训练数据,极大提升了数据生产效率。
03.
工业场景优先,筑牢底层能力
技术的价值最终要体现在落地上。作为一家定位于 “具身大脑” 的公司,中科第五纪的研发资源向大脑侧倾斜,落地则优先选择场景相对可控的工业领域。
其技术能力已经得到了公开评测的验证。在 WorldArena 1.0、2.0具身智能评测中,中科第五纪连续击败了具身智能多家头部企业,取得第一名的成绩。
胜出的核心原因并非工程优化或数据堆砌,而是模型架构层面的创新。“我们没有基于开源模型做纯数据调整或工程优化,而是坚持在表征层面做创新。动作光流表征加上第一视角预训练的组合,带来了性能上的本质提升。”
![]()
落地方面,FAM 2.0 已经在电力巡检与操作场景完成早期验证。通过热力图架构的少样本学习能力,客户只需采集少量现场数据,即可快速完成场景适配与部署,大幅降低了落地成本与周期。
目前,中科第五纪的技术已经进入汽车制造、物流仓储等工业场景,与零跑汽车等企业展开合作。其工业级数采实训平台已经可以模拟搬运、分拣等工位,生成场景多维数据,并提供开源接口支持二次开发。
行业判断:工业场景三年内有望实现规模化落地
针对行业热议的 “具身智能的 GPT 时刻”,黄岩给出了偏冷静的判断。
他认为,具身智能的真正瓶颈不在高层语义理解,而在底层动作生成与物理交互。大模型已经能较好完成任务拆解、长程规划,真正难的是让机器人在真实物理环境中精准、可靠地执行动作。
![]()
为此,中科第五纪选择动作光流作为统一动作表征,把动作从离散坐标序列转为动态光流,让不同本体的动作进入同一表征空间训练,从而破解数据与本体强绑定问题。
落地节奏上,他判断家庭场景至少需要 5 年以上,工业场景 3 年内有望规模化。公司未来一年将聚焦三个核心工业场景能力,并搭建面向工业大场景的预训练范式,推动工业领域“GPT 时刻”到来。
这一判断也决定了中科第五纪的目标非常明确:率先推动具身智能在工业场景实现规模化应用,并加速行业拐点的到来。
据介绍,公司未来一年左右将重点突破三个核心工业场景能力,同时搭建面向工业大场景的大规模预训练范式,包括数据平台、训练算法与基础模型,最终在基模的加持下,将典型场景的能力推广到更全面的工业场景,实现工业领域的 “GPT 时刻”。
04.
结语
回望整个具身智能行业,当多数玩家都在沿着 “大模型 + 机器人” 的路径,在既有架构上做工程优化与数据堆砌时,中科第五纪选择回到动作表征的底层问题,用动作光流与热力图重构了具身模型的基础逻辑。
这条路线的本质,是通过表征层面的创新提升数据利用效率,用数据效率的提升破解落地成本高、周期长的行业痛点。对于仍处于早期阶段的具身智能行业而言,底层技术的创新远比表面的演示效果更有价值。
工业场景是具身智能落地的第一站,也是检验技术成色的试金石。FAM 2.0 的技术路线已经展现出底层表征创新的可行性与阶段性成果,接下来将在更多真实场景中持续验证、迭代。但可以确定的是,只有更多企业沉下心来做底层表征与基础模型的创新,具身智能才能真正从演示走向落地,迎来属于自己的时代。
