擂台上,戴红色拳套的人形机器人和穿着护具的人类拳手对峙。人类出拳,机器人侧身让开;人类起腿,它后撤一步稳住重心;等到空档出现,它单腿支撑,另一条腿扫向对手躯干。
视频全长38秒,画面标注全程实拍、没有加速。9月7日晚,宇树科技放出这段G1人形机器人的自由搏击实录,同时给出一个技术定性:全球首次由世界模型实时驱动的全自主人形机器人格斗。
![]()
(首图|来源:微博@宇树科技 9月7日发布截图。视频封面即为人机对峙画面,原视频38秒,发布15小时观看量6.2万次)
全自主三个字是整段视频的分水岭。过去一年,人形机器人在擂台上挥出的每一拳,背后几乎都站着一个人。这一次,遥控器放下了。
01.
此前的每一拳,都是借来的
2025年5月,CMG世界机器人大赛把G1送上格斗擂台,那场直播里,机器人的攻防由场边操作员遥控完成。美国的REK、UFB等机器人格斗联盟走得更远,把VR头显和手柄做成标配,机器人实际上是操作员的远程替身。更多展会上的擂台表演依赖预设动作库,出拳、格挡、倒地起身全部按脚本回放,两套程序并排播放,彼此之间没有真正的交互。
三种模式有一个共同点:决策权在人手里,或者在脚本里,机器人只负责执行肢体。
这条视频的差别恰在决策权的归属。画面中,G1会跟着对手调整站位,对手移动后它不再对着空气挥拳,而是重新瞄准、出拳、收势。按照官方口径,全程无预设招式、无人工遥控,机器人自主完成预判、闪避、进攻、重心恢复,跑通了从感知到预测、从决策到执行的完整闭环。
人类一拳从启动到命中,快则零点几秒。机器人要在同一个时间窗口里做完四件事:看清对手的动作,评估威胁,决定应对,把指令下发给全身关节。
按传统的分层架构,这四步串行执行。相机采集、状态估计、规划求解、电机响应,每一环都在吃掉时间预算。环环相加,被动反应式的控制永远慢半拍,拳头到了眼前,指令还在路上。
解法只有一个,把反应变成预判。在机器人内部运行一个推演引擎:给定当前观测和一组候选动作,先算一遍接下来会发生什么,再挑一条最有利的轨迹交给身体执行。搏击把这种需求推到了极限,对手行为不可预知,碰撞和扰动持续发生,推演慢一拍就直接失衡。官方把擂台称作高压测试场景,原因就在这里。
模型负责想,身体负责扛。擂台上两个画面最能说明硬件的分量。
一个是单腿踢击。G1身高约1.32米,体重约35公斤,全身23至43个关节电机(视配置而定),关节峰值扭矩最高120牛·米。单腿支撑时,全身重量压在一侧的踝与髋关节上,另一条腿还要加速甩出,扭矩裕度差一点就是侧翻。
另一个是挨踢后的后撤步。被踢中的瞬间,冲击先由关节吸收,低减速比、可力控的关节方案让电机能在碰撞中反向卸力,随后全身协同调整姿态,几步之内把重心收回来。
02.
官方沉默,论文开口
视频只有画面和结论。没有论文,没有延迟数据,没有评测基准,UnifoLM-X2-1.0的内部结构,官方一个字都没说。
三周前,8月17日,arXiv上挂出一篇论文,RoboStriker。作者来自上海交通大学、上海人工智能实验室、华中科技大学、中国科学技术大学、上海创智学院,研究的是同一件事:让29个自由度的G1人形机器人学会全自主拳击,并且完成了真机部署。
先把关系说清楚。论文署名里没有宇树,官方也没有公布X2-1.0与这项研究的任何关联,它是学术界交出的同题答卷,不是宇树的官方论文。它的价值在于,这是目前公开渠道里唯一能拆开来看的同类系统。想搞清楚全自主搏击背后的技术底座,这篇论文是最好的参照样本。
论文首先回答了最根本的那个问题:让机器人自己摸索着打架,为什么这么难。
答案是“具身冷启动”。G1有29个自由度,每个控制周期要填29个数字,而这些数字的绝大多数组合在物理上站不住。强化学习要靠大量、多样的探索才能发现战术,可在29维关节空间里乱撞,机器人还没打出第一拳就先摔倒了,战术智能根本没有机会出现。
RoboStriker的解法是换一张地图。不在29维空间里博弈,先把什么动作物理可行蒸馏成一个32维的隐空间,归一化到单位超球面上,球面上的每一点都对应一个站得住的动作。策略学习搬到这张有界的地图上进行,再怎么探索,也掉不出物理可行的边界。
地图分三步画出来。
第一步,找职业拳击手,用Xsens惯性动捕采集30分钟、50Hz的动作,出拳、防御、步法、转换全覆盖,镜像翻倍后重定向到G1身上,训出一个运动追踪器。这一步先把拳击长什么样固化下来。
第二步,师生蒸馏。把追踪器学到的运动知识压缩进32维隐空间,配上共享解码器,隐码进去,29维关节指令出来。
第三步,先打靶,再对打。打靶阶段用对抗运动先验(AMP)约束动作风格,让机器人像个拳手,而不是乱挥;对打阶段用隐空间神经虚构自博弈(LS-NFSP),每个机器人带两套策略上场,最佳响应策略负责进攻进化,平均策略负责稳定锚定,九成时间出狠招,一成时间走老路。
![]()
(配图|来源:RoboStriker论文Figure 1,arXiv:2608.16195。左为运动追踪器预训练与隐空间蒸馏,右上为AMP行为预热,右下为隐空间神经虚构自博弈)
为什么偏偏是32维?论文做了对照实验。8维和16维压得太狠,动作重建误差分别高达128.2毫米和85.9毫米;64维的动作更精细,搜索空间却随之膨胀,战术学习变慢,进攻落点率从0.685掉到0.520。32维恰好卡在动作保真与策略易学之间的平衡点上。
训练成本也值得一说。整套系统在单张RTX 4090上训练,Isaac Lab仿真器里同时跑4096个平行擂台,物理循环200Hz,策略频率50Hz。消费级显卡干成这件事,意味着这套方法论的复制门槛并不高。
成绩先摆出来。RoboStriker与8个基线交叉对战,全胜。对直接在29维关节空间做自博弈的方法,胜率100%。进攻落点率0.685,是原始空间基线0.142的4.8倍;交战率0.824,意味着八成以上的时间里,机器人同时保持着有效击打距离与朝向对齐,没有消极避战。
消融实验拆出了最值钱的部件。拿掉打靶预热,战术学习直接瘫痪,落点率只剩0.050,不到完整模型的十三分之一。拿掉AMP风格约束,机器人还在进攻,架势没了,落点率跌去28%。结论很直白:先学打靶再上擂台,比想象中重要得多。
![]()
(配图|来源:RoboStriker论文Figure 4,arXiv:2608.16195。MuJoCo仿真可视化对比,去掉AMP后机器人姿态明显变形)
真机部署也跑通了。两台G1在动捕棚里对打,策略以50Hz跑在机载CPU的ONNX Runtime上,双机通过ROS 2协调,骨盆上的标记点以100Hz提供对方的位置。
![]()
(配图|来源:RoboStriker论文Figure 3,arXiv:2608.16195。)
视频:两台G1在动捕环境中近身对打,注意这是论文的实验画面,不是宇树官方视频(来源:RoboStriker项目主页)
到这里,论文与视频可以放在一起对照了,差异比相似更有信息量。
论文里是双机对打,视频里是人机对打。论文靠动捕棚的标记点告诉机器人对手在哪,视频没有交代对手感知从哪里来,画面日志里只有策略服务器的请求记录。论文的策略跑在机器人自己的CPU上,视频的日志显示,重的推演跑在擂台之外的工作站上。
![]()
(配图|来源:宇树官方视频截图。左列实拍画面为人机对打,中右两列模型预测 规划未来为模型推演画面,底部日志栏可见[Client]→PolicyServer的OBS/replan请求与env.step动作下发)
最耐人寻味的是路线差异。论文走自博弈,战术从两个智能体的相互进化里长出来;官方叙事走世界模型,靠预测未来再行动。一个回答战术从哪来,一个回答行动凭什么准。从工程逻辑看,这两个问题迟早要在同一个系统里汇合。
没答的题同样要列清楚。论文没有报告真机胜率,没有公开失败案例,没有与真人交手,理论部分的严格证明放在项目主页而非正文。官方那边,没有论文,没有延迟数据,没有benchmark。对手拳头的感知,是两套系统共同的盲区。
03.
擂台只是考场
搏击的意义从来不在搏击。把这份能力清单拆开看:预判外部扰动、动态维持平衡、接触力可控、突发状况实时重规划,每一项都对应着非结构化环境里的真实作业需求。工厂里被工件撞了一下的机械臂,废墟里踩着瓦砾的救援机器人,客厅里绕着孩子走的家庭机器人,需要的就是同一组本领。
之前的擂台直播里,拳头属于操作员。这一次,拳头属于模型。论文里的模型在动捕棚里打双机,视频里的模型在工作站的加持下打人机,下一个版本要回答的问题已经摆在那儿:把推演搬回机器人自己的身体,把感知从标记点换成自己的眼睛。
等那一天到来,38秒的擂台实录,才算真正变成日常。
参考资料
[1] 宇树科技官方微博 @宇树科技,2026年9月7日视频发布:UnifoLM-X2-1.0实现人形机器人全自主搏击
[2] Kangning Yin, Kaige Liu, Zhe Cao, et al. RoboStriker: Latent-Space Strategic Games for Autonomous Humanoid Boxing. arXiv:2608.16195, 2026-08-17. https://arxiv.org/abs/2608.16195
[3] RoboStriker项目主页:https://sites.google.com/view/robo-striker/
[4] 太平洋科技快讯:世界模型实时驱动,宇树科技首次实现全自主人形机器人格斗,2026-09-08
[5] 中新经纬:全球首次!宇树科技实现人形机器人全自主搏击,2026-09-07
[6] Humanoids Daily: Unitree Unveils UnifoLM-X2: World Model AI Powers Fully Autonomous Robot Combat, 2026-09
[7] The Yangtzeer: Unitree pushes humanoids from scripted moves to autonomous fighting, 2026-09
[8] AlphaSignal: Unitree's UnifoLM-X2-1.0 Lets Humanoid Robots Fight With No Human Control, 2026-09
[9] 北京日报微博:2026世界机器人大会宇树展台报道,2026-08-19
[10] 宇树G1官方参数页:https://www.unitree.com/g1
