近日,星尘智能(Astribot)团队发布在线强化学习框架SmoothRL,并在真实机器人任务中完成验证。该技术关注的并非传统意义上的机器人动作生成,而是解决一个长期困扰具身智能发展的核心问题:机器人如何在真实工作过程中边执行、边学习、边改进。
过去几年,机器人基础模型快速发展,视觉语言动作模型(VLA)让机器人具备了理解指令、规划动作和完成复杂任务的能力。但从实验环境进入真实世界后,机器人仍面临明显差距。一个经过大量数据训练的模型,往往可以完成任务的大致流程,却容易在接触、定位、力度控制等细节环节出现偏差。
例如,机器人能够拿起物体,却可能无法精准放置;能够打开包装,却可能因为几毫米的位置误差导致失败。这些问题并不是单纯增加训练数据就能解决,因为真实环境中的变化具有高度随机性,物体位置、摩擦力、动作延迟都会影响最终结果。
在线强化学习被认为是解决这一问题的重要方向。不同于传统离线训练,在线强化学习允许机器人通过真实交互获得反馈,并根据成功或失败不断调整策略。然而,机器人领域长期存在一个技术障碍:真实机器人的运行节奏与算法训练节奏并不一致。
机器人执行动作时,控制系统需要保证连续性和稳定性,而强化学习算法通常需要暂停环境、收集数据、更新模型,再继续执行。这种同步方式在模拟环境中可行,但在现实机器人上容易造成动作延迟甚至失控。相关研究早已指出,异步强化学习能够降低学习过程对实时控制的影响,使机器人在持续运行状态下完成策略更新。
SmoothRL的创新点正是在这一矛盾中寻找新的平衡。该框架没有要求机器人停止工作等待模型更新,而是按照真实执行过程重新划分动作数据。机器人已经完成或确定执行的部分不会重新修改,真正产生训练价值的是当前实际执行的一段动作,而尚未执行、可能被新策略替换的部分则被舍弃。
这一设计意味着强化学习不再只关注模型认为机器人应该做什么,而开始关注机器人实际上做了什么。对于具身智能而言,这是一种重要变化。过去机器人训练更多依赖预先采集的数据,而未来机器人可能需要在部署后继续成长,根据自身经历不断调整。
从测试结果来看,SmoothRL已经展示出这一方向的潜力。在Astribot S1机器人实验中,动态投掷、给笔戴帽、开箱三个任务均实现明显提升。其中动态投掷成功率由39%提高到94%,笔帽装配任务由8%提高到83%,开箱任务由30%提升至90%。实验显示,在线强化学习不仅提高任务成功率,也改善了机器人运动稳定性,使执行过程中的加速度和动作变化更加平滑。
这类技术进展背后反映的是机器人发展路线正在发生变化。过去,机器人能力提升主要依靠工程师设计结构、编写规则、采集数据,再进行模型训练。而随着基础模型和在线学习技术的发展,机器人开始具备根据环境反馈主动调整的能力。
不过,在线强化学习距离大规模应用仍有挑战。首先,真实机器人采集数据成本较高,一次失败可能意味着设备损耗或时间浪费。其次,强化学习需要可靠的奖励机制,如果机器人无法准确判断行为好坏,学习效果可能受到影响。此外,目前多数在线优化方法仍依赖较好的基础模型,如果初始策略距离目标较远,仅靠小规模在线调整难以完成能力跃迁。
未来,机器人学习可能不再是一次性的训练过程,而会变成长期运行中的持续优化。类似SmoothRL这样的技术探索,正在推动机器人从“部署后固定能力”走向“部署后持续成长”。
