VLA越做越大,机器人为什么还是进不了工厂?

Jack2026-08-272371机器人技术及应用

具身智能行业正在出现一个反常现象:

模型越来越通用,机器人却不一定更容易进工厂。

一个VLA模型可以看图、听指令、理解环境,也能生成动作。但真正进入生产线,它还得重新认识这台机器人有多长的手臂、关节能转多少度、怎么抓东西;还要重新适应物料、工位、流程和节拍。

模型懂得越多,距离工厂却可能仍然隔着一段很长的路。

乐聚最近推出KUAVO-VLA 1.0,切入的正是这段被忽略的距离。



 

它没有继续把模型做得更通用,而是在通用基模与具体技能之间增加一层工业垂域模型,先把KUAVO这台机器人“练熟”,再把工业现场反复出现的基础能力沉淀下来,最后才学习具体工位的新任务。

具身智能真正昂贵的,不是让机器人学会第一件事,而是让它每换一个任务都不用重新交一遍学费。

01.

机器人每换一个工位,都在重新“认识自己”

工业机器人最隐蔽的成本,不一定是硬件,而是重复学习。

分拣、搬运、上下料、装配看起来是四类任务,但拆开之后,都会反复经过识别、定位、抓取、移动、放置。对于人来说,学会抓取之后,换一种零件只需要适应新的物料。但对没有经过垂域训练的模型而言,一个新任务往往还夹带着本体适配和基础操作学习。



 

这就是通用VLA进入工业现场时的一道隐形门槛。

通用模型需要覆盖更多机器人和场景,因此拥有更宽的能力边界。但不同机器人拥有不同的动作空间、运动规律和控制方式。模型进入具体本体之后,仍需要重新建立对应关系。

工业现场又会叠加第二层复杂度。零件变了、工位变了、流程变了,但机器人每天反复做的基本动作其实没有变。如果每个新技能都需要重新练习提升,相当于工厂每招一个新人,都要能力再培训一次,学习周期变长,综合成本不断叠高。



 

乐聚选择的方式,是把这部分“基本功”提前完成。

KUAVO-VLA1.0使用600+小时高质量真机数据,覆盖分拣、搬运、上下料、装配等100项工业任务,而且数据来自KUAVO单一构型。模型因此可以持续学习同一套身体的动作空间和控制规律,同时从大量工业任务中沉淀可复用的操作能力。

它并非在教机器人做一件事,更像是在给机器人补一套职业基本功。



 

02.

通用基模像大学通识课,垂域模型像“专业课”

这也是垂域模型真正有意思的地方。通用基模追求的是能力宽度。要求任意机器人、任意场景都能理解。垂域模型追求的是能力复用。重点是进入一个具体机器人和行业之后,哪些东西可以不用再学。两者不是竞争关系,而是一套分工。

可以把它理解成一套教育体系,基模负责通识教育,垂域模型负责专业训练,技能模型负责上岗。
 

经Benchmark对比,LingBot-VLA 2.0在参测模型中综合表现最优,因此被选为KUAVO-VLA的能力基座,为其提供更高的通用能力起点。

KUAVO-VLA 1.0以Lingbot-VLA 2.0为能力基础,再用600+小时KUAVO真机数据进行二次训练。



 

模型先掌握本体能力和工业共性操作,新任务再集中学习物料、工位和流程差异。

于是,具身智能的研发链条也从过去的“基模—技能”,开始变成基模—垂域模型—技能。

多出来的这一层,压缩的不是模型参数,本质上其实是重复劳动。



 

03.

48.27%之外,真正值得看的,是开发成本被压缩了

如果只看 Benchmark,KUAVO-VLA 1.0 的成绩已经足够醒目。在25项任务中,它取得48.27%的整体任务成功率和74.51%的过程分,两项指标均位列第一。对比骨干网络LingbotVLA2.0的测试基线,任务成功率为 16.27%,过程分为 42.06%。



 

但对工业客户来说,更值得看的其实是另一组数字。

因为过去开发一个新工业技能,往往意味着重新走一遍完整流程:采集大量数据、重新训练模型、现场反复调试,再把机器人拉回产线验证。整个周期可能以月计算,数据量往往需要数百甚至上千条。

问题不是机器人学不会,而是每学会一个新技能,都要重新付一次学费。

垂域模型改变的,恰恰是这笔账。



 

过去的路径,是让通用基模直接面对具体技能。模型既要重新适应机器人本体,又要重新学习工业基础操作,最后才能进入具体任务。

现在则变成:通用基模 → 工业垂域模型 → 具体技能。

本体能力和工业共性能力已经被提前训练,新任务只需要学习真正发生变化的部分。如果传统路径的开发周期以数月计算,而垂域模型路径可以压缩到约一周;原本需要数百甚至上千条数据,新任务可以收敛到150条左右;对应开发成本则可以下降3倍以上。



 

更重要的是,这种压缩并不是拿效果换来的。

在具体任务中,流水线开关分拣任务使用 5小时示范数据进行后训练适配后,成功率达到 80%; GM100 的 BM-45 零食分拣任务使用 150条示范数据,成功率达到 73.33%。从整体工业技能开发来看,垂域模型能够将效果维持在平均80%–90%的水平,部分任务甚至达到100%。



 

这才是工业客户真正会在意的变化。不是让机器人多学一点,而是让同样的效果少花很多时间和数据。

这两件事看起来只是效率提升,背后却是模型开发逻辑发生了变化。

过去,每增加一个技能,就像在一张白纸上重新画一遍机器人。现在,白纸已经变成了一张完成大半的工程图,新任务只需要修改其中的一小块。所以,垂域模型真正压缩的不是某一次训练的时间,而是整个工业技能开发链条里大量重复发生的工作。



 

对于实验室来说,几个月和几周可能只是项目进度表上的两个数字。对于工厂来说,却完全是另一回事。一个技能如果需要几个月才能上线,它更像一次定制项目;如果一周左右就能完成适配,它才开始具备被复制到更多工位的可能。

工业具身智能真正的规模化,不是把一个机器人做得更聪明,而是把“学会干活”这件事的边际成本不断压低。



 

04.

下一场竞争,是效率大战

如果把一个工业技能拆开,会出现三个层次。最底层是通用基模,负责跨机器人、跨场景的基础能力。中间是机器人平台的垂域模型,负责本体适配和工业共性能力。最上层才是具体技能,解决某种物料、某个工位、某套流程。

这样的分层,会改变具身智能产业的竞争逻辑。过去大家更容易比较模型能力,重点看谁的数据多、模型大、泛化强。但工业化之后,真正昂贵的是每一次新任务背后的数据采集、训练调试和部署。

如果每个任务都重新学习,机器人越卖越多,开发成本也跟着膨胀。



 

如果本体能力和工业共性能力已经沉淀下来,那么每完成一个任务,下一次就能少学一点。

最终形成一个正向循环,任务落地→真机数据积累→垂域能力增强→新任务更快上线。

机器人开始拥有一种过去硬件没有的资产:职业经验。一台机器人做过100个工业任务和只做过3个任务,硬件可能完全一样,但模型里的能力密度已经不同。

这或许才是具身智能真正走向规模化的关键。不是让一个模型什么都能做。而是让它每学会一件事,都能成为下一件事的起点。

最终,通用模型决定机器人能走多远,垂域模型决定它能多快走进工厂;而技能训练,决定它今天能不能真正开工。