2026年初,具身智能的主流叙事仍在VLA(视觉-语言-动作)模型、世界模型和端到端学习上打转。一家名为橡木果(Acorn Robot)的公司,却拿出了一条截然不同的技术路线。
它的团队构成有点特殊:从2016年到2023年,清华机械工程系的一位老师,陆续把自己八位不同年份入学的博士生带进了同一个项目,最终组成九人核心团队,全数扎进了一个在当时尚未被主流视野理解的方向——操作本能。
由此开始,橡木果走出了一条“自下而上”的路。他们试图先赋予机器人操作本能,让它在与物理世界的交互中自主涌现出操作智能,而不是用大模型和海量数据去教会机器人每一个动作。九年时间,从理论发现做到产品商业化闭环。这个过程,比多数融资故事安静得多,却也扎实得多。
01.
操作真的有本能吗?
创始人的学术轨迹有点跨界的味道。清华机械工程博士,哈佛神经科学博士后。在哈佛期间,他研究人脑如何控制手,逐渐形成一个判断——语言没有先天本能,操作却有。
![]()
他的观察很朴素。一个小孩如果出生后不接触语言,一辈子都学不会说话,且学什么语言就说什么语言。但抓取行为全球高度一致,不论年龄、文化、环境,没有任何人系统“教”过人类如何抓东西,大家却都做得差不多。
这个判断导向一条技术假设:操作行为的底层,可能有一套与生俱来的“内在期望”,不是具体动作的规划,而是一种持续收敛的行为倾向。机器人如果能被植入这种本能,或许不需要模仿海量的人类操作数据,也能在与环境交互中自行长出稳定的操作能力。
这就和主流的“模仿学习”逻辑拉开了距离。多数人想让机器人拟合人的动作,橡木果想的是先让机器人像人一样拥有操作的底层本能,再让它自己去找办法。
02.
审视VLA在“最后一厘米”失效的结构性问题
当前具身领域的主流VLA架构,本质上是一个巨大的“感知-动作”黑盒,任务规划和操作执行耦合在一起,通过海量数据和超大算力进行端到端拟合。这条路在语言和多模态理解上进展飞快,但轮到物理执行时,麻烦开始从三个方向浮现。
一是数据规模问题比想象中更尖锐。语言只有单一信息模态,操作却同时涉及视觉、触觉、本体感知等,而且动作输出和具体硬件(电机特性、传动形式、手指数量甚至导轨松紧)深度绑定。任务与硬件一旦耦合,泛化所需的数据量是指数级的。截至2026年初,全球合规可用的机器人操作数据只有约50万小时,缺口超过99%。很难指望任何一家公司能采集到足以覆盖所有硬件本体与操作场景的数据。
二是实时性在物理世界是一个硬约束。操作执行要求毫秒级响应,一个动作要么瞬间完成,要么失败。云端大模型在生成文字时“一个字一个字往外蹦”尚且能忍,但当物体正从指尖滑落时,机器人没有等待算力生成下一个动作的奢侈。
三是换场景就失灵的泛化问题。更要命的是,任务泛化与硬件泛化的逻辑并不相同。任务(比如“叠衣服”)是知识层面的,可以抽象统一;但执行必须适配每一个硬件的个体差异,两台看起来一模一样的夹爪,导轨阻尼不同,控制参数就可能差别很大。橡木果做过一个很形象的类比:乒乓球规则全世界一样,但每个选手的打法完全不同。规则是任务,打法就是硬件适配。
于是推导出一个反直觉的结论:在物理执行层面,很可能没有“最好的预训练模型”,只有最适配当前硬件的模型。
03.
把任务规划和操作执行拆开
基于上述判断,橡木果选择把任务规划与操作执行彻底解耦,各自独立演进,通过标准化接口协作。
任务规划层可以用大模型去解决“做什么”:推理、任务分解,输出的不是具体动作指令,而是关键图像帧和语义约束,比如“保持水平,不要洒水”。
操作执行层则是他们真正下注的地方:不再试图用神经网络去端到端地拟合动作轨迹,而是回到物理交互的最底层,让“本能”驱动行为。
这套架构的核心是两个模型。
Natus AGE-0 AGE-0:零数据冷启动的操作本能模型
8月10日,橡木果机器人正式发布「Natus AGE-0 AGE-0具身本能模型」。这是全球首个以触觉感知为核心、复刻人类操作机理的通用操作基座模型。
具体来说,Natus AGE-0完全嵌入末端执行器,由触觉刺激直接驱动,毫秒级响应。它内置了三类硬编码的“本能”:定向本能(朝目标移动)、探索本能(接触物体后通过滑移、形变等触觉信息自主寻找稳定接触构型)、交互本能(以“滑移最小化”为目标实时调节抓力,抓豆腐松、抓锤子紧)。
![]()
这意味着它不需要任何预先采集的操作数据。出厂即具备基础操作本能,面对一个从未见过的物体,它会沿物体表面自主探索,不断试探、滑移、调整,直到建立稳定接触。不是一次保证成功,但反复试探后往往能找到办法。
一个典型案例是:让一个单自由度工业夹爪拾起平贴在桌面上的银行卡——厚度不足1毫米。没有外置摄像头,没有云端大脑,也没有学习过任何示范轨迹。夹爪不断尝试推、翘、扣,试了八九次之后,自己找到了一个可以用边缘撬起卡片的策略。团队管这叫“本能驱动下的行为涌现”。
Magis:从“会做”到“熟练”的操作技能模型
Natus AGE-0解决了零样本启动和适应性,Magis的使命是让机器人从“会做”到“熟练”。
有意思的是它的训练路径。Magis并不是拿人类示范视频去训练,而是利用Natus AGE-0在真实物理环境中自主探索产生的数据进行学习。当Natus AGE-0完成一次成功操作,它记录的不仅是“成功”这一结果,更包含一整套丰富的物理信息:物体重量、质心位置、表面软硬与粗糙度、抓取时的力分布和滑移趋势。这些由触觉自动打标的力学语义,会被叠加对齐到视觉数据上,用来训练技能模型。
这样做的好处很直接:训练数据需求大幅降低;模型学到了深层物理属性,反而更容易泛化到从未见过的物体和场景。
04.
触觉作为信息的底座
一切本能都需要信息输入,橡木果选择把触觉做深做透。
他们将触觉信息分为三层:界面信息(接触面上的分布力、形变、滑移——其中滑移是最难测量也最关键的一项)、物体信息(通过接触间接感知的软硬度、摩擦系数、质量与质心分布等力学属性)、环境信息(通过工具或物体间接感知的接触位置、刚度、阻抗等,这决定了装配为什么比抓取难)。
![]()
为了获得这些信息,团队自研了视触觉传感器。原理是弹性体加微型相机,通过图像表征算法反演弹性体变形,解算出所需的多模态触觉数据。其中动态滑移表征技术于2020年首次公开提出,比行业普遍关注早了5年。传感器至今已迭代十余代原型机,第三代产品实现了工程化量产,可直接输出标准化触觉信息,避免硬件差异导致后续模型失效。
05.
结语
凭借Natus AGE-0的“零数据冷启动”,橡木果的解决方案可以快速进入产线。
2025年正式开启商业化,仅用两个月,就在一家全球头部化妆品ODM厂商产线上完成POC验证并实现营收。产线上要求机器人抓取、旋拧和放置形状、大小、材质差异巨大的化妆品包材——软管、瓶子、盒子,形状不规则,表面质感从光滑到磨砂不一。零数据、快速适配的能力拿下了客户,首笔订单金额数百万元。
近日,橡木果完成天使轮融资。本轮融资由招商局创投、蔚来资本共同领投,水木清华校友种子基金跟投。招商局创投投资部总经理高斌表示:“我们长期关注硬科技领域的底层创新。橡木果团队从神经科学和接触行为机理出发,提出并验证了本能驱动这一全新路径,这在具身智能行业是极具前瞻性的。他们不盲从主流,敢于从第一性原理'出发,找到了一条更高效、更优雅的通用操作解决方案。其零数据冷启动的能力,不仅解决了行业的落地难题,更构建了坚实的商业闭环基础。我们看好团队的技术信仰和执行力,期待他们成为工业柔性生产领域的变革者。”
故事讲到这儿,魅力与疑问都浮出了水面。
橡木果的路线令人兴奋之处在于,它正面回应了当前具身智能“数据饥渴”和“泛化困难”的结构性难题,找到了一条“先做减法”的路径。操作本能目前已经在抓取、旋拧等基础操作上证明了效力,已足够覆盖工业场景的绝大多数产线需求。
另一个悬而未决的问题是接口标准。将任务规划与操作执行解耦后,大模型层与本能执行层之间的标准化接口到底是什么样的?谁来定义?能否成为行业共识?这些问题甚至比技术本身更难。
橡木果创始人说过,他们的壁垒来自“认知领先和工程细节沉淀”。这句话不错,但护城河的宽度,最终取决于未来两年能在更多行业场景里跑出什么样的成果。
在全行业都在追求“更大模型、更多数据、更强算力”的时刻,橡木果的选择像是重新问了一个更基础的问题:机器人动手之前,是不是需要先有“本能”?这条路走了九年,如今走到台前。它未必是唯一的答案,但至少提醒了行业,通往通用操作智能的路径,或许并不只有向上堆叠这一条。
