具身智能的“第三条路”:让机器人用不确定微分几何理解世界

Jack2026-08-142153具身智能

今天,抓取已经不是具身智能最值得惊讶的事情。让机器人完成一个抓取动作并不难,难的是让它在没有被提前告诉答案的情况下完成动作。例如没有预先标定的坐标,机器人能不能抓起一只被移动过的杯子?这个在人类看来十分简单的问题,如今却暴露了具身智能下一场竞争的真正难题。

这个问题真正值得讨论的是:杯子动了以后,机器人是否还敢直接伸手?并且继续完美执行全流程。这个简单场景背后,指向的是具身智能一个越来越现实的问题——当机器人从实验室进入工厂、仓库、商场甚至家庭,世界不会按照数据集里的方式等待它。

地面会有几毫米的高低差,物体会被人碰一下,光照会变化,传感器会延迟,电机不会百分之百精准,上一秒还在原位的东西,下一秒可能已经移动。机器人真正面对的,从来不是一个“理想的世界”。而是一个不断变化、永远存在扰动的世界。

近期,这类难题似乎得到了一种新解法,用的还是数学而非传统的AI领域方法论。机器人大讲堂发现,一家名为信度启源的公司,放出了他们的最新成果。

在视频中的一间办公室里,一台人形机器人站在桌前,桌上就放着一杯咖啡,下面是一辆带滑轮的托盘。有人提前推了一下托盘。杯子随着托盘移动,停在一个没有被标定过的位置。几秒后,一条语音指令下发:取水杯。机器人没有重新扫描场景,也没有停下来等待人工校准。它调整方向,走向桌边,站稳,伸手,抓住咖啡,再把它拿起来。



 

整个过程只有10多秒。视频一镜到底。最后,机器人把咖啡递到人手中,人拿到咖啡杯后,机器人就自动松手,任务丝毫无卡顿,没有出现“夺杯子”的尴尬场面,机器人松手的动作没有试探和犹豫,像一个练习了千百遍的动作,而且已经接近人的正常速度和反应。



 

抓取考验算准动态位置,递送要同时算准力度、时机和对方手的空间,是抓取链条里最难的一环。一个没训练过的机器人在边界内快速确定动作物理安全,所以松手干脆利落,短短十秒钟的视频,背后确是决策像人、快、可解释的最佳体现。

机器人大讲堂了解到,视频背后是一套全新的具身智能运行框架!这家刚刚成立的公司,正在把一个来自数学领域的理论体系搬进机器人,他们尝试以“不确定理论”为基础,结合不确定统计、不确定微分方程和不确定控制,构建一套名为“信度世界模型”的新范式。

它最特别的地方,不是把模型做得更大,而是试图用数学的方式,让机器人少做一次猜测,多做一次计算;少走一步弯路,直接找到动作应该怎么发生。

如果这条路最终能够在更多真实场景中成立,它改变的可能不只是一个机器人模型,而是具身智能从实验室走向产业时,对“智能”本身的理解。

01.

热钱和落地之间,隔着一道泛化鸿沟

935 亿元。这是 2026 年上半年国内具身智能赛道的融资总额,是去年同期的 5 倍。融资事件 322 笔,同比增长 137%,市场规模预计年内破万亿。资本用真金白银投票,押注机器人进入工厂和家庭。

热钱的另一面,是落地的迟疑。兴业证券 2026 年 4 月的一份深度报告把问题挑明,机器人硬件已经足够成熟,真正的瓶颈在具身大模型。当前具身大模型难以可靠处理复杂物理世界的不确定性,泛化能力较弱。机器人换一个场景就失灵,是行业里公开的难题。

数据采集、模型训练、场景标定,每一项都在烧钱,部署一台机器人进产线,往往要几个月的定制化开发。行业不缺热情,缺的是一条把机器人真正送进真实世界的路。

信度启源视频里展现的,正是这样一种新的可能性。

02.

两条主干道,面临相似的挑战

围绕机器人的大脑怎么做,行业目前有两条"主干道"。

第一条是端到端大模型路线。视觉、语言、动作全部塞进同一个神经网络,数据驱动,黑盒运行,泛化靠堆量。它的困境也由此而来,数据永远不够,分布永远不全,遇到没见过的组合,模型只能靠猜。第二条是传统控制加 AI 的混合路线。规则驱动,场景受限,工程师把物理规律一条条写进代码。规则写不完,场景一变就失灵,复杂度随着场景数量线性膨胀。

两条路殊途同归,都在用数据去逼近物理世界。而真实世界的频率远不稳定,地面不会平整,光照不会恒定,电机不会绝对精准,场景从不重复。



 

当数据驱动的边界显现,行业把目光转向了世界模型。与其让机器人记住每个场景,不如先让它理解物理规律,再推演动作。图灵奖得主 Yann LeCun 多次公开表示,大语言模型不是通往真正智能的路,智能体需要的是能够预测世界的模型。斯坦福大学教授李飞飞把空间智能视为 AI 的下一个方向。WAIC 2026 上,世界模型被定义为 AI 的现实认知大脑。国内七部门揭榜挂帅申报指南提出,到 2028 年研制具有自主知识产权的端侧世界模型系统。从学界到产业再到政策,世界模型被推到了舞台中央。

但方向是新的,方法还在延续。主流世界模型依然以数据拟合为核心,用大模型处理海量数据,思路与前两条路一脉相承。

信度启源走的,是第三条路。数据驱动和规则驱动之外,它选择理论驱动,从数学公理出发,每一步计算都白盒可见。信度启源将其称为信度世界模型。

03.

把机器人控制做成数学题

要理解第三条路,得回到中学的立体几何。机器人在哪,杯子在哪,手以什么角度抓握,都是空间中的位置和姿态问题,这是第一层。机器人会动,位置随时间变化,就要引入时间变量,用微分方程描述运动的演化,这是第二层,微分几何。

现实世界的扰动必然存在。地面不会绝对平整,电机执行总有偏差,传感器带着噪声,模型和现实之间永远隔着一段距离。统计相关性擅长描述趋势,却难以给出因果边界,如何处理这段距离,是第三层要回答的问题。



 

信度启源用不确定理论把扰动重新建模,得到不确定微分几何。它算出的不是一个猜测的动作,而是一个可信边界。就像老司机不会去计算旁边车辆变道的概率分布,只会本能地保持一个安全距离。在这个几何范围内,动作是物理安全的。

这套数学体系推导出的是一套信度智能算法,实时解算未来状态的可信边界,让机器人在边界内做出最优决策,不需要海量采样,不需要预设分布,甚至不需要针对新场景重新训练。物理规律在哪都一样。

04.

七个模块,复刻人脑的信息处理

在这套数学体系之上,信度启源搭起了七窍框架,由听觉、触觉、视觉、校验、预测、决策、控制七个模块组成。

前三窍负责感知。听觉、触觉、视觉模块从传感器数据中提取环境的几何特征,转化为信度,传递给下游模块。这部分可以调用成熟的感知模型做特征提取。

真正决定机器人怎么动、动多快的,是后面四窍。

校验模块像人脑的前庭系统。毫秒级判断当前状态是否超出物理可信边界,发现危险立刻中断动作,不等上层决策。



 

预测模块对应人脑的顶叶,做一件反直觉的事,预测现在。所有传感器都有延迟,机器人看到的永远是几十毫秒前的世界,它基于带延迟和噪声的数据,反推出此刻的真实状态,再推演下一步。

决策模块对应前额叶,按信度最大化原则直接求解最优控制律,不在几万个候选动作里做概率采样。

控制模块对应小脑和基底节,把决策指令转化为电机的精确控制信号。

关键也在这里,校验、预测、决策、控制四窍完全没有使用大模型。每一步计算都有明确的数学支撑,决策可追溯、可解释,中间没有神经网络的黑盒猜测。

05.

快和省,到底来自哪?

正向设计,这就是信度世界模型快和省的原因。

主流大模型路线是反向训练。数据一遍遍喂进去,算力一次次烧掉,换一个场景,往往又是一轮采集和校准。信度世界模型是正向设计。从数学公理直接推出算法,绕开大模型,省掉大量推演。几乎没有训练成本,推理不需要云端算力,一台机器人本体加一套算法,就能跑起来。

用团队的话说,大模型是在用数据拟合世界,信度启源是在用数学理解世界。这是两种世界观。对投资人而言,省下的每一项都是账面上的数字。算力采购、数据标注、场景定制,这三块是具身智能公司成本的大头,信度世界模型把三者同时压了下去。

抗扰动能力也把第三条路的商业价值落到了实处。传统方案里,标定点位、采集数据、训练模型,一条产线几个月的定制化开发。信度世界模型不需要针对新场景重新训练。厘米级的位置偏差、光照变化、微小扰动,都能自己处理。算法部署上去就能用,机器人从 demo 变成能 24 小时稳定干活的生产力。

这意味着规模化部署的经济门槛被拉低。同一套模型可以适配不同的机器人本体、不同的作业场景,批量化落地的空间由此打开。工业装配、商业服务、家政服务,可落地的场景清单还在拉长。

06.

二十年理论,一条自主的链路

第三条路不是凭空冒出来的。

它的理论基础是不确定理论,2007 年由清华大学数学科学系刘宝碇教授创立,是研究非决定性现象的公理化数学分支。两套公理体系处理不同的现象,概率论研究频率,不确定理论研究信度,各有其适用边界。

二十年里,这套理论衍生出不确定统计、不确定规划、不确定逻辑、不确定过程、不确定分析、不确定微分方程、不确定金融等领域。代表作是德国施普林格出版的《Uncertainty Theory》,并被译成俄文、日文和波斯文。

这是清华数学系在具身智能领域的第一次创业。

从最底层的不确定理论,到七个模块的架构搭建,再到硬件平台的部署调试,信度启源的整条技术链路已经构建完成。这是一条完整自主、不依赖西方 AI 主流范式的路线,从基础科学到应用,全链条原创。



 

07.

从黑板到产线

目前,信度启源已经开启新一轮融资,下一步是把信度世界模型适配到更多工业机器人、人形机器人平台上,推进工业场景和商业场景。

当行业还在争论数据够不够、算力强不强,这家公司选择从公理出发。给机器人一套和人类直觉同源的数学框架,用可解释的物理规律做决策。这场从黑板开始的实验,正在变成一条可以走通的路。

视频里那只杯子,只是开始。