清华00后博士创业,高瓴、智元都投了

2026-08-1310000人工智能(AI)

 

Image
 

将VLM和世界模型统一在同一个架构里。

近日,具身基座模型公司Latent Verse(北京潜界科技有限公司)完成数亿元种子轮融资,投资方包括高瓴创投、清流资本、英诺天使基金、智元和星动纪元。

本轮融资从启动到交割耗时不足两个月。据了解,高瓴创投早在公司成立之前就已接触核心成员,融资启动后以最快速度成为首轮投资人。英诺天使也是最早入局的资方之一,与团队沟通当天即给出TS。另有数家一线VC已锁定下一轮融资。

Latent Verse是一家专注于具身智能基础模型研发的AI科技公司,以“Embodied-native(具身原生)”为核心理念,推动具身智能从感知理解走向自主交互与泛化执行。本轮融资将主要用于UTAM模型研发、多模态具身数据体系、模型训练基础设施,以及机器人在真实场景中的技术验证。

Image
 
Image
 

 

01.

 来自清华的“具身创二代”

 

Latent Verse成立于2026年5月20日,迄今尚不足三个月。团队由00后清华叉院在读博士胡钰承牵头,另外两位核心联合创始人同样出自清华交叉信息研究院,三人皆深耕具身基座模型。其中,胡钰承与另一位成员师从星动纪元创始人陈建宇,第三位成员师从破壳机器人创始人许华哲。

胡钰承出生于2001年。在清华读博期间,他选择了当时并不主流的具身模型研究方向,是国内最早把预训练的视频生成模型应用到具身领域的学者之一。其代表成果《Video Prediction Policy(VPP)》是国内较早将视频预测预训练模型落地具身机器人策略的研究,入选 ICML 2025 Spotlight,为国内 WAM(World Action Model)路线奠基性工作之一。下场创业前,他曾在字节Seed主导BagelVLA系列具身基座模型的研发。

团队成员还来自北京大学、南洋理工、阿里Qwen、小米等机构。

股权设计也值得关注。作为一号位,胡钰承持股仅在30%左右,股份相对均衡地分配给联创成员。“这个时代想做成大脑,一定不是靠一个人像一个独裁者,而是要靠整个团队贡献智慧,”他说,“如果公司做不出来,一号位有70%的股份也没有意义;如果能做出来,即使只有10%也是很好的结果。”

 

02. 

把VLM与世界模型统一在同一架构中

 

围绕“大脑”的技术路线,行业尚未形成共识。Latent Verse团队在这一方向上有长期的研究积累。

从早期的VA、VLA研究,到WAM阶段的VPP被英伟达DreamZero等项目引用,再到BagelVLA和UAM的提出,团队的研究主线与具身智能模型范式的演进高度一致。正是基于这样的积累和洞察,他们对现有路线的局限看得更清楚。

当前行业主流两条技术路线上,VLA架构依托海量机器人实操数据拟合动作,但缺少对物理世界时序变化的预判能力,另一类纯世界模型侧重视频帧预测,难以直接输出精细机器人控制信号。

基于此,Latent Verse提出第三条融合路线,将VLM和世界模型统一在同一个架构里。

Image
 

Latent Verse正在训练的首款模型是UTAM(Unified Tactile Action Model,统一触觉动作模型)。模型内部由四个专家模块构成一条完整的执行链。

视觉语言专家负责理解任务意图;世界模型专家规划新任务流程;动作专家生成粗粒度动作表征;触觉专家则将粗动作解码为精细的末端控制信号,比如手指触碰杯壁后实时调整力度和姿态。

整套执行链采用分层闭环逻辑:前半段依托视觉语言、世界模型做开环粗规划与全局视觉跟踪,后半段依靠触觉专家模块做末端接触闭环修正,类似人类先通过视觉定位抓取、再凭触觉实时调整握力与姿态。

将触觉放在核心位置,是Latent Verse与大多数VLA路线的关键差异。

“仅凭摄像头判断杯子‘在哪里’,和准确判断杯子是否正在从手中滑落,显然不是同一个问题。”在家庭场景中,物体的材质、形变、抓握姿态等接触信息决定了机器人能否真正应对物理世界的复杂度。UTAM要做的,正是让机器人在理解任务意图的同时,在物理接触层面做出精细、实时的调整。

Image
 

据悉,目前Latent Verse已完成UTAM多模态数据基础设施和训练管线建设,并开始推进各专家模块的联合训练。接下来,LatentVerse计划在模型能力、数据体系和真实部署经验成熟后,向机器人本体与应用场景延伸。