紫东太初开源了一个9B参数的通用多模态大模型ZDTaichu5.0-9B。参数量在10B以内,但它在空间具身智能这条赛道上的成绩值得单独看。9项国际权威空间理解基准中拿下8项同参数通用组别第一,在空间感知、跨视角三维推理、具身任务规划等指标上优于Qwen3.5-9B、STEP3-VL-10B。即使把Gemini 3 Pro、Grok 4这些闭源模型加进来对比,它仍在5项基准上取得最高分。通用多模态能力方面,图文理解、OCR、视觉数学、代码、Agent等评测里保持第一梯队,11项Agent、代码、指令遵循和数学推理测试中表现出对同量级开源模型的优越性,TAU2-Bench和IFEval上的成绩略高于Gemini 3 Pro。
空间具身能力测的是三层东西
通用多模态模型进物理世界卡在几个地方。一个机器人面对操作台上的工件,需要同时完成三件事:看清楚目标在哪,这是空间感知;换了视角之后还能认出来并判断空间关系,这是跨视角三维推理;给出一个不违反物理约束的操作方案,这是具身推理。这些能力在数字世界的多模态评测里几乎不会同时考到,但在物理现场,它们必须同时在线,缺任何一层,任务链条就会在某个节点断掉。
ZDTaichu5.0-9B在几个具体任务上的表现说明了差距。给定一张图或一段视频,要求模型精准定位目标物体坐标,同时理解物体属性、空间排序、位置信息三个维度,ZDTaichu5.0-9B准确输出了归一化坐标并命中真值,参与对比的同级开源模型全部定位错误。参照系转换任务里,模型需要先移动到某个参照物位置、转向面对另一个参照物,再判断第三个物体相对自身的方位,ZDTaichu5.0-9B给出了正确的方位判断。MindCube-tiny榜单要求模型在脑中构建三维心智地图完成复杂物体关系推演,ZDTaichu5.0-9B得分78.27,对Qwen的57.6、STEP3的62.8,差距超过15到20个点。这个榜单本质上测的是模型有没有真正建立三维空间表征,而不是做简单的语义匹配。ERQA和RoboSpatial是具身交互理解的核心基准,测的除了物体在哪里,还有能不能对它做操作以及该如何操作。放置任务要求模型判断可放区域,找到杯柄侧的空闲位置,ZDTaichu5.0-9B输出坐标落在合理区域,Qwen和STEP3输出坐标全部落在不符合要求区域。
自适应循环推理把算力用在难的问题上
ZDTaichu5.0-9B的技术路线里,自适应循环推理是核心。现在处理复杂推理的主流方案有两种,一是思维链让模型在输出层面多想几步,二是外部工具调用。但对于物理世界任务,这两种方式都有局限。思维链更适合数学、代码等符号推理,机器人面对的是持续变化的三维环境,很多判断依赖视觉状态和空间关系,不能简单拆解成线性的语言推理步骤。工具调用会增加系统复杂度和执行延迟,在实时交互场景里,模型需要快速判断环境变化并动态调整策略。
自适应循环推理让模型自己判断这道题有没有把握。模型在完成一次标准前向计算后,通过熵门控机制评估当前预测结果的不确定性,如果结果比较确定,直接输出,不额外消耗算力。如果遇到空间变换、物体关系判别、操作条件校验这类高不确定性的判断节点,模型在内部循环执行层块计算,迭代优化隐层表征。整个过程发生在模型前向传播内部,不依赖外部工具调用,也不需要生成额外的思维链文本。这个路线跟外界猜测的GPT-6 Astra使用的Loop Transformer技术采取类似路线。
开放数据管线比开放权重更有价值
绝大多数开源模型只发布权重,不公开数据处理管线。ZDTaichu5.0-9B开放的管线详细方案覆盖训练的三个核心环节。预训练阶段,将开源图文、网页文档、公开视频、多视角素材以及仿真数据统一纳入数据池,经过哈希与URL去重、清晰度和安全过滤、图文相关性筛选,以及图像重描述、视频抽帧等处理,组织成多模态训练样本。监督微调阶段,样本池是大规模任务轨迹数据,涵盖开源SFT指令、真实业务问答、空间具身案例与智能完整工具调用轨迹,团队执行指令质量打分、答案正确性校验、难度分层配比,专门做图像、问题、对象关系、操作约束之间一致性的强制校验。高质量退火加GRPO可验证奖励强化学习阶段,团队建立了能力域、难度、质量三维自动标签系统,标签体系与评测基准维度一一对应。
这套管线方案开放的意义在于,它把如何把自己手上的工业数据、仿真数据、实验数据训练成一个能用的多模态模型这件事,从少数团队的内部经验变成了可以直接复用的公开方法论。对于正在推进具身智能落地、但缺乏大模型训练经验的机器人公司、制造企业和科研机构,这比单纯多一个高分模型权重更有价值。
紫东太初已在科研自动化、智能制造等真实场景中对ZDTaichu5.0-9B进行了落地测试。科研自动化方向,用户输入问题,模型能自主调用工具,完成解析解与数值解求解、结果校验并可视化,跑通从提问到分析报告的完整流程。试管按序入架的湿实验中,模型需要持续追踪两支试管的身份和任务进度,即使试管在抓取和移动后位置发生变化,模型仍能判断当前状态并继续规划下一步。智能制造方向,模型已围绕备料配送、机台上下料等典型业务完成实体验证,覆盖密集货架、相似零件以及复杂操作约束等工业现场常见问题。10B参数档位的选择有产业逻辑,真正的终端具身设备对推理延迟和硬件成本有约束,70B或更大的模型无法在边缘侧实现实时响应。10B档位是当前算力约束下能力与部署的合理折中点,能跑在消费级GPU上,能在合理延迟内输出规划结果,能在私有化部署时控制成本。ZDTaichu5.0-9B在完成科研自动化和智能制造场景的闭环验证后选择开源,说明空间具身智能模型的竞争正在从比拼参数和benchmark分数,进入比拼真实场景验证、数据闭环和生态构建的阶段。仿真环境和真实物理世界之间依然存在差距,团队明确提出后续要持续投入优化仿真到现实的迁移能力。
