当一台AI机器人在训练中突然开始"玩"起来——反复尝试与指令完全不同的动作,并且因此学得更快时,冲绳科学技术大学院大学的研究团队意识到:他们可能无意中触碰到了人类语言习得的核心秘密。

这项发表在《科学进展》上的研究,用一个具有类脑神经网络的虚拟机器人,揭示了儿童语言能力迅速习得的关键机制:丰富多样的语言环境,加上与生俱来的好奇心。
▍好奇心驱动的"黑巧克力实验"
研究采用的PV-RNN模型基于人脑信息处理理论,以"自由能最小化"为训练目标——在追求预测准确性和保持信念系统稳定之间寻找平衡。研究团队在模型中引入了强化学习,同时对完成任务给予外部奖励,对满足好奇心给予内部奖励。

由此产生了两股相互竞争的驱动力:机器人既希望保持对世界的现有认知,又会因采取迫使其更新信念的行动而获得奖励。第一作者西奥多·廷克用"巧克力实验"解释了这一机制:你从未试过白巧克力,但好奇心驱使你尝了一口——即使黑巧克力更符合你的口味预期,你也因此更新了对巧克力的整体认知。
▍"玩闹行为"加速语言理解
机器人在训练中展示了令人惊讶的行为:即使已经能熟练完成任务,它仍会故意碰倒或推动与任务无关的物体。"这是我最喜欢的部分,"廷克说,"我们没有让机器人像孩子一样玩耍,但它却主动产生了玩耍般的行为——这种由好奇心驱动的行为,反而帮助它更快地理解语言。"
实验数据显示:接触过48种动词-形容词-宾语组合的"好奇机器人",泛化准确率为25%;而接触过180种组合的同类机器人,准确率飙升至85%。语言的丰富多样性,是解锁理解能力的关键变量。
▍意外的"U型曲线"
最令团队惊讶的是,机器人复现了幼儿语言习得中著名的U型性能曲线——在动词变位等语言任务中,儿童的表现会先提升、再下降(过度泛化规则导致错误)、最终再次回升。当研究人员交换两个任务的含义时,机器人经历了完全相同的性能起伏。
廷克说:"机器人能够像儿童一样处理异常情况,这完全出乎意料,因为模型中没有针对过度泛化或异常处理的设计——它们似乎自己学会了。"
▍透明的大脑,可观测的认知
与拥有万亿参数、训练于天量数据集的大语言模型不同,这类神经网络架构透明——其"隐藏状态"(编码对未来的预测)可被研究者自由访问,实时追踪机器人完成任务时的"心理计划"。这为研究人类认知提供了宝贵窗口。
研究团队表示,这个平台未来将用于观察和研究更多人类行为。当AI开始用"好奇心"和"玩耍"来学习语言时,它或许正在接近一个比单纯"预测下一个词"更接近"真正理解"的路径——而那条路径,恰好是人类婴儿早已走过的。
