我们想要的,正是你想要的。真正让你愿意开口交谈的伙伴。有血有肉的游戏角色。以游戏引擎为银幕的虚拟演员。能真正完成任务的机器人,而不是摆拍出来的演示。而这一切,都始于一个能够感知的身体。下面就是我们的身体,在仿真器中实时运行。
这是我们的虚拟人。一个具身的心智,正以你当年的方式认识世界。全身皮肤与地面接触。实时直播即将上线。
Fig. 01a仿真器实时会话。手指触碰手指。
Fig. 01b仿真器实时会话。杯子落在身体上。
Fig. 01c今天的人工智能听起来很聪明,却在一本正经地胡编乱造。它没有空间感,也没有时间感。它从未触碰过这个世界。
通往真正智能的唯一路径,是让人工智能像人一样学习:通过一个能看、能触摸、能听、能说、能唱、能动的身体,感受重力,经历时间,体会痛苦与愉悦,并学会区分自我与世界。
这需要三样东西。一个身体,一个能从经验中泛化的心智,以及一个世界。今天的人工智能无法泛化。它并不理解自己在做什么。不理解自己的身体。不理解周围的空间。不理解行动的后果。真正的泛化,需要把这些一并理解。这就是为什么每一个机器人演示都是摆拍出来的。
设想一下:在一个它从未见过的房间里,你让机器人绕过你指的那两张桌子,把第三张桌子上的钥匙取回来。它知道那是你的钥匙,因为是你扔过去的。没有任何公开演示能做到这一点。仿真里做不到,实机上也做不到。这就是每一家机器人公司都会撞上的那堵墙。
这三样,我们都在做。身体。心智。世界。我们已获专利的架构(US 11,537,850 B2,第二项专利已核准,另有 5 项在审)阐述了运动、触觉、痛觉与愉悦如何共同塑造一个具身人工智能感知世界、形成意图的方式。与婴儿的发育学习同理,但快得多。
会主动注视的眼睛,而不是只做记录的摄像机。
摄像机对画面里的每一个像素一视同仁。你不是这样。你以低分辨率接收一整片宽阔的视野,同时把最锐利的视力投向一小块区域,投向你选择注视的任何地方。我们的虚拟人以同样的方式观看。210 度乘 130 度的视野,每只眼睛有 5 度的中央凹,两者再融合成一个立体中央凹以获得深度。
下面是它在仿真器中的表现,目光扫过一个从正午走向月夜的世界。宽视野是虚拟人能够看到的范围。中央凹是它正在注视的地方。
仿真器实时会话。虚拟人的宽视野、左右眼的中央凹,以及融合后的立体中央凹,随它的目光从白天进入夜晚。本段录像中 140° 乘 76° 的画面来自单个演示摄像机,比虚拟人自身的视野更小;它自身的视野更宽也更深,为 210° 乘 130°。
Fig. 02由物理建模而生的声音,而非数据堆砌而成。
大多数合成语音,本质上是对某个曾被录音的人的重新混合。BioFold 直接对人类声道本身建模,我们的虚拟人则像孩子学说话那样,学习如何控制它。由此得到的声音可以实时运行,每次调用都完全一致,并且可以属于一个从未存在过的人。
物理建模语音是一个小众且鲜有人涉足的领域。BioFold 仍处于早期阶段,但我们相信,它或许已经是世界上听起来最接近真人的声音。
接下来你听到的一切,都不是由人工智能生成的。每一个声音都直接来自物理模型,由人工调校。没有任何采样,也没有从录音中拼接。下一步是把控制权交给我们的人工智能,让它像孩子学会使用自己的声音那样学会驱动这个模型,并把它推向远超手工调校所能达到的高度。
其中一段是真人歌手的录音。另外两段是 BioFold 通过声道物理模型重建出的同一个声音。重建过程没有使用这个人的任何录音。选择一个声音和一个元音,然后连续播放来对比。
声音
元音
真实的嗓音从不会把一个音完美地稳住。它的音量会随时刻轻微颤动。正是这种颤动,在很大程度上区分了“活的”与“机械的”。下面是同一个合成音,在 BioFold 加入这种颤动前后的对比。
声音
元音
Real recordings are from VocalSet (J. Wilkins, P. Seetharaman, A. Wahl, B. Pardo, “VocalSet: A Singing Voice Dataset,” ISMIR 2018, Northwestern University), licensed CC BY 4.0, source doi.org/10.5281/zenodo.1193957. Real clips are excerpts (silence trimmed). The reproduction clips are our own synthesized reproductions derived from parameters extracted from those recordings (© Mind Machine Learning); not part of or endorsed by VocalSet.