00 / 核心主张

能够泛化的人工智能。

我们想要的,正是你想要的。真正让你愿意开口交谈的伙伴。有血有肉的游戏角色。以游戏引擎为银幕的虚拟演员。能真正完成任务的机器人,而不是摆拍出来的演示。而这一切,都始于一个能够感知的身体。下面就是我们的身体,在仿真器中实时运行。

这是我们的虚拟人。一个具身的心智,正以你当年的方式认识世界。全身皮肤与地面接触。实时直播即将上线。

Fig. 01a

仿真器实时会话。手指触碰手指。

Fig. 01b

仿真器实时会话。杯子落在身体上。

Fig. 01c
01 / 问题所在

这场打造真正智能机器的竞赛,困在了语言模型和僵尸机器人里。

今天的人工智能听起来很聪明,却在一本正经地胡编乱造。它没有空间感,也没有时间感。它从未触碰过这个世界。

通往真正智能的唯一路径,是让人工智能像人一样学习:通过一个能看、能触摸、能听、能说、能唱、能动的身体,感受重力,经历时间,体会痛苦与愉悦,并学会区分自我与世界。

这需要三样东西。一个身体,一个能从经验中泛化的心智,以及一个世界。今天的人工智能无法泛化。它并不理解自己在做什么。不理解自己的身体。不理解周围的空间。不理解行动的后果。真正的泛化,需要把这些一并理解。这就是为什么每一个机器人演示都是摆拍出来的。

设想一下:在一个它从未见过的房间里,你让机器人绕过你指的那两张桌子,把第三张桌子上的钥匙取回来。它知道那是你的钥匙,因为是你扔过去的。没有任何公开演示能做到这一点。仿真里做不到,实机上也做不到。这就是每一家机器人公司都会撞上的那堵墙。

这三样,我们都在做。身体。心智。世界。我们已获专利的架构(US 11,537,850 B2⁠,第二项专利已核准,另有 5 项在审⁠)阐述了运动、触觉、痛觉与愉悦如何共同塑造一个具身人工智能感知世界、形成意图的方式。与婴儿的发育学习同理,但快得多。

01身体
02心智
03世界
身体 · 视觉

中央凹视觉

会主动注视的眼睛,而不是只做记录的摄像机。

摄像机对画面里的每一个像素一视同仁。你不是这样。你以低分辨率接收一整片宽阔的视野,同时把最锐利的视力投向一小块区域,投向你选择注视的任何地方。我们的虚拟人以同样的方式观看。210 度乘 130 度的视野,每只眼睛有 5 度的中央凹,两者再融合成一个立体中央凹以获得深度。

下面是它在仿真器中的表现,目光扫过一个从正午走向月夜的世界。宽视野是虚拟人能够看到的范围。中央凹是它正在注视的地方。

仿真器实时会话。虚拟人的宽视野、左右眼的中央凹,以及融合后的立体中央凹,随它的目光从白天进入夜晚。本段录像中 140° 乘 76° 的画面来自单个演示摄像机,比虚拟人自身的视野更小;它自身的视野更宽也更深,为 210° 乘 130°。

Fig. 02
身体 · 声音

BioFold

由物理建模而生的声音,而非数据堆砌而成。

大多数合成语音,本质上是对某个曾被录音的人的重新混合。BioFold 直接对人类声道本身建模,我们的虚拟人则像孩子学说话那样,学习如何控制它。由此得到的声音可以实时运行,每次调用都完全一致,并且可以属于一个从未存在过的人。

物理建模语音是一个小众且鲜有人涉足的领域。BioFold 仍处于早期阶段,但我们相信,它或许已经是世界上听起来最接近真人的声音。

接下来你听到的一切,都不是由人工智能生成的。每一个声音都直接来自物理模型,由人工调校。没有任何采样,也没有从录音中拼接。下一步是把控制权交给我们的人工智能,让它像孩子学会使用自己的声音那样学会驱动这个模型,并把它推向远超手工调校所能达到的高度。

其中一段是真人歌手的录音。另外两段是 BioFold 通过声道物理模型重建出的同一个声音。重建过程没有使用这个人的任何录音。选择一个声音和一个元音,然后连续播放来对比。

声音

元音

Real recordings are from VocalSet (J. Wilkins, P. Seetharaman, A. Wahl, B. Pardo, “VocalSet: A Singing Voice Dataset,” ISMIR 2018, Northwestern University), licensed CC BY 4.0, source doi.org/10.5281/zenodo.1193957. Real clips are excerpts (silence trimmed). The reproduction clips are our own synthesized reproductions derived from parameters extracted from those recordings (© Mind Machine Learning); not part of or endorsed by VocalSet.

Fig. 03