题图:Cheva用AI创作
好久没有聊《千智之脑》这本书了,因为这个话题还是挺深奥的,我也不能保证自己理解对了,总之这本书还是挺有意思,这本书还是很有意思,读起来很有启发性。这本书的大约前三分之一还要多讲的是作者多年来的研究成果,也就是大脑是如何工作。我试着总结一下,不确定我是否理解和总结的正确。
首先,人类的智慧主要是由新皮质产生的。新皮质具有学习能力,可以学习外部世界的方方面面。学习的结果就是一个世界的模型。但是这个世界的模型并不是统一而完整的,而是很多个小模型。每一个模型对应的是外部世界某一方面的性质。打个比方说,一个茶杯,它有很多性质,比如说,其中一个性质是它的颜色、外观,在大脑的新皮质当中,还有一个次级的结构叫皮质柱。每一个皮质柱就对应学习一种模型。颜色、外观就是视觉模型,它的质地和冷热就是触觉模型。甚至我们如何使用它,拿起水杯放到嘴巴边,也有一个相应的模型。也就是说每一个皮质柱都有一个自己的模型,记录了某个事物的一个方面。然后这些小模型在一起就形成了一个关于某项事物完整的模型。说了半天模型、模型,由神经元细胞网络构成的新皮质是或者说它的次级结构——皮质柱是如何学习模型的呢?这个模型到底是个什么东西呢?
长话短说,所谓的模型是就是基于坐标系的,它的原理非常类似。你可以把这个模型想象成一张一张的地图,在地图上就有相应的坐标——经度和纬度。以视觉模型为例,那这个地图或者说坐标系就应该至少包括颜色、大小、形状、三个坐标。而人们看到的每一样事物都在这个坐标空间当中有一个独独特的位置,它们之间的相对关系,就是我们学习到的世界模型。
之前说了每一个皮质柱都有一套自己独立的模型。那为什么以个人观点来看,绝大部分情况下,我们感受到这个世界是统一的呢?完全有可能不同的模型给出的是不同的判断结果。问题的答案就是我们这本书的书名《千智之脑》,也就是当我们要形成某项决策或者判断的时候,大脑中的各种皮质柱会根据自己的模型做出自己的判断。然后他们在一起投票,看哪一种判断获得支持最多。然后这种判断就会进入我们的意识,形成我们对外部世界统一观点。不知道我的这个解释说清楚了没有,当然就算您听懂了,也不保证我的理解是对的。
在介绍完了作者的最新研究成果即他对大脑真正的运作方式之后,他进入了一个更有趣的话题,就是我们应该如何设计人工智能系统。首先,他认为,真正的人工智能系统必定是在模仿人类智能的运作方式,也就是具有灵活的学习能。而且人工智能建立的外部世界模型应该也是基于参考系框架的。
这本书应该还是比较新的,但是它的出版应该是早于chat GPT问世之前,作者对他成书时的人工智能发展状况做了一些表述。他认为,当时的人工智能系统都是专用性的,没有达到大脑的通用性的水平。因为人类的大脑几乎可以学习任何的东西,只要有足够的动机,但当时人工系统虽然在很多方面超过人类,但是它们都只能做一件事。比如阿尔法go就只会下围棋。同时,他也提到了大语言模型,说在神经网络方面有一项成就引人注目。这些人工智能模型可以写出像人类说出来的一样的文字。不他它显然也把这种语言模型当成了一只有专门功能的专用人工智能。他认为,通用人工智能必须吸收他之前提到的人脑的工作原理,并模仿这一原理才可能实现。
不过在我看了一些视频和资料之后,我觉得作者低估了大语言模型的能力。从某种意义上来讲,大语言模型正是再通过作者所表述的那种坐标系框架在学习外部世界,只是它是通过语言文字在学习,而不像我们人类通过各种感官。之所以说它也是通过坐标系框架建立世界模型,是因为大语言模型并不是直接学习文字的。它根据他的原理,它首先要把人类语言中的词语转化成一个复杂的向量,用数字表示。下面的话要理解,就需要有一些线性代数方面的知识了。所谓向量可以认为是一个多维空间中的点。组成这个向量具体的数值向量一般长成这个样子——(1,2,3,4)。向量本身可以看作是一个多维空间中的点。这个空间可以是我们日常所见的二维平面、三维立体空间,甚至是四维、五维、六维一直到直到无穷维空间。而组成向量的各个具体数字。如上面的1,2,3,4就是这个向量的坐标。
而在大语言模型当中,每一个向量就代表着一个词语。而这个词语因为是来自人类语言的,它又和外部世界中的一个事物对应。比如说“石头”这个词就对应着一种天然形成的很坚硬的东西。而“黄金”就是对应的一种闪闪发光的坚硬的石头。当然这个例子有点不恰当,因为黄金实际上是金属,严格来说并不算是石头。但在某大部分人看来,它和石头的性质是接近的。那么两个性质接近的事物在一个高维空间当中的位置的距离就应该比较近。大语言模型的学习过程,就是通过阅读大量的人类文字找出词语之间在高维空间中相对位置的关系,或者说是不断调整每个词语的坐标,把它们摆到正确的位置之上的过程。最终的结果也就是一个和整个世界相关的模型。这在本质上和作者所说的大脑的皮质柱,通过坐标系框架给世界建模是一样。
而如今人工智能发展的前沿之一就是多模态,也是将一些不同功能的模型和大语言模型连接起来。比如可以把具有图像识别功能的模型,通过某种方式和大元模型连接起来,这让模型具有了看图识图的功能,甚至描述图片内容并做出推理的能力。所以说我觉得虽然作者在写书的时候,认为真正的通用人工智算法还没有出现。但是我实际上,我认为现在的人工智能与作者所研究的人脑运作方式的原理接近程度,比作者当时认为的要大的多。现在的机器智能和人类智能相比还不具备的一个特点就是实时的学习。人工智能模型的训练需要耗费很高的成本。而且模型一旦学习成功之后,就就很难做出更改。如chat GPT,就只知道2010年以前的事情,因为在那后训练就停止了,学习的过程也停止了。但是,人类几乎是具备终身学习的能力。人类大脑中的神经元可以不断的建立新的连接,也可以删除一些不常用的连接。这样我们会遗忘一些事情,同时学又会新的知识。当然在我看来,这一个缺点并不算很重要的事情。因为我们人类大脑的可塑性也不是那么强大。绝大部分人在进入成年之后,世界观基本上啊也就定型了,所能做出的也只是微调而已。特别是人到老年之后,就很难再接受新的事物了。人类的大脑的可塑性与人工智能模型而言,也只是程度上略微好一点点。而且现在也存在一些对人工智能模型进行微调的开销较小的技术。
智能是人类引以为傲的一项特质,以前有一些哲学家感叹,人类是万物的灵长,是特殊的存在。随着机器学习技术的发展,也许人类的这份骄傲保持不了多长时间了。