昨天说到现在的开源大模型能力也是进步飞快。号称打平最早期的GPT 3.5的比比皆是。这些开源的大模型使每个人都可以部署属于自己的AI。而不必依赖OpenAI、微软和谷歌这样的大公司。因为AI的重要用途之一就是总结文档、分析数据。而这些内容很可能涉及到用户的隐私和商业机密。如果使用大公司提供的API的话,隐私泄露和数据泄密的风险实在是太高了。再就是,像AI这样强大的技术,只垄断在少数公司手里才是真正的威胁。如果人人都能用得起,用得上AI,那样才可能从整体上提升社会的生产力,拥有更美好的未来。
而开源的AI模型则让每个人都拥有属于自己的AI成为了可能。在开源的AI模型当中最受欢迎的要数,那些7B大小的模型,也就是70亿参数,可以把它理解成有70亿个神经元吧。这样大小的模型。体积和占用空间较小,而且运行的开销比较便宜。经过4位量化之后,性能的损失很少。却可以在一部普通的,拥有4到8G显存的台式PC上运行。而且响应速度还非常快,体验甚至比OpenAI的API还要棒。虽然现在7B模型的技术已经相当强大了。一些日常碰到的问题也能给出让人满意的答案,但是面对复杂的问题仍然表现不够,这是因为它的参数量还是偏小了一点。根据生物学家的研究,人类的大脑平均有上千亿个神经元,而且科学家们推断,在人类进化的过程中,学会了使用火并且吃熟食,这一变化使得人类将较少的资源用在消化系统,将腾出来的资源用来扩大脑容量,是使人类能够走上进化之树顶端的非常重要的原因。
同样的道理也可以应用在AI模型上面,虽然现在最厉害的AI模型GPT-4的参数情况还是商业机密,不过有消息认为GPT-4的参数规模也有1000亿,而且还是有数个上千亿规模的模型组成的混合专家架构,所以它表现出来令人诧异的能力。但在开源模型当中也有很多大规模的模型,其中主要的是700亿参数左右,这个数量虽然没有达到1000亿,但是已经与人类大脑的神经元数量相差不到一个数量级了,而参数达到1000亿的开源模型也有一个,由卡塔尔的高科技公司训练的Falcon 130B,它是用了1300亿模型,据说效果也是非常的不错。
研究人员们发现,这种大语言模型有一种涌现的现象,就是随着参数或者我们用更通俗的话来说,——赛博神经元的数量的增加,当这些赛博神经元的数量增加到一定数量的时候,大模型的某些能力会,出现跳跃式的增长,他们把这种叫做涌现现象。虽然也有研究指出,并不存在所谓的涌现,只是相关研究人员使用的数据有问题,但不管怎样,模型的规模越大,其处理复杂问题的能力就越强,这个倒是没有什么问题的。
不过上面说的几种大规模的开源模型,已经远远超出了普通电脑的承受范围,个人部署是非常困难的,不过在7B和70B模型之间,还有两档可以选择,一个是13B一个是34B,13B的模型比70亿的模型,规模增长有限,在配置稍微高益的电脑上,也能够流畅运行,但是能力提升也相对有限。
34B模型倒是一个不错的选择,它可以运行在一些高端的台式电脑上,但是即便你没有高端的台式电脑,但是可以上网,也有办法体验这种大模型,这种规模的大模型,前不久,我发现在一个叫做kaggle的云算力平台上面,他们提供每周30个小时的免费使用时长,而且他们与著名的谷歌提供的Colab免费云算力平台不同,他们每个实例提供了两张英伟达的T4显卡,而Colab只有一张,每张T4显卡的显存容量有14G,两张合计28G,就足以运行34B规模的大模型了,你只要有电脑和一个kaglle账户,就可以体验。
我用业余时间捣鼓了两天,写了一个notebook,可以使用exllama这个程序,在kaggle上运行34B规模的各种语言模型,其中效果比较好的,就是之前提到过的Yi模型。这是一个国产的模型,在各项评测中,能够打平,甚至部分指标超越GPT3.5。实际使用效果确实也还不错,不过kaggle平台,虽然提供免费的GPU,但也有一些限制,你无法将开源模型常用的webUI运行在平台上,并提供外网访问地址。它一旦检测到,就会停止运行程序,所以这个脚本只能把提示词传给语言模型,让它生成答案,无法聊天,也不能够进行流式输出,所以在回复内容比较长的时候,等待时间也比较长,有时间再继续改进一下。