现在当家长,学校不光给孩子布置作业,而是把作业告诉家长,让家长督促孩子完成作业。比以前我们小时候当家长可要累多了。不光是这个,还要学习教育局给老师安排的任务,让家长们学习家长课堂,就是在微信小程序上上课,观看视频课程打卡。本来是有点抵触的,但是没办法,硬着头皮去看了。家长看了视频,发现有几期讲得还是非常好的。
比如有一期是讲如何正确地利用奖励和惩罚。奖励和惩罚本来是家长管教孩子时最常用的手段,但是在实际应用中还是有很多误区的。看了这些课,还真没有意识到。比如,之前也给小宝贝立过这样的规矩,说学校的课堂测试,如果能够考进班上的前20名,就给他奖励好吃的零食,或者是玩具之类的。其实我的这些想法很多是因为最近这几年来特别关注AI人工智能领域的知识和技术,得到了一些启发。
AI人工智能神经网络的训练一般是两种,一种就是有监督的训练,一种叫强化学习,是一种无监督的训练。有监督的训练很简单,就是把训练的数据和答案都丢给训练程序,训练程序会让模型接收数据,然后给出一个输出,用输出和答案进行对比,然后给出一个损失函数,损失函数的值越大,就需要模型对自己本身的参数做出更大的调整。这种有人类监督的学习方式可以看成是以惩罚为主,损失函数就相当于是人类给AI模型的惩罚,损失函数越大,惩罚就越厉害。
而强化学习则是恰恰相反,它让AI模型自己去探索人类预设的环境,自己去找出方法,当然在AI模型寻找方法的时候,它采取的步骤所带来的后果会有一个奖励值给它,如果采取的步骤符合我们的要求,就会得到更多的奖励。所以强化学习就是一种以奖励为主的训练方式,而人工智能也是从生物的神经网络受到的启发,既然这些方式对机器这么好用,效果这么好,在人类学习过程中当然也是可以借鉴的。
不过看了这个节目之后,还是不得不说这个想法太机械太片面,人类还是有很大不同的。我下完这节网课之后,深刻地认识到人和机器的最大不同,还是因为人有自我意识,虽然现在的人工智能行为越来越像人类,在能力上还大大地超越人类,但自主意识这个问题应该还是不具备的,特别是学习这件事情,特别是人类的学习这件事情,是不一定需要过多地使用奖励和惩罚的,因为频繁地使用奖励和惩罚,就会把人,就会把家长摆在一个控制者,或者说统治者的地位,而孩子则成为被控制者,长期如此对他们的人格的健全和完善是不利的,仅就学习方面来说,长期上也是会有不良的影响。
如果成绩好,或者学习表现好,就给予奖励,不好就给予惩罚,当然可以让孩子养成习惯,但是长期这样的话,就会让学习的动力变成了来自外在的奖励,或者对惩罚的恐惧,这种动力驱动是外在的。在这样的方式下,孩子是无法养成自己主动学习,主动求知的动力的,所以这种方式在低年级,要学习的知识还比较简单的情况下是非常管用的,而一旦进入高年级,随着知识复杂度越来越高,越来越难以理解,如果没有主动思考的习惯,后面是很难学习好的,所以在机器上好用的奖励和惩罚,是不应该过多地用在孩子身上,而应该注重培养他们主动学习,启发他们对知识的好奇与渴望,让他们能够自主学习,才是最根本最重要的。
稍微补充一点,人类的神经构造还有一点与机器非常不同,在强化学习当中,奖励机制非常类似于人类的多巴胺奖励机制,但是对机器来说,奖励的大小就是一个数值,它的作用是固定的,但是人类的神经系统会对多巴胺产生奖励依赖,也就是说相同的数量的多巴胺,如果经常刺激的话,会产生耐受,人类的主观快乐会逐渐下降,而需要更大的奖励,所以这也是奖励和惩罚,即使不能够过于频繁地使用的一个原因。