第三章的名字是:从证据到因:当贝叶斯牧师遇见福尔摩斯先生。
什么是贝叶斯定理?
贝叶斯定理是18世纪50年代,英国一位牧师托马斯.贝叶斯提出来的,用数学工具表示贝叶斯定理有一些头疼,先用语言和案例介绍贝叶斯定理吧:
1.首先你对事务有一个先验判断;
2.你获得一个新的证据;
3.根据证据更新你的判断;
4.再等待新的证据。
比如,现在的深度学习方法和神经网络算法,给计算机喂大量的数据,可以让计算机学会认识猫和狗,前提是需要喂给计算机非常多非常多的数据才行。但是你教小孩子认识猫和狗,似乎只需要若干次就可以了。小孩就是利用贝叶斯定理认识猫和狗的:见到一个类似的猫或狗,就会猜测这是猫还是狗,得到纠正后,就会更新判断,并用更新的信念用于下一次判断。
不仅仅是小孩,其实成人也是贝叶斯定理的使用者,只是经常是模糊使用,不清楚而已。
福尔摩斯的侦探方式就是使用贝叶斯定理的一个体现。福尔摩斯有句名言:“当你排除了所有不可能的,剩下的那个无论有多么不可思议,都一定是真相”。每获得一个新证据排除了一个可能性,·剩下的部分可信度就逐渐升高,直到最后只剩下一个。
中学时学习的概率题目通常是这样的,一个箱子里有50个白球,50个黑球,随机从箱子里取出一个球,请问白色的概率是多少?答案很简单,50%。但是生活中大多数时候是信息不完备的,没有人出一道题,还会有标准答案在后面等着你。更大可能性是有一个黑箱子,不知道里面有什么球。请问,你取出一个白球的概率是多少,又或者,你取出一个白球后,请问,里面有白球的概率是多少。这和福尔摩斯判案是类似的问题。
从概率学上说,贝叶斯是寻找逆概率的方法。什么是逆概率?和逆概率相对应的是前置概率。比如,我们观察到有个小孩将石头丢向你的窗户,我们可以预测到窗户会破碎的可能性有多大,这就是是前向概率,我们的认知通常在这个方向运作;但是,如果你发现你的窗户破了,我们要找到原因(是小孩用石头砸碎的?还是自己碎裂的?)。我们要像福尔摩斯一样去破案。这就是逆概率,由结果追溯原因的方法。
可恶的公式。但是却不得不理解。
不使用公式,我们人类也在使用贝叶斯定理,但是公式会给我们更加精确的结果。这区别就像石器时代的石刀和现代车床刀具的区别。
我们从到茶店里光顾的顾客开始谈起,用P(S)表示客人点烤饼的概率,用P(T)表示客人点茶的概率。如果我们已知一个顾客点了茶,那么P(S|T)就表示这位顾客点烤饼的概率(竖线意为“假设我知道”,这个概率表达式也称之为条件概率)。同样,如果我们已知某位顾客点了烤饼,则P(T|S)就表示这位顾客点茶的概率。如此一来,我们就有下面两个公式:
P(S且T)=P(S|T)P(T)
第二个则是:
P(S且T)=P(T|S)P(S)
很显然,如果两个量分别等于第三个量,那么这两个量也相等。因此,我们推导出:
P(S|T)P(T)=P(T|S)P(S)
这个公式就是贝叶斯公式,看上去似乎很简单,但是要深刻理解还需要不少时间。我们用这个公式对接受医院体检,结果为阳性的情况进行分析,看看分析的结果和我们日常的感受有什么区别。
乳腺癌检测阳性后到底有多可怕
举例来说,一位40岁的女性做X光检测后,结果为阳性。那么,她应该在多大程度上相信这个结果,她是否要接受手术?我们根据前面的贝叶斯公式进行描述和分析:
P(D|T)=P(T|D)P(D)/P(T)
我们假定D代表疾病,T代表检测为阳性。其中P(D|T)的意思是,如果你检测为阳性,得病的概率是多少?
我们通过公式进行计算。首先是P(D),P(D)的意思是人群中乳腺癌患病的比例,这里是1/700,也就是说,每700人当中有一个人患乳腺癌,这是一个先验概率;其次是P(T),P(T)的意思是在人群中检测为阳性的概率,这里包括有病的人检测为阳性,以及没有病的人被检测出假阳性。乳房X光检测的敏感度为73%,也就是说,如果你有病的话,有73%的概率会被检测出阳性。另外还有个数据是假阳性的概率,数据是12%,也就是说,你没有病,有12%的概率检测为阳性。合并这两者的数据,公式如下:
P(T)=(1/700)×(73%)+(699/700)×(12%)≈12.1%。这个数据和全体人群的假阳性概率差不多,主要是因为每700人中才一个人患癌,对数据贡献太小。
最后我们计算出患病的概率P(D|T)=73%*(1/700)/(12.1%)=1/116,小于1%。
这一个结论和我们通常的想法大不一样,X光检测为阳性的40岁女性有更高的概率没有患病。当然,如果她接受复查,再次为阳性的话,重新计算概率时的先验概率就不应该是1/700了。新的阳性证据就提高了患病的概率。还有,如果病人有家族史,或者本来就携带乳腺癌遗传基因,那么,它的先验概率也不是1/700了,而是1/20或者更小。
贝叶斯网络:应如何看待数据!!!
贝叶斯的逆概率规则是一种形式最为简单的贝叶斯网络,前面我们讨论的茶馆点烤饼→点茶;疾病→检测就是这样的简单网络。对于更加复杂的贝叶斯网络,我们要总结出3个简单的基本类型,借助这些类型,未来可以组建成更加复杂,更加有用途的贝叶斯网络(在后面的文章中,也是组件因果图的基本形式)。这三种形式是:
A→B→C。这种接合形式是被称为“链”接合或中介接合的最简单的表现形式。
A←B→C。这种接合形式被称为“叉”接合,B通常被视作A和C的共因(common cause)或混杂因子(confounder)。混杂因子会使A和C在统计学上发生关联,即使它们之间并没有直接的因果关系。
A→B←C。这是最让人着迷的一种接合形式,被称作“对撞”(collider)接合。这个例子是:才华→名人←美貌。
三种接合形式,链接合、叉接合和对撞接合,就像分隔因果关系之梯第一层级和第二层级大门的锁眼。透过锁眼向第二层级窥探,我们就可以发现观测数据背后的因果过程的秘密。每一种接合都代表了一个因果流的不同模式,并在数据中以条件独立性和非独立性的形式留下标记。在后面的章节中,会经常遇到这些符号,也是非常烧脑的一部分内容。到时候在做分晓吧。
真实世界中的贝叶斯网络
真实世界中贝叶斯网络已经无处不在了,被广泛应用于语音识别、垃圾邮件识别,甚至在游戏中的排名。其中两个和DNA识别有关的案例是:
2014年7月17日,马来西亚航空公司飞往吉隆坡的17号航班从阿姆斯特丹的史基浦机场起飞,在乌克兰东部上空,被一枚俄罗斯制造的地对空导弹击落。机上的298人全部遇难。由于是导弹击落的飞机,所有遇难乘客尸体被严重烧毁,其DNA信息也遭到了破坏。幸运的是,法医研究所有一个强大的工具——“波拿巴”,这个工具就是利用贝叶斯网络,综合比对来自遇难者几个不同的家庭成员的DNA信息来识别乘客的尸体的。
2018年4 月,美国加州警方利用一个开放的在线基因数据库网站,破获了一个二十世纪七八十年的悬案,这位嫌疑犯是强奸杀人案的“金州杀手”(Golden State Killer)。这个数据网站的方法是通过DNA数据匹配,找到嫌疑犯的亲戚,在通过贝叶斯方法,绘制家谱,最终找到嫌疑犯本人。通过这种方法,中国以前被拐卖的小孩,也可以找到自己的亲戚,进而更容易找到家人。
来自于 [WhereIn Android] (http://www.wherein.io)