如果系统只有一个自变量 x,一个响应变量 y (可以有多个应变量,为方便起见,暂假定只有一个应变量) 的 n 次试验的试验样本具有下表形式:
假设过程是线性的,那么就可以写出数学模型,
yi= a +bxi + ei,(i=1,2,...,n) ------(4.1)
其中 e=(e1,...,en)T 为观察的误差向量,假定它服从正态分布。
这里,a 和 b 是待确定的参数。即,未知数是 a 和 b。求 a 和 b 的过程,使用最小二乘法。俗称 配直线 。
因为实验有误差,算出来的 a, b 也是有误差的,所以叫做估计值。
以后我们用 β 表示估计值,文献标准写法,应该加一个帽子,因为 HTML 加这个帽子太麻烦,我们省略这个帽子。 就是说,我们要配的直线是回归直线
这个关系称为相关系数(correlation coefficient)。相关系数的最大值为 1,称为正相关,最小值为 -1,负相关。
绝对值 |r | 越接近于 1,y 与 x 之间的线性关系越好;
离 1 越远,其线性关系越差。当 r=0 ,线性关系不存在或说没有关系。
用 r 来衡量 y 与 x 之间是否有线性关系, r 需要达到一个起码值(临界值),
相关系数临界值记作 rα(n-2) 。它依赖于自由度 n-2 和置信系数 α 两个参数。
这个临界值可以查统计学相关系数临界值表。也可以由近似计算得到,在我的计算程序中,由近似计算提供。
如果
r< rα(n-2) ------(4.16)
就说 y 与 x 之间以置信水平 α 相关,否则称以置信水平 α 不相关。
相关不相关,就看 α 与 1 之间的差距的大小。 1-α 被认为是置信概率。
有时简单地记作 P=1-α 并称为 P 值。P 值太小,置信概率太低。在统计学上没有意义。
说在统计学意义上不相关。
由此,当 P 接近但不等于 1,我们说 y 与 x 之间是高相关的,当 P 接近但不等于 0,弱相关。