统计学

龙望

目录

  • 1 第一单元   绪论
    • 1.1 课程总体介绍
    • 1.2 理论部分
    • 1.3 应用部分
    • 1.4 单元小结
    • 1.5 随堂小练
    • 1.6 课后习题详解
    • 1.7 【思政导读】统计学家:戴世光
  • 2 第二单元  数据的搜集
    • 2.1 理论部分
    • 2.2 应用部分
    • 2.3 单元小结
    • 2.4 随堂小测
    • 2.5 课后习题详解
    • 2.6 【思政导读】统计学家:吴定良
  • 3 第三单元  数据的图表展示
    • 3.1 理论部分
    • 3.2 应用部分
    • 3.3 单元小结
    • 3.4 随堂小测
    • 3.5 课后习题详解
    • 3.6 【思政导读】数据可视化名人
  • 4 第四单元   数据的概括性度量
    • 4.1 理论部分
    • 4.2 应用部分
    • 4.3 单元小结
    • 4.4 随堂小测
    • 4.5 课后习题详解
    • 4.6 【思政导读】趣味统计故事会
  • 5 第五单元  概率与概率分布
    • 5.1 理论部分
    • 5.2 应用部分
    • 5.3 单元小结
    • 5.4 随堂小测
    • 5.5 课后习题详解
    • 5.6 【思政导读】正态分布的前世今生
  • 6 第六单元  统计量及其抽样分布
    • 6.1 理论部分
    • 6.2 应用部分
    • 6.3 单元小结
    • 6.4 随堂小测
    • 6.5 课后习题详解
    • 6.6 【思政导读】T分布的由来
  • 7 第七单元  参数估计
    • 7.1 理论部分
    • 7.2 应用部分
    • 7.3 单元小结
    • 7.4 随堂小测
    • 7.5 课后习题详解
    • 7.6 【思政导读】脱贫普查工作
  • 8 第八单元  假设检验
    • 8.1 理论部分
    • 8.2 应用部分
    • 8.3 单元小结
    • 8.4 随堂小测
    • 8.5 课后习题详解
    • 8.6 【思政导读】 P 值详解
  • 9 第九单元  分类数据分析
    • 9.1 理论部分
    • 9.2 应用部分
    • 9.3 单元小结
    • 9.4 随堂小测
    • 9.5 课后习题详解
    • 9.6 【思政导读】从数据的角度看《泰坦尼克号》
  • 10 第十单元  方差分析
    • 10.1 理论部分
    • 10.2 应用部分
    • 10.3 单元小结
    • 10.4 随堂小测
    • 10.5 课后习题详解
    • 10.6 【思政导读】方差分析的应用
  • 11 第十一单元 一元线性回归
    • 11.1 理论部分
    • 11.2 应用部分
    • 11.3 单元小结
    • 11.4 随堂小测
    • 11.5 课后习题详解
    • 11.6 【思政导读】高尔顿与回归
  • 12 第十二单元 多元线性回归
    • 12.1 理论部分
    • 12.2 应用部分
    • 12.3 单元小结
    • 12.4 随堂小测
    • 12.5 课后习题详解
    • 12.6 【思政导读】统计学家:许宝騄
  • 13 第十三单元 时间序列分析和预测
    • 13.1 理论部分
    • 13.2 应用部分
    • 13.3 单元小结
    • 13.4 随堂小测
    • 13.5 课后习题详解
    • 13.6 【思政导读】毛主席田野调查
  • 14 第十四单元 指数…
    • 14.1 理论部分
    • 14.2 应用部分
    • 14.3 单元小结
    • 14.4 随堂小测
    • 14.5 课后习题详解
    • 14.6 【思政导读】中国统计思维
  • 15 【选学】专题1:统计调查
    • 15.1 调查问卷基础知识
    • 15.2 网络问卷实操
  • 16 【选学】专题2:空间统计基础
    • 16.1 理论:空间统计学
    • 16.2 应用1:空间模式识别
  • 17 【选学】专题3:多元统计分析
    • 17.1 多元统计分析入门
    • 17.2 【实操案例】K-means聚类分析
    • 17.3 【实操案例】主成分分析
  • 18 【选学】专题4:高级统计工具
    • 18.1 R语言之Rstudio入门
    • 18.2 python之Jupyter notebook入门
    • 18.3 数据可视化BI工具
  • 19 【选学】专题5:文本大数据统计应用
    • 19.1 理论
    • 19.2 应用
  • 20 【选学】专题6:统计建模竞赛
    • 20.1 PPT
    • 20.2 视频
  • 21 国贸专题:国际贸易网络流数据分析
    • 21.1 网络计量方法
    • 21.2 国际贸易网络分析实践
  • 22 审计与财管专题:统计实务
    • 22.1 ppt
    • 22.2 应用案例
  • 23 数经与财管专题:商务大数据分析
    • 23.1 RFM:识别客户群体
  • 24 金科专题:时间序列预测综合
【思政导读】高尔顿与回归
  • 高尔顿与“回归”


     

高尔顿的思想演变

                  回归分析的过去绕不开高尔顿。正是高尔顿提出了“回归”这一概念。但最初,他的兴趣并不在这里。

高尔顿出生于1822年2月16日。1844年,也就是他22岁时,父亲去世,留下一大笔财产。从此,他放弃学医,转而追随自己的激情——旅行。高尔顿曾经两次去非洲探险,一次是沿着尼罗河往上到达喀土穆,一次是在非洲西南部的瓦尔维斯湾登陆,为了找到通往恩加米湖的新通道。根据自己的旅行探险经历,高尔顿在《热带非洲》杂志上发表文章,还写了一本旨在为探险家提供建议的书《旅行的艺术》。

        1859年,查尔斯·达尔文的《物种起源》出版。这成为高尔顿兴趣的转折点。他相信,人类的很多特质和能力是遗传决定的。高尔顿没有止于想法,而是开始收集数据来证实自己的想法。事实上,高尔顿是最早使用问卷和调查方法的人之一,他的思想对统计学发展也产生了巨大影响。在对遗传数据的研究中,他提出了“回归(regression)”的概念。

回归概念的提出

         1875年,高尔顿将7种不同直径的豌豆种子分发给7个朋友。等这些种子长出新豌豆后,朋友们又将新豌豆给回高尔顿。之所以选择豌豆,是因为豌豆是一种自花授粉的植物,这使得高尔顿可以研究单一来源的影响。高尔顿测量了母豌豆及其子豌豆的直径:大豌豆的后代直径也更大,小豌豆的后代直径更小。这验证了高尔顿的想法。但高尔顿发现了一个格外有意思的现象,他称之为“回归平庸”(regression towards mediocrity,):大豌豆的后代的中位直径小于母豌豆的中位直径,向同代的中位直径回归;而小豌豆的后代的中位直径大于母豌豆的中位直径,同样向同代的中位直径回归。高尔顿的父亲曾经向他展示过非常细致的图表。受父亲的影响,高尔顿绘制了或许是历史上第一张“回归线”图:



        这张图中的R不是我们现在理解的相关关系(皮尔逊后来才用r表示相关系数),它是高尔顿估计的母豌豆种子直径的回归系数(recursion),或者说回归线的斜率,这一系数等于0.33。它表示子豌豆的直径与同代豌豆平均值的偏差,平均而言只有母豌豆与同代平均值偏差的1/3。这一数值小于1,证明“回归”现象的存在。

在高尔顿看来,“回归平庸”是一种生物学现象,它似乎保证了后代的遗传特征不会越来越极端化。

1884年,高尔顿在伦敦建立了一个人体测量实验室,广泛收集各种人体测量数据。高尔顿在人体测量数据(比如身高)上同样发现了“回归”现象: 子女身高与同代人平均值的偏差,平均而言是中间父母(mid-parentage)与同代人平均值偏差的2/3。中间父母是指父亲和母亲的平均值。



         当回归不仅在豌豆上观察到,也在人类的各种测量数据中发现,高尔顿更加确信“回归法则”(Law of Regression)的存在。他这样解释回归法则:首先,孩子的特征一方面遗传自他/她的父母,一方面遗传自更早的祖先。谱系追溯地越久远,祖先的数量和差异性就越大,他们的平均值将和种族的平均值没有差异。遥远祖先和中间父母的影响就好像是将固定比例的纯水倒入固定酒精度的酒中,从而稀释父母的影响。中间祖先的影响机制类似,但程度不同。中间祖先是酒和水一定比例的混合倒入酒中,酒也被稀释了。最终,这些的联合影响就是将原始的酒稀释成固定的比例,即遗传常数。

遗传常数:从回归到相关

       高尔顿相信大多数遗传特征有一个统一的遗传常数。但如果遗传常数存在,为什么不同测量特征的回归线的斜率会不一样呢?为了解决这一矛盾,高尔顿意识到,回归线的斜率与两个测量特征的变异性有关。比如,当横轴的变异性大于纵轴的变异性时,回归线就变得平缓。

也就是说,高尔顿初步意识到可以用回归方程 =(/) 来表现两个变量之间的关系。当然,它不是用这样的符号来表示自己的结论的。高尔顿不知道怎么计算r,所以他用的是一个估计值。 / 相当于一个校正系数,用测量特征的变异来校正观察到的斜率,得到高尔顿构想的遗传常数。

现代生物学的研究并不支持遗传常数的存在,但这一想法让高尔顿在概念上对相关和回归做出区分:相关不变,但回归线的斜率可以不一样。

如何理解呢?

        以下是关于这一思想的现代统计学解释。

我们可以创造三组数据。这三组数据的相关系数是一致的,但我们在第一组数据的基础上改变x的变异程度(标准差)或y的变异程度,来看看回归线的斜率是如何变化的?

考虑以下三组数据。x和y都已经中心化,即它们的平均值等于0。每组数据中,x和y的相关都是0.64。你可以使用相关统计软件来检验这一点。

data1

data2

data3
xy
xy
xy
-3-5
-6-5
-3-10
-31
-61
-32
-10
-20
-10
20
40
20
21
41
22
33
63
36

数据1中x和y的标准差都是2.68,而在数据2中,我们放大x的标准差(5.37),让回归线变缓。在数据3中,我们放大y的标准差,回归线变得更加陡峭。




相关系数度量的是以标准差为单位的两个变量共同变异的程度,它与方向无关。回归系数度量的是预测变量每变化一个单位,结果变量变化多少单位。用y对x做回归,和用x对y做回归,回归系数或者说回归线的斜率是不一样的。回归系数与两个变量的相关系数、两个变量各自的变异程度相关。它告诉我们,当x的原始单位变化一个单位时,为了知道y在原始单位上会变化多少,我们需要知道x和y之间的相关性,以及x和y本身的变异程度。

相关拓宽了高尔顿的思考领域

相关的发现让高尔顿得以研究更广泛的问题。1888年,高尔顿开始思考与遗传不相关的两个问题:

  1. 如果我们从古墓里挖掘出一个人的股骨,这根股骨的长度可以告诉人类学家股骨主人的身高或身材吗?

  2. 在刑事鉴定中,同一个人不同部位的测量特征有什么关系?

高尔顿很快发现,这些问题和已经解决的遗传中的亲属关系问题(母豌豆和自豌豆的大小、父母和子女的身高)没有本质的区别,它们都是相关的问题。在高尔顿的概念中,相关意味着两个测量特征受到相同因素的影响。它用差异的程度来描述相关,比如随机抽取的两个英国人身高差异的中位数是2.4英寸,而两兄弟身高差异的中位数只有1.4英寸。

在量纲一致的情况下,回归就是对相关的测量。当量纲不一致时,你还要考虑不同特征的离散程度。假设我们在分析一群人左手中指的长度和身高的关系。我们发现,平均而言,中指的长度偏离均值1英寸,身高就会偏离均值8.19英寸,而身高偏离均值1英寸,中指的长度平均偏离均值0.06英寸。可以表示为:

=8.19

=0.06

为了计算相关指数(index of correlation),需要考虑两个不同的离散程度(本质上就是标准差):

(0.06)×17515=(8.19)×15175

高尔顿对相关的应用前景表示乐观。他认为,相关还可以用来研究社会问题,比如贫穷和犯罪的关系。高尔顿认为,相关性法则涵盖了广泛的主题领域,任何有能力、有兴趣的人都可以参与研究:

There is a vast field of topics that fall under the laws of correlation, which lies quite open to the research of any competent person who cares to investigate it.

回归的假象

高尔顿关于遗传的许多思想已经被证明是错误的,这里的梳理主要是为了追随高尔顿的思想脉络,加深对回归和相关的理解。在最后一节,我们将说明,高尔顿所谓的“回归”的生物学现象其实也只是一个统计学假象,它是选择性偏差的结果。

如果理解呢?

任何一个测量特征都是信号和噪音的组合。当我们选择高于平均值的测量特征时,信号(遗传因素)和噪音(随机的环境因素)都很可能高于平均值。我们观察它们的下一代的同一测量特征,高于平均值的信号会被传递下去,但高于平均值的噪音不会,因为这些噪音是随机的,两代人之间相互独立。

我们可以构造模拟数据来复现这一统计现象。假设有16颗豌豆,父母豌豆直径是第4列的测量值,从高到低排序,同一行是父母豌豆对应的后代豌豆大小,后代豌豆的信号值和父母豌豆相同,但噪音是独立且随机的。我们将16颗豌豆按父母豌豆直径大小从高到低排序,分为4组,每组4个,计算每组的平均值,比如编号1~4的4颗豌豆直径最大,平均有22,比同代人均值高2.6875(22-19.3125),而这4颗豌豆对应的后代豌豆的平均直径是20.75,比同代豌豆的直径高1.125,低于父母豌豆的幅度,向同代人的均值“回归”,同理,我们观察最小的4颗父母豌豆,平均直径是16.75,低于均值2.5625,对应的后代豌豆比均值低1.625,同样向同代人的均值“回归”。我们通过构造数据复现了这一统计学现象。



总结

因为表哥达尔文《物种起源》一书,高尔顿对遗传问题产生了浓厚的兴趣,并积极收集数据证明自己的想法。高尔顿的许多生物学思想已经被证明是错误的,但他的调查分析确实对现代统计学的发展产生了巨大影响。

许多人可能认为,是先有相关,再有回归,但历史正好相反。

高尔顿在对豌豆、人类的遗传特征的研究中首次发现了“回归”现象:后代在同一测量特征上与同代人平均值的差异总是会小于他们的父母与同代人的差异。而且,高尔顿相信,后代和父母与同代人的差异存在固定的数量关系,即遗传常数。这导致高尔顿发现了相关系数:两个测量特征的相关不变,但可以通过它们的变异程度的比值来调整观察到的回归线的斜率。相关的发现进一步拓宽了高尔顿的思考领域,使他可以关心更加广泛的话题。