统计学

龙望、胡智星

目录

  • 1 第一单元   绪论
    • 1.1 课程总体介绍
    • 1.2 理论部分
    • 1.3 应用部分
    • 1.4 单元小结
    • 1.5 随堂小练
    • 1.6 课后习题详解
    • 1.7 【思政导读】统计学家:戴世光
  • 2 第二单元  数据的搜集
    • 2.1 理论部分
    • 2.2 应用部分
    • 2.3 单元小结
    • 2.4 随堂小测
    • 2.5 课后习题详解
    • 2.6 【思政导读】统计学家:吴定良
  • 3 第三单元  数据的图表展示
    • 3.1 理论部分
    • 3.2 应用部分
    • 3.3 单元小结
    • 3.4 随堂小测
    • 3.5 课后习题详解
    • 3.6 【思政导读】数据可视化名人
  • 4 第四单元   数据的概括性度量
    • 4.1 理论部分
    • 4.2 应用部分
    • 4.3 单元小结
    • 4.4 随堂小测
    • 4.5 课后习题详解
    • 4.6 【思政导读】趣味统计故事会
  • 5 第五单元  概率与概率分布
    • 5.1 理论部分
    • 5.2 应用部分
    • 5.3 单元小结
    • 5.4 随堂小测
    • 5.5 课后习题详解
    • 5.6 【思政导读】正态分布的前世今生
  • 6 第六单元  统计量及其抽样分布
    • 6.1 理论部分
    • 6.2 应用部分
    • 6.3 单元小结
    • 6.4 随堂小测
    • 6.5 课后习题详解
    • 6.6 【思政导读】T分布的由来
  • 7 第七单元  参数估计
    • 7.1 理论部分
    • 7.2 应用部分
    • 7.3 单元小结
    • 7.4 随堂小测
    • 7.5 课后习题详解
    • 7.6 【思政导读】脱贫普查工作
  • 8 第八单元  假设检验
    • 8.1 理论部分
    • 8.2 应用部分
    • 8.3 单元小结
    • 8.4 随堂小测
    • 8.5 课后习题详解
    • 8.6 【思政导读】 P 值详解
  • 9 第九单元  分类数据分析
    • 9.1 理论部分
    • 9.2 应用部分
    • 9.3 单元小结
    • 9.4 随堂小测
    • 9.5 课后习题详解
    • 9.6 【思政导读】从数据的角度看《泰坦尼克号》
  • 10 第十单元  方差分析
    • 10.1 理论部分
    • 10.2 应用部分
    • 10.3 单元小结
    • 10.4 随堂小测
    • 10.5 课后习题详解
    • 10.6 【思政导读】方差分析的应用
  • 11 第十一单元 一元线性回归
    • 11.1 理论部分
    • 11.2 应用部分
    • 11.3 单元小结
    • 11.4 随堂小测
    • 11.5 课后习题详解
    • 11.6 【思政导读】高尔顿与回归
  • 12 第十二单元 多元线性回归
    • 12.1 理论部分
    • 12.2 应用部分
    • 12.3 单元小结
    • 12.4 随堂小测
    • 12.5 课后习题详解
    • 12.6 【思政导读】统计学家:许宝騄
  • 13 第十三单元 时间序列分析和预测
    • 13.1 理论部分
    • 13.2 应用部分
    • 13.3 单元小结
    • 13.4 随堂小测
    • 13.5 课后习题详解
    • 13.6 【思政导读】毛主席田野调查
  • 14 第十四单元 指数…
    • 14.1 理论部分
    • 14.2 应用部分
    • 14.3 单元小结
    • 14.4 随堂小测
    • 14.5 课后习题详解
    • 14.6 【思政导读】中国统计思维
  • 15 【选学】专题1:统计调查
    • 15.1 调查问卷基础知识
    • 15.2 网络问卷实操
  • 16 【选学】专题2:空间统计基础
    • 16.1 理论:空间统计学
    • 16.2 应用1:空间模式识别
  • 17 【选学】专题3:多元统计分析
    • 17.1 多元统计分析入门
    • 17.2 【实操案例】K-means聚类分析
    • 17.3 【实操案例】主成分分析
  • 18 【选学】专题4:高级统计工具
    • 18.1 R语言之Rstudio入门
    • 18.2 python之Jupyter notebook入门
    • 18.3 数据可视化BI工具
  • 19 【选学】专题5:文本大数据统计应用
    • 19.1 理论
    • 19.2 应用
  • 20 【选学】专题6:统计建模竞赛
    • 20.1 大学生统计建模培训
    • 20.2 空间计量建模
  • 21 国贸专题:国际贸易网络流数据分析
    • 21.1 网络计量方法
    • 21.2 国际贸易网络分析实践
  • 22 审计与财管专题:统计实务
    • 22.1 ppt
    • 22.2 应用案例
  • 23 数经与财管专题:商务大数据分析
    • 23.1 RFM:识别客户群体
  • 24 金科专题:时间序列预测综合
【思政导读】 P 值详解

一、P 值的由来

R·A·Fisher(1890-1962)作为一代假设检验理论的创立者,在假设检验中首先提出 P 值的概念。他认为假设检验是一种程序,研究人员依照这一程序可以对某一总体参数形成一种判断。也就是说,他认为假设检验是数据分析的一种形式,是人们在研究中加入的主观信息。(当时这一观点遭到了 Neyman-Pearson 的反对,他们认为假设检验是一种方法,决策者在不确定的条件下进行运作,利用这一方法可以在两种可能中作出明确的选择,而同时又要控制错误发生的概率。这两种方法进行长期且痛苦的论战。虽然 Fisher 的这一观点同样也遭到了现代统计学家的反对,但是他对现代假设检验的发展作出了巨大的贡献。)Fisher 的具体做法是:

  1. 假定某一参数的取值。

  2. 选择一个检验统计量 (例如 z 统计量或 Z 统计量) ,该统计量的分布在假定的参数取值为真时应该是完全已知的。

  3. 从研究总体中抽取一个随机样本 4 计算检验统计量的值 5 计算概率 P 值或者说观测的显著水平,即在假设为真时的前提下,检验统计量大于或等于实际观测值的概率。

  • 如果 P 值 < 0.01,说明是较强的判定结果,拒绝假定的参数取值。

  • 如果 0.01<P 值 < 0.05,说明较弱的判定结果,拒接假定的参数取值。

  • 如果 P 值 > 0.05,说明结果更倾向于接受假定的参数取值。

可是,那个年代,由于硬件的问题,计算 P 值并非易事,人们就采用了统计量检验方法,也就是我们最初学的 t 值和 t 临界值比较的方法。统计检验法是在检验之前确定显著性水平,也就是说事先确定了拒绝域。但是,如果选中相同的,所有检验结论的可靠性都一样,无法给出观测数据与原假设之间之间不一致程度的精确度量。只要统计量落在拒绝域,假设的结果都是一样,即结果显著。但实际上,统计量落在拒绝域不同的地方,实际上的显著性有较大的差异。

因此,随着计算机的发展,P 值的计算不再是个难题,使得 P 值变成最常用的统计指标之一。

二、P 值的计算

为理解 P 值的计算过程,用表示检验的统计量,表示根据样本数据计算得到的检验统计量值。

左侧检验 0:0 vs 1:<0

P 值是当=0时,检验统计量小于或等于根据实际观测样本数据计算得到的检验统计量值的概率,即 p 值 = (|=0)

右侧检验 0:0 vs 1:>0

P 值是当=0时,检验统计量大于或等于根据实际观测样本数据计算得到的检验统计量值的概率,即 p 值 = (|=0)

双侧检验 0:=0 vs 1:0

P 值是当=0时,检验统计量大于或等于根据实际观测样本数据计算得到的检验统计量值的概率,即 p 值 = 2(|||=0)

三、P 值的意义

P 值就是当原假设为真时所得到的样本观察结果或更极端结果出现的概率。如果 P 值很小,说明这种情况的发生的概率很小,而如果出现了,根据小概率原理,我们就有理由拒绝原假设,P 值越小,我们拒绝原假设的理由越充分。

总之,P 值越小,表明结果越显著。但是检验的结果究竟是 “显著的”、“中度显著的” 还是 “高度显著的” 需要我们自己根据 P 值的大小和实际问题来解决。