统计学

龙望、胡智星

目录

  • 1 第一单元   绪论
    • 1.1 课程总体介绍
    • 1.2 理论部分
    • 1.3 应用部分
    • 1.4 单元小结
    • 1.5 随堂小练
    • 1.6 课后习题详解
    • 1.7 【思政导读】统计学家:戴世光
  • 2 第二单元  数据的搜集
    • 2.1 理论部分
    • 2.2 应用部分
    • 2.3 单元小结
    • 2.4 随堂小测
    • 2.5 课后习题详解
    • 2.6 【思政导读】统计学家:吴定良
  • 3 第三单元  数据的图表展示
    • 3.1 理论部分
    • 3.2 应用部分
    • 3.3 单元小结
    • 3.4 随堂小测
    • 3.5 课后习题详解
    • 3.6 【思政导读】数据可视化名人
  • 4 第四单元   数据的概括性度量
    • 4.1 理论部分
    • 4.2 应用部分
    • 4.3 单元小结
    • 4.4 随堂小测
    • 4.5 课后习题详解
    • 4.6 【思政导读】趣味统计故事会
  • 5 第五单元  概率与概率分布
    • 5.1 理论部分
    • 5.2 应用部分
    • 5.3 单元小结
    • 5.4 随堂小测
    • 5.5 课后习题详解
    • 5.6 【思政导读】正态分布的前世今生
  • 6 第六单元  统计量及其抽样分布
    • 6.1 理论部分
    • 6.2 应用部分
    • 6.3 单元小结
    • 6.4 随堂小测
    • 6.5 课后习题详解
    • 6.6 【思政导读】T分布的由来
  • 7 第七单元  参数估计
    • 7.1 理论部分
    • 7.2 应用部分
    • 7.3 单元小结
    • 7.4 随堂小测
    • 7.5 课后习题详解
    • 7.6 【思政导读】脱贫普查工作
  • 8 第八单元  假设检验
    • 8.1 理论部分
    • 8.2 应用部分
    • 8.3 单元小结
    • 8.4 随堂小测
    • 8.5 课后习题详解
    • 8.6 【思政导读】 P 值详解
  • 9 第九单元  分类数据分析
    • 9.1 理论部分
    • 9.2 应用部分
    • 9.3 单元小结
    • 9.4 随堂小测
    • 9.5 课后习题详解
    • 9.6 【思政导读】从数据的角度看《泰坦尼克号》
  • 10 第十单元  方差分析
    • 10.1 理论部分
    • 10.2 应用部分
    • 10.3 单元小结
    • 10.4 随堂小测
    • 10.5 课后习题详解
    • 10.6 【思政导读】方差分析的应用
  • 11 第十一单元 一元线性回归
    • 11.1 理论部分
    • 11.2 应用部分
    • 11.3 单元小结
    • 11.4 随堂小测
    • 11.5 课后习题详解
    • 11.6 【思政导读】高尔顿与回归
  • 12 第十二单元 多元线性回归
    • 12.1 理论部分
    • 12.2 应用部分
    • 12.3 单元小结
    • 12.4 随堂小测
    • 12.5 课后习题详解
    • 12.6 【思政导读】统计学家:许宝騄
  • 13 第十三单元 时间序列分析和预测
    • 13.1 理论部分
    • 13.2 应用部分
    • 13.3 单元小结
    • 13.4 随堂小测
    • 13.5 课后习题详解
    • 13.6 【思政导读】毛主席田野调查
  • 14 第十四单元 指数…
    • 14.1 理论部分
    • 14.2 应用部分
    • 14.3 单元小结
    • 14.4 随堂小测
    • 14.5 课后习题详解
    • 14.6 【思政导读】中国统计思维
  • 15 【选学】专题1:统计调查
    • 15.1 调查问卷基础知识
    • 15.2 网络问卷实操
  • 16 【选学】专题2:空间统计基础
    • 16.1 理论:空间统计学
    • 16.2 应用1:空间模式识别
  • 17 【选学】专题3:多元统计分析
    • 17.1 多元统计分析入门
    • 17.2 【实操案例】K-means聚类分析
    • 17.3 【实操案例】主成分分析
  • 18 【选学】专题4:高级统计工具
    • 18.1 R语言之Rstudio入门
    • 18.2 python之Jupyter notebook入门
    • 18.3 数据可视化BI工具
  • 19 【选学】专题5:文本大数据统计应用
    • 19.1 理论
    • 19.2 应用
  • 20 【选学】专题6:统计建模竞赛
    • 20.1 大学生统计建模培训
    • 20.2 空间计量建模
  • 21 国贸专题:国际贸易网络流数据分析
    • 21.1 网络计量方法
    • 21.2 国际贸易网络分析实践
  • 22 审计与财管专题:统计实务
    • 22.1 ppt
    • 22.2 应用案例
  • 23 数经与财管专题:商务大数据分析
    • 23.1 RFM:识别客户群体
  • 24 金科专题:时间序列预测综合
课后习题详解

一、思考题

1解释估计量和估计值。

 

       ∧

在参数估计中,用来估计总体参数的统计量称为估计量,用符号θ示。样本均值、样本比例样本方

差等都可以是一个估计量 根据一个具体的样本计算出来的估计量的数值称为估计值

 

 

2.简述评价估计量好坏的标准。 评价估计量好坏的标准主要有以下三个:

1)无偏

                                              ∧                  

无偏性是指估计量抽样分布的数学期望等于被估计的总体参数。设总体参数 θ,所选择的估计量为θ,如 Eθθ,则θ θ 的无偏估计量。

 

2)有效性 一个无偏的估计量并不意味着它就非常接近被估计的参它还必须与总体参数的离散程度比较有效性

是指对同一总体参数的两个无偏估计量,有更小标准差的估计量更有效。

3)一致性 一致性是指随着样本量的增大点估计量的值越来越接近被估总体的参换言一个大样本给出的估计

量要比一个小样本给出的估计量更接近总体的参数。

 

 

3怎样理解置信区间? 置信

计学家在某种程度上确信这个区间会包含真正的总体参所以给它取名为  100  样, 100 个样本构造的总体参数 100 个置信区间中, 95%的区间包含总体参数的真值, 5%没包含

对置信区间的理解,有以下几点需要注意:

1中有 95%的区间包含总体参数的真5%的区间不包含总体参数的真 平为 95%的区间也可以用类似的方 式进行表述。

2)总体参数的真值是固定的、未知的,而用样本构造的区间则是不固定的。若抽取不同的样本,那么可

以得到不同的区间从这个意义上说置信区间是一个随机区间它会因样本的不同而不同而且不是所有的区 间都包含总体参数的真值一个置信区间就像是为捕获未知参数而撒出去的不是所有撒网的地点都能捕获到

参数。

3(比  95%这个 样本所产生的区间是否包含总体参数的真值。我们只能希望这个区间是大量包含总体参数真值的区间中的一个, 但它也可能是少数几个不包含参数真值的区间中的一个。

置信区间是一个随机区间,1α 的置信区间意味着,随着样本观察值的不同置信区间也不同, 100 次运 用这个区间,约 1001α)个区间能包含参数,也就是说,大约 100α 个区间不能包含参数。

 

4 95%的置信区间。

95%的置信区的含义为抽 100 个样本根据每一个样本构造一个置信区间这样 100 个样本构 总体参数 100 个置信区间中,95%的区间包含了总体参数的真值, 5%含。

6.解释独立样本和匹配样本的含义。

答:如果两个样本是从两个总体中独立抽取的,即一个样本中的元素与另一个样本中的元素相互独立,则称 为独立样本。

匹配样本是指一个样本中的数据与另一个样本中的数据相对应。



7.在对两个总体均值之差的小样本估计中,对两个总体和样本都有哪些假定? 答:在对两个总体均值之差的小样本估计中,对两个总体和样本需要作出以下假定:

(1)两个总体都服从正态分布。


(2)两个随机样本独立地分别抽自两个总体。



8.简述样本量与置信水平、总体方差、估计误差的关系。 答:(1)样本量与置信水平成正比,在其他条件不变的情况下,置信水平越大,所需的样本量也就越大。

(2)样本量与总体方差成正比,总体的差异越大,所要求的样本量也越大。

(3)样本量与估计误差的平方成反比,即可以接受的估计误差的平方越大,所需的样本量就越小。


二、练习题

1.利用下面的信息,构建总体均值的置信区间。


_

(1)总体服从正态分布,且已知 σ=500,n=15,x=8900,置信水平为 95%。


_

(2)总体不服从正态分布,且已知 σ=500,n=35,x=8900,置信水平为 95%。


_

(3)总体不服从正态分布,σ 未知,n=35,x=8900,s=500,置信水平为 90%。


_

(4)总体不服从正态分布,σ 未知,n=35,x=8900,s=500,置信水平为 99%。


_

解:(1)由于总体服从正态分布,σ=500,n=15,x=8900,α=0.05,z0.05/2 =1.96。所以总体均值 μ 的 95%

的置信区间为:






即(8646.97,9153.03)。

(2)已知总体不服从正态分布,但 n=35 为大样本,因此采用 z 统计量,总体均值 μ 的 95%的置信区间为:






即(8734.35,9065.65)。

(3)已知总体不服从正态分布,σ 未知,但由于 n=35 为大样本,因此可以采用 z 统计量,总体均值 μ 的

90%的置信区间为:




即(8760.97,9039.03)。

(4)已知总体不服从正态分布,σ 未知,但由于 n=35 为大样本,因此可以采用 z 统计量,总体均值 μ 的

99%的置信区间为:




即(8681.95,9118.05)。



2.某大学为了解学生每天上网的时间,在全校 7500 名学生中采取重复抽样方法随机抽取 36 人,调查他们 每天上网的时间,得到表 7-2 的数据(单位:小时)。


表 7-2 某大学 36 名学生每天上网的时间







求该校大学生平均上网时间的置信区间,置信水平分别为 90%,95%和 99%。

解:已知:n=36,当 α 为 0.1,0.05,0.01 时,相应的 z 值分别为:z0.1/2=1.645,z0.05/2 =1.96,z0.01/2 =2.58

根据样本数据计算得:





由于 n=36 为大样本,所以平均上网时间的 90%的置信区间为:




即(2.88,3.76)。


平均上网时间的 95%的置信区间为:





即(2.79,3.85)。

平均上网时间的 99%的置信区间为:




即(2.63,4.01)。


3.某企业生产的袋装食品采用自动打包机包装,每袋标准重量为 100g,现从某天生产的一批产品中按重复

抽样随机抽取 50 包进行检查,测得每包重量如表 7-3 所示。


表 7-3 某企业生产的袋装食品每包重量数据


每包重量(g) 包数

96~98 2

98~100 3

100~102 34

102~104 7

104~106 4

合计 50


已知食品包重量从正态分布,要求:

(1)确定该种食品平均重量的 95%的置信区间。

(2)如果规定食品重量低于 100g 属于不合格,确定该批食品合格率的 95%的置信区间。 

解:(1)已知:总体服从正态分布,但 σ 未知,n=50 为大样本,α=0.05,z0.05/2 =1.96。根据分组的样本数

据计算得:



该种食品平均重量的 95%的置信区间为:





即(100.87,101.77)。

(2)根据样本数据可知,样本合格率为 p=45/50=0.9。该种食品合格率的 95%的置信区间为:




即(0.82,0.98)。



4.假设总体服从正态分布,利用表 7-4 的数据构建总体均值 μ 的 99%的置信区间。 表 7-4


16.4 17.1 17.0 15.6 16.2

14.8 16.0 15.6 17.3 17.4

15.6 15.7 17.2 16.6 16.0

15.3 15.4 16.0 15.8 17.2

14.6 15.5 14.9 17.7 16.3


解:已知:总体服从正态分布,但 σ 未知,n=25 为小样本,α=0.01,t0.01/2 (25-1)=2.797。根据样本数


_

据计算得:x=16.128,s=0.871。


总体均值 μ 的 99%的置信区间为:





5.利用下面的样本数据构建总体比例 π 的置信区间。

(1)n=44,p=0.51,置信水平为 99%。

(2)n=300,p=0.82,置信水平为 95%。

(3)n=1150,p=0.48,置信水平为 90%。 解:(1)已知:n=44,p=0.51,α=0.01,z0.01/2 =2.58。总体比例 π 的 99%的置信区间为:




p ± za /2 


即(0.32,0.70)。



p(1 - p)

n




= 0.51 ± 2.58 



0.51´ (1 - 0.51)

44




= 0.51 ± 0.19


(2)已知:n=300,p=0.82,α=0.05,z0.05/2 =1.96。总体比例 π 的 95%的置信区间为:




p ± za /2 


即(0.78,0.86)。



p(1 - p)

n




= 0.82 ± 1.96 


0.82 ´ (1 - 0.82)

300




= 0.82 ± 0.04


(3)已知:n=1150,p=0.48,α=0.1,z0.1/2 =1.645。总体比例 π 的 90%的置信区间为:




p ± za /2 


即(0.46,0.50)。



p(1 - p)

n




= 0.48 ± 1.645 



0.48 ´ (1 - 0.48)

1150




= 0.48 ± 0.02




6.在一项家电市场调查中,随机抽取了 200 个居民户,调查他们是否拥有某一品牌的电视机。其中拥有该 品牌电视机的家庭占 23%。求总体比例的置信区间,置信水平分别为 90%和 95%。

解:已知:n=200,p=0.23,α 为 0.1 和 0.05 时,相应的 z0.1/2 =1.645,z0.05/2 =1.96。总体比例 π 的 90%的 置信区间为:




p ± za / 2 




即(0.18,0.28)。


p(1 - p)

n



= 0.23 ± 1.645 


= 0.23 ± 0.05


0.23 (1 - 0.23)

200


总体比例 π 的 95%的置信区间为:




p ± za /2 


p(1 - p)

n



= 0.23 ± 1.96


= 0.23 ± 0.06


0.23(1 - 0.23)

200



即(0.17,0.29)。



7.一位银行的管理人员想估计每位顾客在该银行的月平均存款额。他假设所有顾客月存款额的标准差为

1000 元,要求的估计误差在 200 元以内。置信水平为 99%,应选取多大的样本? 解:已知:σ=1000,估计误差 E=200,α=0.01,z0.01/2 =2.58。所以应抽取的样本量为:





所以应抽取 167 个样本。



8.某居民小区共有居民 500 户,小区管理者准备采用一种新的供水设施,想了解居民是否赞成。采取重复 抽样方法随机抽取了 50 户,其中有 32 户赞成,18 户反对。

(1)求总体中赞成该项改革的户数比例的置信区间(α=0.05)。

(2)如果小区管理者预计赞成的比例能达到 80%,估计误差不超过 10%。应抽取多少户进行调查(α=0.05)? 解:(1)已知:n=50,p=32/50=0.64,α=0.05,z0.05/2 =1.96。总体中赞成该项改革的户数比例的 95%的

置信区间为:




p ± za /2 





即(0.51,0.77)。


p(1 - p)

n



= 0.64 ± 1.96 


= 0.64 ± 0.13


0.64 (1 - 0.64)

50


(2)已知:π=0.80,α=0.05,z0.05/2 =1.96。应抽取的样本量为:


9.根据下面的样本结果,计算总体标准差 σ 的 90%的置信区间。


_

(1)x=21,s=2,n=50。


_

(2)x=1.3,s=0.02,n=15。


_

(3)x=167,s=31,n=22。



_

解:(1)已知:=21,s=2,n=50,α=0.1,查表得:χ20.1/2(50-1)=66.3387,χ21

总体方差 σ2 的置信区间为:


-0.1/2(50-1)=33.9303。



即 2.95≤σ2≤5.78。标准差的置信区间为:1.72≤σ≤2.40。



_

(2)已知:x=1.3,s=0.02,n=15,α=0.1,查表得:χ20.1/2(15-1)=23.6848,χ21

总体方差 σ2 的置信区间为:


标准差的置信区间为:0.015≤σ≤0.029。

(3)已知:x=167,s=31,n=22,α=0.1,查表得:χ20.1/2(22-1)=32.6706,χ2(22-1)=11.5913。

总体方差 σ2 的置信区间为:



2 2 2 2

标准差的置信区间为:24.85≤σ≤41.73。



10.顾客到银行办理业务时往往需要等待一段时间,而等待时间的长短与许多因素有关。比如,银行业务员 办理业务的速度,顾客等待排队的方式等。为此,某银行准备采取两种排队方式进行试验,第一种排队方式是: 所有顾客都进入一个等待队列;第二种排队方式是:顾客在三个业务窗口处列队三排等待。为比较哪种排队方式 使顾客等待的时间更短,银行各随机抽取 10 名顾客,他们在办理业务时所等待的时间(单位:分钟),如表 7-5 所示。

表 7-5 顾客到银行办理业务等待时间


方式 1 6.5 6.6 6.7 6.8 7.1 7.3 7.4 7.7 7.7 7.7

方式 2 4.2 5.4 5.8 6.2 6.7 7.7 7.7 8.5 9.3 10.0



要求:

(1)构建第一种排队方式等待时间标准差的 95%的置信区间。

(2)构建第二种排队方式等待时间标准差的 95%的置信区间。

(3)根据(1)和(2)的结果,你认为哪种排队方式更好? 

解:(1)已知:n=10,α=0.05,查表得 χ0.05/2 2(10-1)=19.0228,χ1

1 的样本数据计算得:s2=0.2272。总体方差 σ2 的置信区间为:








2(10-1)=2.7004。根据方式






标准差的置信区间为:0.33≤σ≤0.87。

(2)根据方式 2 的样本数据计算得:s2=3.3183。总体方差 σ2 的置信区间为:


2 2


标准差的置信区间为:1.25≤σ≤3.33。

(3)第一种排队方式更好,因为它的离散程度小于第二种排队方式。



11.从两个正态总体中分别抽取两个独立的随机样本,它们的均值和标准差如表 7-6 所示。


(1)设 n1=n2=100,求(μ1-μ2)95%的置信区间。

(2)设 n1=n2=10,σ12=σ22,求(μ1-μ2)95%的置信区间。

(3)设 n1=n2=10,σ12≠σ22,求(μ1-μ2)95%的置信区间。

(4)设 n1=10,n2=20,σ1  =σ2  ,求(μ1-μ2)95%的置信区间。

(5)设 n1=10,n2=20,σ12≠σ22,求(μ1-μ2)95%的置信区间。

解:(1)由于两个样本均为独立大样本,σ1和 σ2未知。当 α=0.05 时,z0.05/2=1.96,则 μ1-μ2 的 95%的置信区间为:



即(0.824,3.176)

(2)由于两个样本均为来自正态总体的独立小样本,当 σ12 和 σ22 未知但 σ1  =σ2   时,需要用两个样本的方

差 s12 和 s22 和来估计。总体方差的合并估计量 sp2 为:




当 α=0.05 时,t0.05/2(10+10-2)=2.101,则 μ1-μ2 的 95%的置信区间为:





即(-1.986,5.986)。


(3)由于两个样本均为来自正态总体的独立小样本,σ12 和 σ22 未知且 σ12≠σ2  ,n1=n2=n。当 α=0.05 时,

t0.05/2(10+10-2)=2.101,则 μ1-μ2 的 95%的置信区间为:



2 2


即(-1.986,5.986)。


(4)由于两个样本均为来自正态总体的独立小样本,σ12 和 σ22 未知但 σ12=σ22,n1≠n2。需要用两个样本的 方差 s12 和 s22 来估计。总体方差的合并估计量 sp2 为:




当 α=0.05 时,t0.05/2(10+20-2)=2.048。因此,μ1-μ2 的 95%的置信区间为:






即(-1.431,5.431)。

 


(5)由于两个样本均为来自正态总体的独立小样本,σ12 和 σ22 未知且 σ12≠σ22,n1≠n2。因此,μ1-μ2 的 95%

的置信区间为:


自由度的计算如下:



当 α=0.05 时,t0.05/2(20)=2.086。μ1-μ2 的 95%的置信区间为:



即(—1.364,5.364)。



12.表 7-7 是由 4 对观察值组成的随机样本。



表 7-7



配对号 来自总体 A 的样本 来自总体 B 的样本

1

2

3

4 2

5

10

8 0

7

6

5


_

(1)计算 A 与 B 各对观察值之差,再利用得出的差值计算d和 sd。


(2)设 μ1 和 μ2 分别为总体 A 和总体 B 的均值,构造 μd=μ1-μ2 的 95%的置信区间。 解:(1)计算过程如表 7-8 所示。








13.一家人才测评机构对随机抽取的 10 名小企业的经理人用两种方法进行自信心测试,得到的自信心测试 分数如表 7-9 所示。


表 7-9 10 名小企业的经理人自信心测试分数数据


人员编号 方法 1 方法 2

1

2

3

4

5

6

7

8

9

10 78

63

72

89

91

49

68

76

85

55 71

44

61

84

74

51

55

60

77

39


要求:构建两种方法平均自信心得分之差 μd=μ1-μ2 的 95%的置信区间。


_

解:根据样本数据计算得:d=[(78-71)+(63-44)+„+(55-39)]/10=110/10=11

14.从两个总体中各抽取一个 n1=n2=250 的独立随机样本,来自总体 1 的样本比例为 p1=40%,来自总体

2 的样本比例为 p2=30%。要求:

(1)构造 π1-π2 的 90%的置信区间。

(2)构造 π1-π2 的 95%的置信区间。 






15.生产工序的方差是工序质量的一个重要度量。当方差较大时,需要对工序进行改进以减小方差。表 7-10

是两部机器生产的袋茶重量(单位:g)的数据。

表 7-10 两部机器生产的袋茶重量的数据


机器 1 机器 2

3.45 3.22 3.90 3.22 3.28 3.35

3.20 2.98 3.70 3.38 3.19 3.30

3.22 3.75 3.28 3.30 3.20 3.05

3.50 3.38 3.35 3.30 3.29 3.33

2.95 3.45 3.20 3.34 3.35 3.27

3.16 3.48 3.12 3.28 3.16 3.28

3.20 3.18 3.25 3.30 3.34 3.25

要求:构造两个总体方差比(σ12/σ22)95%的置信区间。 

解:根据样本数据计算得:s12=0.058375,s22=0.005846。当 α=0.05 时,由 Exce1 的“FINV”函数计算得:

2 2

F0.025(21-1,21-1)=2.46,F1-α/2(n1-1,n2-1)=F0.975(21-1,21-1)=0.41。两个总体方差比 σ1  /σ2

的 95%的置信区间为:






2


即两个总体方差比 σ12/σ22 的 95%的置信区间为:4.06≤σ12/σ2  ≤24.35。



16.根据以往的生产数据,某种产品的废品率为 2%。如果置信区间为 95%,估计误差不超过 4%,应抽取 多少样本?

解:已知:π=2%,E=4%,当 α=0.05 时,z0.05/2=1.96。应抽取的样本量为:



故应至少抽取样本量为 48 的样本。