-
1 一、集中趋势的度量
-
2 二、离散程度的度量
-
3 三、偏态与峰态的度量
-
4 PPT
一、集中趋势的度量
集中趋势是指一组数据向某一中心值靠拢的程度,它反映了一组数据中心点的位置所在。
1.分类数据:众数
(1)概念
众数是一组数据中出现次数最多的变量值,用 Mo 表示。
(2)众数的适用范围 众数主要用于测度分类数据的集中趋势,也适用于顺序数据以及数值型数据集中趋势的测度。一般只有在数据量较大的情况下,众数才有意义。
(3)众数的特点 众数是一个位置代表值,它不受数据中极端值的影响。从分布的角度看,众数是具有明显集中趋势点的数值,

一组数据分布的最高峰点所对应的数值即为众数。如果数据的分布没有明显的集中趋势或最高峰点,众数可能不 存在;如果有两个或多个最高峰点,则可以有两个或多个众数。众数如图 4-1 所示。

图 4-1众数示意图
2.顺序数据:中位数和分位数
(1)中位数
①概念
中位数是一组数据排序后处于中间位置上的变量值,用 Me 表示。 中位数将全部数据等分成两部分,每部分包含 50%的数据,一部分数据比中位数大,另一部分则比中位数小。用中位数来代表总体标志值的一般水平,可以避免数列中极端值的影响,对某些社会经济现象更具有代表性。
②中位数的适用范围 中位数主要用于测度顺序数据的集中趋势,也适用于测度数值型数据的集中趋势,但不适用于分类数据。
③中位数的确定 根据未分组数据计算中位数时,要先对数据进行排序,然后确定中位数的位置,最后确定中位数的具体数值。
中位数位置的确定公式(n 为数据个数):
中位数位置=(n+1)/2
设一组数据为 x1,x2,„,xn,从小到大的顺序排序后为 x(1),x(2),„,x(n),则中位数为:
④中位数的特点
中位数是一个位置代表值,其特点是不受极端值的影响。
(2)四分位数
①概念
四分位数、十分位数和百分位数分别是用 3 个点、9 个点和 99 个点将数据 4 等分、10 等分和 100 等分后各 分位点上的值。
四分位数也称四分位点,它是一组数据排序后处于 25%和75%位置上的值。通常所说的四分位数是指处在25%位置上的数值(称为下四分位数)和处在 75%位置上的数值(称为上四分位数)。
②四分位数的计算 根据未分组数据计算四分位数时,首先对数据进行排序,然后确定四分位数所在的位置,该位置上的数值就是四分位数。
在总体所有 N 个单位的标志值都已经按大小顺序排列的情况下,设下四分位数为 QL,上四分位数为 QU,根 据四分位数的定义有:
QL 位置=(n+1)/4
QU 位置=3(n+1)/4
注意:如果位置是整数,四分位数就是该位置对应的值;如果是在 0.5 的位置上,则取该位置两侧值的平均 数;如果是在 0.25 或 0.75 的位置上,则四分位数等于该位置的下侧值加上按比例分摊位置两侧数值的差值。
3.数值型数据:平均数
平均数也称为均值,它是一组数据相加后除以数据的个数得到的结果。平均数在统计学中具有重要的地位,是集中趋势的最主要测度值,它主要适用于数值型数据,而不适用于分类数据和顺序数据。
(1)简单平均数与加权平均数
①简单平均数:根据未分组数据计算的平均数,用总体各单位标志值简单加总得到的标志总量除以单位总量而得。设一组样本数据为 x1,x2,„,xn,样本量(样本数据的个数)为 n,则简单样本平均数记为x,计算公式为:

②加权平均数:根据分组数据计算的平均数。
设原始数据被分成 k 组,各组的组中值分别用 M1,M2,„,Mk 表示,各组变量值出现的频数分别用 f1,f2,„,fk 表示,则样本加权平均数的计算公式为:
(2)一种特殊的平均数:几何平均数
①计算公式
几何平均数是 n 个变量值乘积的 n 次方根,用 G 表示。计算公式为:
=
②适用范围
几何平均数主要用于计算比率的平均。当变量值是比率的形式时,采用几何平均法计算平均比率更为合理。 在实际应用中,几何平均数主要用于计算现象的平均增长率。
4.众数、中位数和平均数的比较
众数、中位数和平均数是集中趋势的三个主要测度值,彼此间存在着一定的数量关系。
(1)众数、中位数和平均数的关系
![]()
![]()
![]()
![]()
![]()
![]()
表 4-1众数、中位数和平均数的关系
测度值 | 分布角度 | 对称分布 | 左偏分布 | 右偏分布 |
众数 (Mo) |
一组数据分布最高峰 |
众数、中位数和平 均数必定相等,
_ 即 Mo=Me=x, 如图 4-2(a) | 存在极小值,拉动平 均数向极小值一方 靠,众数和中位数不
_ 受极值的影响,即x
<Me<Mo, 如图 4-2(b) |
存在极大值,拉动 平均数向极大值一 方靠,即 Mo<Me
_ <x,如图 4-2(c) |
中位数 (Me) |
一组排序数据中间位置的值 | |||
平均数
_ (x) |
全部数据的算术平均 |
图 4-2不同分布的众数、中位数和平均数
在非对称正态分布的情况下,众数、中位数和平均数三者的差别取决于偏斜的程度,偏斜的程度越大,它们 之间的差别越大;偏斜的程度越小,它们之间的差别越小。但不论如何偏斜,中位数总是在众数与算术平均数之 间。经验表明,在适度偏斜的情况下,众数与中位数的距离约为中位数与算术平均数距离的 2 倍。即:
2(x-Me)=Me-Mo 或 2(Me-x)=Mo-Me
(2)众数、中位数和平均数的特点与应用场合
①众数是一组数据分布的峰值,不受极端值的影响。其缺点是具有不唯一性,一组数据可能有一个众数,也 可能有两个或多个众数,也可能没有众数。
众数只有在数据量较多时才有意义,当数据量较少时,不宜使用众数。众数主要适合作为分类数据的集中趋 势测度值。
②中位数是一组数据中间位置上的代表值,不受数据极端值的影响。 中位数主要适合作为顺序数据的集中趋势测度值。
③平均数是对数值型数据计算的,而且利用了全部数据信息,它是实际中应用最广泛的集中趋势测度值。 当数据呈对称分布或接近对称分布时,3 个代表值相等或接近相等,这时则应选择平均数作为集中趋势的代表值。但平均数的主要缺点是易受数据极端值的影响,对于偏态分布的数据,平均数的代表性较差。因此,当数据为偏态分布,特别是当偏斜程度较大时,可以考虑选择众数或中位数。











