三、数值型数据的整理与展示
1.数据分组
(1)数据分组的概念和目的 数据分组是根据统计研究的需要,为了观察数据的分布特征,将原始数据按照某种标准划分成不同的组别,
分组后的数据称为分组数据。经分组后再计算出各组中数据出现的频数,就形成了一张频数分布表。在分组时, 如果按照性别、质量等级等定性指标分组,称为按品质标志分组;如果按照数量或数值等定量指标分组,称为按 数量标志分组。
(2)数据分组的方法
①单变量值分组:把每一个变量值作为一组,这种分组通常只适合离散变量,且在变量值较少的情况下使用;
②组距分组:将全部变量值依次划分为若干个区间,并将这一区间的变量值作为一组。在组距分组中,一个组的最小值称为下限;一个组的最大值称为上限。适用于连续变量或变量值较多的情况。
(3)分组和编制频数分布表的具体步骤
①确定组数
一般情况下,一组数据所分的组数不应少于 5 组且不多于 15 组,即 5≤K≤15。实际应用时,可根据数据的 多少和特点及分析的要求来确定组数。
②确定各组的组距
组距是一个组的上限与下限的差。组距可根据全部数据的最大值和最小值及所分的组数来确定,即组距=(最大值-最小值)÷组数。
注意:为便于计算,组距宜取 5 或 10 的倍数,而且第一组的下限应低于最小变量值,最后一组的上限应高 于最大变量值。
③根据分组整理成频数分布表
(4)组距分组的注意事项
①遵循“不重不漏”的原则
“不重”就是任一个单位数值只能分在其中某一组中,不能同时分在两组中;“不漏”就是任一数值必须分在某一组内,不能遗漏。 为解决“不重”的问题,统计分组时习惯上规定“上组限不在内”,即当相邻两组的上下限重叠时,恰好等于某一组上限的变量值不算在本组内,而计算在下一组内。
a.对于离散变量,可以采用相邻两组组限间断的办法解决“不重”的问题;
b.对于连续变量,可以采取相邻两组组限重叠的方法,根据“上组限不在内”的规定解决“不重”的问题, 也可以对一个组的上限值采用小数点的形式,小数点的位数根据所要求的精度具体确定。
②避免出现空白组(即没有变量值的组)或个别极端值被漏掉
在组距分组中,如果全部数据中的最大值和最小值与其他数据相差悬殊,为避免出现空白组(即没有变量值的组)或个别极端值被漏掉,第一组和最后一组可以采取“××以下”及“××以上”这样的开口组。开口组通常以相邻组的组距作为其组距。
(5)等距分组、不等距分组 在组距分组时,如果各组的组距相等,则称为等距分组;如果各组的组距不相等,则称为不等距分组。
(6)组中值 组中值是每一组中下限值与上限值中间的值,即
组中值=(下限值+上限值)/2
在组距分组时,通常用组中值作为该组数据的一个代表值。使用组中值代表一组数据时有一个必要的假定条件,即各组数据在本组内呈均匀分布或在组中值两侧呈对称分布。
2.数值型数据的图示
条形图、饼图、环形图及累积分布图等都适用于显示数值型数据。此外,对数值型数据还有一些图示方法,
这些方法并不适用于分类数据和顺序数据。
(1)分组数据:直方图
①直方图:展示分组数据分布的一种图形,它是用矩形的宽度和高度(即面积)来表示频数分布的。绘制该 图时,用横轴表示各组组限,纵轴表示频数(一般标在左方)或频率(一般标在右方)。
②直方图与条形图的区别
表 3-1直方图与条形图的区别
图形 | 频数表示 | 排列方式 | 数据类型 |
条形图 | ①条形的长度表示频数,宽度固定 ②长度有意义,高度没有意义 | 各矩形分开排列 | 分类数据 |
直方图 | ①矩形面积表示频数,矩形高度表示 频数或组距,宽度表示组限 ②高度与宽度均有意义 | 各矩形连续排列 | 数值型数据 |
(2)未分组数据:茎叶图和箱线图
①茎叶图
a.茎叶图 茎叶图是反映原始数据分布的图形。它由茎和叶两部分构成,其图形是由数字组成的。它主要用于反映原始
数据的分布形状及离散状况,比如,分布是否对称,数据是否集中,是否有离群点等。
b.茎叶图的绘制方法 绘制茎叶图的关键是设计好树茎。制作茎叶图时,首先把一个数字分成两部分,通常是以该组数据的高位数
值作为树茎,而且叶上只保留该数值的最后一个数字。 c.茎叶图与直方图的区别 茎叶图类似于横置的直方图,与直方图相比,茎叶图既能给出数据的分布状况,又能给出每一个原始数值,
即保留了原始数据的信息;而直方图虽然能很好地显示数据的分布,但不能保留原始的数值。在应用方面,直方 图通常适用于大批量数据,茎叶图通常适用于小批量数据。
②箱线图
a.箱线图
由一组数据的最大值、最小值、中位数、两个四分位数这五个特征值绘制而成,反映原始数据分布。通过箱 线图,不仅可以反映出一组数据分布的特征,还可以进行多组数据分布特征的比较。
b.箱线图的绘制方法
先找出一组数据的最大值、最小值、中位数和两个四分位数(中位数 Me 是一组数据排序后处于中间位置上 的变量值,四分位数是处在数据 25%位置和 75%位置上的两个值,分别称为下四分位数 QL 和上四分位数 Q U ); 然后,连接两个四分位数画出箱子;再将最两个极值点与箱子相连接,中位数在箱子中间。
(3)时间序列数据:线图 如果数值型数据是在不同时间上取得的,即时间序列数据,则可以绘制线图。线图主要用于反映现象随时间变化的特征。
注意:绘制线图时,时间一般绘在横轴,观测值绘在纵轴。一般应绘成横轴略大于纵轴的长方形,其长宽比例大致为 10:7。图形过扁或过于瘦高,不仅不美观,而且会给人造成视觉上的错觉,不便于对数据变化的理解。 一般情况下,纵轴数据下端应从“0”开始,以便于比较。数据与“0”之间的间距过大,可以采取折断的符号将纵轴折断。
(4)多变量数据的图示
①散点图
是指用二维坐标展示两个变量之间关系的一种图形。它是用坐标横轴代表变量 x,纵轴代表变量 y,每组数 据(xi,yi)在坐标系中用一个点表示,n 组数据在坐标系中形成的 n 个点称为散点,由坐标及其散点形成的二 维数据图称为散点图。
②气泡图 可用于展示三个变量之间的关系。绘制时将一个变量放在横轴,另一个变量放在纵轴,而第三个变量则用气
泡的大小来表示。
③雷达图 是指显示多个变量的常用图示方法,也称为蜘蛛图。雷达图在显示或对比各变量的数值总和时十分有用,假
定各变量的取值具有相同的正负号,则总的绝对值与图形所围成的区域成正比。此外,利用雷达图也可以研究多 个样本之间的相似程度。
图 3-1 总结了数据类型与主要的图示方法。

图 3-1数据类型与主要的图示方法