统计 · 数据分析

怎样用一个数描述一组数据?

上一章我们学会了:数据要收集、要整理,还要画成表或图,让人一眼看懂。

可是你有没有遇到过这种时候——图表是看懂了,但别人只给你一句话,比如:

"甲厂和乙厂生产的灯泡,平均寿命都是 10001000 小时。" "上周平均气温是 25C25^\circ\text{C}。"

一个孤零零的数字,就把一整组数据"代表"了。这到底行不行得通?一个数为什么能代表一堆数?这一节,我们先把这个问题想清楚。

先想一个你肯定碰过的情况:考试成绩发下来,老师说"咱们班平均 8585 分"。你立马在心里把自己和 8585 比——可你有没有想过:这一个 8585,真的能代表全班 4040 个人吗?万一班里有人考了 2020 分、有人考了 100100 分呢?

"用一个数字代表一组数据",听起来省事,其实藏着不少门道。这就是本节课要聊的。

一个让人纠结的对比

假设两个射击队员,各打 55 发子弹,成绩(环数)如下:

甲:8, 9, 9, 10, 9
乙:6, 10, 10, 8, 11

如果只说"谁更厉害",你可能有点拿不准。两个人都有 1010 环的好成绩,也都有不太好的那一发。

这时候,我们本能地会想:能不能用一个数,把每个人这 55 发的整体水平"压"出来?

比如,先求个平均:

8+9+9+10+95=455=9\frac{8+9+9+10+9}{5} = \frac{45}{5} = 9

6+10+10+8+115=455=9\frac{6+10+10+8+11}{5} = \frac{45}{5} = 9

咦?两个人平均数都是 99 环。那是不是说他俩水平一样?

不一定。 平均数一样,只说明"总环数一样",可没说"打得稳不稳"。

你看甲的成绩:都在 881010 之间,很集中;乙的成绩:从 661111,忽高忽低,明显更"飘"。所以虽然平均数相同,甲的发挥其实更稳、更可靠。

这就暴露了一件事:要真正描述一组数据,往往不止需要一个数。 我们至少要看两方面。

两组"代表性数字"

我们刚才其实碰到了数据最重要的两类特征:

集中趋势

集中趋势说的是:这一组数据,大致集中在哪个数附近?也就是数据的"中心"在哪里。

离散程度(波动大小)

离散程度说的是:这一组数据,是紧紧挤在中心附近,还是撒得很开?也就是数据的"波动"有多大。

用大白话说:

  • 想知道"整体水平大概多少",看集中趋势(比如平均数)。
  • 想知道"稳不稳、齐不齐",看离散程度(比如波动大小)。

一个好用的比方:两个班级平均成绩都是 8080 分。

  • 集中趋势相同:整体水平一样。
  • 但 A 班人人都在 758575\sim85 之间,B 班有人 4040 分、有人 100100 分——离散程度差别很大。

为什么"一个数"既厉害又有限

用一个数字代表一组数据,好处很明显:

  • 方便比较。不用对着一长串数字发呆,"平均数 99 环"一句话就懂。
  • 方便记忆。一堆数记不住,一个总结性的数好记。

但它的代价也明显:

平均数藏住了什么

三个家庭的年收入(单位:万元):

  • 张家:10,10,10,10,1010, 10, 10, 10, 10 → 平均 1010
  • 李家:8,9,10,11,128, 9, 10, 11, 12 → 平均 1010
  • 王家:1,1,2,3,431, 1, 2, 3, 43 → 平均 1010

三家平均数都是 1010 万,但生活天差地别:张家人人都小康,王家有一个超高收入者把平均"拉"上去了,大多数人其实很穷。 一个数把细节压平了,有些真相就看不见了。

所以"用一个数描述一组数"不是万能的,它只是给我们一个快捷的入口。要看仔细,还得配合其他数字,甚至回头看原始的图表。

接下来我们要拆开学的两件事

这节课是个"总纲"。我们已经看清:描述一组数据,主要看两条线——

  1. 集中趋势:用什么数代表"中心"?最常见的是平均数、中位数、众数。这三兄弟,我们在平均数、中位数和众数里细讲。
  2. 离散程度:数据波动大不大?用极差、方差这些数来衡量。这部分留在数据的波动里讲。

记住这个框架:先看中心在哪,再看散得开不开。 两个数合起来,才比单独一个平均数靠谱。

一个生活里的类比

集中趋势和离散程度这对组合,特别像"平均水平和稳定性":

  • 两家外卖店,平均送达时间都是 3030 分钟(集中趋势相同)。
  • 但 A 店每次都在 283228\sim32 分钟,B 店有时 1010 分钟、有时 5555 分钟(离散程度差很多)。
  • 你点外卖赶时间,会选哪家?多半选 A——因为稳定比"平均快"更让人安心。

这就说明:只看平均数(集中趋势)会漏掉"稳不稳"(离散程度)。两个数配合看,才算看全。

两个班的平均分陷阱

一班:82,83,84,85,8682, 83, 84, 85, 86 → 平均 8484,很整齐。 二班:60,70,84,98,10060, 70, 84, 98, 100 → 平均也是 8484,但两头拉得很开。 如果只看"平均 8484 分",会以为两班一样;看了分布才知道,一班是"大家都中等",二班是"有人吊车尾、有人拔尖"。

为什么这一章要分三节课

你可能会问:用一个数字描述一组数,为什么值得单独开一章、还拆成三节?

因为"用一个数字代表一堆数字"是统计里最核心、也最容易被误用的技巧。用得好,它能帮我们快速比较;用不好(比如只看平均数、被极端值骗),它会悄悄误导我们。所以我们要:

  • 先建立"要看中心和波动两方面"的意识(本节课);
  • 再学中心怎么算:平均数、中位数、众数(下一节);
  • 再学波动怎么量:极差、方差(下下节)。

顺便说:这一节课你不用背公式,重点是建立框架——以后无论碰到什么数据,先问两句:"它的中心大概在哪?它散得开不开?"问完这两句,你就已经超过很多只会甩平均数的人了。

回过头看

这节课我们想通了一件重要的事:

  • 一个代表数字(比如平均数)很有用,能帮我们快速比较和记忆;
  • 但它会"压平"细节,所以要看集中趋势离散程度两个方面;
  • 平均数相同,不代表两组数据一模一样——还得看波动。

带着这个思路,下一节我们就正式认识集中趋势的"三兄弟":平均数、中位数、众数。

信息

本节课你应该能回答的问题

  1. 为什么"平均数相同"还不能说两组数据一样?结合甲乙射击的例子说明。
  2. 什么是集中趋势?什么是离散程度?各用一句大白话解释。
  3. 用一个数字代表一组数据,有什么好处,又有什么代价?
  4. 描述一组数据,为什么常常需要"至少两个数"(一个看中心、一个看波动)?