统计 · 数据分析
平均数、中位数和众数
上一节我们说:要描述一组数据的"中心"在哪,得看集中趋势。这一节,我们就来认识集中趋势的三位主角:平均数、中位数、众数。
先猜:你们班数学平均分 ,是不是说明"大家都在 分上下"?不一定。可能一半人 、一半人 ,平均也正好是 。
"平均水平"这个词,藏着至少三种不同的算法。这一节我们把它们一次认清。
它们都能代表"一般水平",但性格很不一样。学会区别它们,你就不会再被一个孤零零的平均数骗到了。
老大:平均数
这是你最熟的老朋友。把所有数加起来,再除以个数。
一组数据的平均数,等于所有数据之和除以数据的个数。 如果数据是 ,共 个,平均数记作 :
小明五次数学测验成绩:。 所以他的平均成绩是 分。
平均数的脾气:特别在意每一个数,尤其是极端值(特别大或特别小的数)。 一个超级高分或超级低分,就能把它拉高或拉低。
老二:中位数
把数据按从小到大排好队,排在正中间的那个数,就是中位数。
把一组数据按从小到大(或从大到小)排列后,处在最中间位置的数,叫做中位数。
- 如果数据个数是奇数,正中间那一个就是中位数;
- 如果数据个数是偶数,取最中间两个数的平均数作为中位数。
七个人的身高(厘米):。 排好队后,正中间是第 个:。所以中位数是 厘米。
六个同学的零花钱(元):。 中间两个是第 、第 个: 和 。 中位数 (元)。
中位数的脾气:不太怕极端值。 哪怕班里突然来一个身高 厘米的巨人,中位数也基本不动,因为它只看"排队排中间的是谁"。
老三:众数
出现次数最多的那个数,就是众数。
一组数据中,出现次数最多的数据,叫做这组数据的众数。
鞋店一天卖出的鞋码:。 出现了 次,最多,所以众数是 码——老板该多进 码的鞋。
再看一组数:,每个都只出现一次,没有"最多"的,所以这组数据没有众数。
特别注意:众数不一定在中央,它只是"最常出现"的那个。而且一组数可以有多个众数(几个数出现次数一样多且都最多),也可以没有众数。
三兄弟,什么时候用谁?
这是最容易考、也最实用的地方。看一张对比表:
| 代表量 | 优点 | 缺点 | 适合场景 |
|---|---|---|---|
| 平均数 | 用到了所有数据 | 容易被极端值带偏 | 数据较均匀、无离谱极端值时 |
| 中位数 | 不受极端值影响 | 没用到全部数据 | 数据中有特别大/特别小的离群值时 |
| 众数 | 反映"最常见" | 可能不止一个或没有 | 关心"哪种最多"(如畅销尺码) |
某公司 个员工的年工资(万元):。
- 平均数 万
- 中位数 万
- 众数 万
老板若想显得"待遇好",会拿平均数 万说事;但大多数员工其实只拿 万左右。这里用中位数或众数,才更接近普通员工的真实感受。
所以看新闻、看广告里的"平均"时,多留个心眼:那个平均数,有没有被一两个极端值悄悄抬高或压低?
跳水、体操打分,常会"去掉一个最高分、一个最低分,再平均"。这其实是在削弱极端值的影响——和用中位数抗干扰是一个思路。裁判怕个别评委打分太离谱,把平均数带偏,所以先砍掉最怪的两个。
一个值得注意的细节
平均数、中位数、众数,不一定相等,也完全可能三个都不同。它们只是从三个不同角度描述"中心":
- 平均数:算出来的"重心";
- 中位数:排队排出来的"中间";
- 众数:数出来的"最常"。
一句话记忆:平均看总和,中位看位置,众数看次数。
三者可能都不在"正中间"
注意,平均数、中位数、众数,三个数不一定重合,甚至可能三个都不一样。
某次小测 人得分:。
- 平均数 ;
- 中位数:排好队第 个是 ;
- 众数:每个数都只出现一次,没有众数。 三个代表量,给出了三种不同的"中心"感觉。
所以新闻里说"收入中位数""房价中位数"时,别自动当成"平均数"去理解。政府和大机构常爱报中位数,正是因为中位数不容易被少数富豪"拉高",更能反映普通人的处境。
一句话收尾:平均数看总和,中位数看排队位置,众数看出现次数。 三个角度,三种真相,缺一都可能被骗。
回过头看
这节课我们认识了集中趋势的三兄弟:
- 平均数:加起来除以个数,最全面但怕极端值;
- 中位数:排队取中间,抗干扰、不怕 outlier;
- 众数:出现最多者,反映"最常见"。
它们没有谁绝对更好,关键看你想回答什么问题。下一节我们会转向另一个角度——数据不止有"中心",还有"散得开不开",也就是数据的波动。
本节课你应该能回答的问题
- 平均数、中位数、众数分别怎么求?各用一句话概括计算方法。
- 为什么"员工平均工资"有时会被老板拿来误导人?中位数在这里为什么更实在?
- 一组数据可以有几个众数?可以"没有众数"吗?举例子说明。
- 偶数个数据时,中位数该怎么取?为什么不是随便挑一个中间的数?