统计 · 数据分析

平均数、中位数和众数

上一节我们说:要描述一组数据的"中心"在哪,得看集中趋势。这一节,我们就来认识集中趋势的三位主角:平均数、中位数、众数

先猜:你们班数学平均分 8080,是不是说明"大家都在 8080 分上下"?不一定。可能一半人 6060、一半人 100100,平均也正好是 8080

"平均水平"这个词,藏着至少三种不同的算法。这一节我们把它们一次认清。

它们都能代表"一般水平",但性格很不一样。学会区别它们,你就不会再被一个孤零零的平均数骗到了。

老大:平均数

这是你最熟的老朋友。把所有数加起来,再除以个数。

平均数

一组数据的平均数,等于所有数据之和除以数据的个数。 如果数据是 x1,x2,,xnx_1, x_2, \ldots, x_n,共 nn 个,平均数记作 xˉ\bar{x}xˉ=x1+x2++xnn\bar{x} = \frac{x_1 + x_2 + \cdots + x_n}{n}

算一个平均数

小明五次数学测验成绩:82,90,76,88,9482, 90, 76, 88, 94xˉ=82+90+76+88+945=4305=86\bar{x} = \frac{82+90+76+88+94}{5} = \frac{430}{5} = 86 所以他的平均成绩是 8686 分。

平均数的脾气:特别在意每一个数,尤其是极端值(特别大或特别小的数)。 一个超级高分或超级低分,就能把它拉高或拉低。

老二:中位数

把数据按从小到大排好队,排在正中间的那个数,就是中位数。

中位数

把一组数据按从小到大(或从大到小)排列后,处在最中间位置的数,叫做中位数

  • 如果数据个数是奇数,正中间那一个就是中位数;
  • 如果数据个数是偶数,取最中间两个数的平均数作为中位数。
奇数个:直接取中间

七个人的身高(厘米):150,152,155,158,160,162,165150, 152, 155, 158, 160, 162, 165。 排好队后,正中间是第 44 个:158158。所以中位数是 158158 厘米。

偶数个:取中间两个的平均

六个同学的零花钱(元):5,8,10,12,15,205, 8, 10, 12, 15, 20。 中间两个是第 33、第 44 个:10101212。 中位数 =10+122=11= \frac{10+12}{2} = 11(元)。

中位数的脾气:不太怕极端值。 哪怕班里突然来一个身高 200200 厘米的巨人,中位数也基本不动,因为它只看"排队排中间的是谁"。

老三:众数

出现次数最多的那个数,就是众数。

众数

一组数据中,出现次数最多的数据,叫做这组数据的众数

众数可能不止一个,也可能没有

鞋店一天卖出的鞋码:35,36,36,37,37,37,38,3935, 36, 36, 37, 37, 37, 38, 393737 出现了 33 次,最多,所以众数是 3737 码——老板该多进 3737 码的鞋。

再看一组数:1,2,3,41, 2, 3, 4,每个都只出现一次,没有"最多"的,所以这组数据没有众数

特别注意:众数不一定在中央,它只是"最常出现"的那个。而且一组数可以有多个众数(几个数出现次数一样多且都最多),也可以没有众数。

三兄弟,什么时候用谁?

这是最容易考、也最实用的地方。看一张对比表:

代表量优点缺点适合场景
平均数用到了所有数据容易被极端值带偏数据较均匀、无离谱极端值时
中位数不受极端值影响没用到全部数据数据中有特别大/特别小的离群值时
众数反映"最常见"可能不止一个或没有关心"哪种最多"(如畅销尺码)
选错代表量会误导人

某公司 55 个员工的年工资(万元):8,9,9,10,608, 9, 9, 10, 60

  • 平均数 =8+9+9+10+605=19.2= \frac{8+9+9+10+60}{5} = 19.2
  • 中位数 =9= 9
  • 众数 =9= 9

老板若想显得"待遇好",会拿平均数 19.219.2 万说事;但大多数员工其实只拿 99 万左右。这里用中位数或众数,才更接近普通员工的真实感受。

所以看新闻、看广告里的"平均"时,多留个心眼:那个平均数,有没有被一两个极端值悄悄抬高或压低?

跳水比赛为什么去掉最高最低分

跳水、体操打分,常会"去掉一个最高分、一个最低分,再平均"。这其实是在削弱极端值的影响——和用中位数抗干扰是一个思路。裁判怕个别评委打分太离谱,把平均数带偏,所以先砍掉最怪的两个。

一个值得注意的细节

平均数、中位数、众数,不一定相等,也完全可能三个都不同。它们只是从三个不同角度描述"中心":

  • 平均数:算出来的"重心";
  • 中位数:排队排出来的"中间";
  • 众数:数出来的"最常"。

一句话记忆:平均看总和,中位看位置,众数看次数。

三者可能都不在"正中间"

注意,平均数、中位数、众数,三个数不一定重合,甚至可能三个都不一样。

三者各不同

某次小测 77 人得分:0,20,60,70,80,90,1000, 20, 60, 70, 80, 90, 100

  • 平均数 =0+20+60+70+80+90+1007=4207=60= \frac{0+20+60+70+80+90+100}{7} = \frac{420}{7} = 60
  • 中位数:排好队第 44 个是 7070
  • 众数:每个数都只出现一次,没有众数。 三个代表量,给出了三种不同的"中心"感觉。

所以新闻里说"收入中位数""房价中位数"时,别自动当成"平均数"去理解。政府和大机构常爱报中位数,正是因为中位数不容易被少数富豪"拉高",更能反映普通人的处境。

一句话收尾:平均数看总和,中位数看排队位置,众数看出现次数。 三个角度,三种真相,缺一都可能被骗。

回过头看

这节课我们认识了集中趋势的三兄弟:

  • 平均数:加起来除以个数,最全面但怕极端值;
  • 中位数:排队取中间,抗干扰、不怕 outlier;
  • 众数:出现最多者,反映"最常见"。

它们没有谁绝对更好,关键看你想回答什么问题。下一节我们会转向另一个角度——数据不止有"中心",还有"散得开不开",也就是数据的波动

信息

本节课你应该能回答的问题

  1. 平均数、中位数、众数分别怎么求?各用一句话概括计算方法。
  2. 为什么"员工平均工资"有时会被老板拿来误导人?中位数在这里为什么更实在?
  3. 一组数据可以有几个众数?可以"没有众数"吗?举例子说明。
  4. 偶数个数据时,中位数该怎么取?为什么不是随便挑一个中间的数?