四分位数と箱ひげ図

同義語:quartiles and box plots

概要

四分位数と箱ひげ図は、データを小さい順に並べて 4 つに分ける 3 つの値 $Q_1,Q_2,Q_3$($Q_2$ は中央値、$Q_1,Q_3$ は下半分・上半分の中央値)と、最小値・$Q_1$・$Q_2$・$Q_3$・最大値の五数要約を描いた図である。四分位範囲 $Q_3-Q_1$ の 1.5 倍より外の値を外れ値とする基準がよく使われる。データが 6 個以上なら、1 つの値をどんな実数に取り替えても四分位数はもとのデータで決まる範囲に収まるが、平均値はいくらでも動く。四分位数の定め方はソフトによって異なり、五数要約が同じでも分布は同じとは限らない。四分位数は、傾きを変えた絶対値の和を最小にする値(分位点)とも見られる。

$$\newcommand{C}[0]{\mathbb{C}} \newcommand{N}[0]{\mathbb{N}} \newcommand{Q}[0]{\mathbb{Q}} \newcommand{R}[0]{\mathbb{R}} \newcommand{Z}[0]{\mathbb{Z}} $$

前提知識: 平均・中央値・分散

高校での出発点:データを 4 つに分ける

データを小さい順に並べ、真ん中で 2 つに分けたところが 中央値 である。前半と後半をさらにそれぞれ真ん中で分けると、データはおよそ 4 等分される。この 3 つの区切りの値を 四分位数 といい、小さい順に第 1 四分位数 $Q_1$、第 2 四分位数 $Q_2$(中央値)、第 3 四分位数 $Q_3$ と書く。平均値・中央値・分散の定義は 平均・中央値・分散 で扱った。この記事では、四分位数とそれを絵にした 箱ひげ図 を調べる。まず教科書の方式で 2 つのデータの四分位数を求めてみる。

11 個のデータの四分位数

11 人の小テスト(15 点満点)の得点が、小さい順に
$$ 3,\ 5,\ 6,\ 7,\ 8,\ 8,\ 9,\ 10,\ 12,\ 13,\ 15 $$
であったとする。

  • 中央値:11 個の真ん中は 6 番目なので、$Q_2=8$ である。
  • 下半分:中央値(6 番目)を除いた前半は 1〜5 番目の $3,5,6,7,8$ である。その真ん中(3 番目)は $6$ なので、$Q_1=6$ である。
  • 上半分:後半は 7〜11 番目の $9,10,12,13,15$ である。その真ん中は $12$ なので、$Q_3=12$ である。
    四分位範囲は $Q_3-Q_1=12-6=6$ である。最小値 $3$、最大値 $15$ と合わせた 5 つの数 $3,6,8,12,15$ を、このデータの 五数要約 という。
12 個のデータの四分位数と外れ値

12 個のデータ
$$ 2,\ 4,\ 4,\ 5,\ 6,\ 7,\ 8,\ 9,\ 10,\ 11,\ 13,\ 20 $$
では、個数が偶数なので中央値は 6 番目と 7 番目の平均で、$Q_2=\dfrac{7+8}2=7.5$ である。

  • 下半分は 1〜6 番目の $2,4,4,5,6,7$ で、その中央値は 3 番目と 4 番目の平均 $\dfrac{4+5}2=4.5$ である。よって $Q_1=4.5$ である。
  • 上半分は 7〜12 番目の $8,9,10,11,13,20$ で、その中央値は $\dfrac{10+11}2=10.5$ である。よって $Q_3=10.5$ である。
    四分位範囲は $10.5-4.5=6$ である。$Q_3$ から四分位範囲の $1.5$ 倍だけ上は $10.5+1.5\cdot6=19.5$、$Q_1$ から $1.5$ 倍だけ下は $4.5-9=-4.5$ である。$20$ は $19.5$ を超えるので、よく使われる基準(def-qbp-boxplot)では 外れ値 と判定される。

2 つの例から、次の問いが出てくる。

  1. 四分位数は正確にはどう定めるのか。「4 等分」はどのくらい正確か。→ def-qbp-quartile、ex-qbp-quarter
  2. 箱ひげ図は何を描き、何を描かないのか。→ def-qbp-boxplot、ex-qbp-same-summary
  3. 外れ値があるとき、平均・分散と四分位数はどう違う反応をするか。→ thm-qbp-robust、ex-qbp-mean-moves
  4. 表計算ソフトで求めた四分位数が教科書の値と違うのはなぜか。→ rem-qbp-conventions、ex-qbp-conventions
    高校の計算この記事の言葉大学の言葉
    小さい順に並べて何番目かを見る$j$ 番目に小さい値 $x_{(j)}$順序統計量
    下半分・上半分の中央値四分位数分位点(分位点関数の値)
    箱ひげ図の箱の長さ四分位範囲ばらつきの頑健な尺度
    外れ値を 1 つ変えても箱は動かない四分位数の動く範囲の評価頑健性(ブレークダウン点)
    中央値は絶対値の和を最小にする四分位数は傾きを変えた絶対値の和を最小にする分位点回帰の損失関数

四分位数と五数要約

データを $x_1,x_2,\dots,x_n$ とする。これを小さい順に並べ替えたものを
$$ x_{(1)}\le x_{(2)}\le\dots\le x_{(n)} $$
と書く。$x_{(j)}$ を $j$ 番目に小さい値 という。同じ値が何個あっても、並べ替えた列は 1 通りに決まる。たとえば ex-qbp-odd では $x_{(5)}=x_{(6)}=8$ である。

四分位数・五数要約・四分位範囲

$n\ge2$ 個のデータ $x_{(1)}\le\dots\le x_{(n)}$ について、$h$ を $\dfrac n2$ 以下の最大の整数とする($n$ が偶数なら $h=\dfrac n2$、奇数なら $h=\dfrac{n-1}2$)。

  • 第 2 四分位数 $Q_2$:データ全体の中央値。$n$ が奇数なら $x_{\left(\frac{n+1}2\right)}$、偶数なら $\dfrac{x_{(h)}+x_{(h+1)}}2$。
  • 下半分 は $x_{(1)},\dots,x_{(h)}$、上半分 は $x_{(n-h+1)},\dots,x_{(n)}$ である($n$ が奇数なら、真ん中の $x_{\left(\frac{n+1}2\right)}$ はどちらにも入れない)。
  • 第 1 四分位数 $Q_1$ は下半分の中央値、第 3 四分位数 $Q_3$ は上半分の中央値である。
    最小値・$Q_1$・$Q_2$・$Q_3$・最大値の 5 つの数を 五数要約、$Q_3-Q_1$ を 四分位範囲(interquartile range、IQR)という。四分位範囲の半分 $\dfrac{Q_3-Q_1}2$ を 四分位偏差 という。

ここで「中央値」は、平均・中央値・分散 と同じく、個数が奇数なら真ん中の値、偶数なら真ん中の 2 つの平均である。この定め方を、この記事では 教科書の方式 と呼ぶ。ほかの方式は rem-qbp-conventions で見る。

小さなデータで確かめる
  1. $n=7$:$2,3,5,6,8,9,12$。$h=3$ である。$Q_2=x_{(4)}=6$。下半分 $2,3,5$ の中央値は $Q_1=3$、上半分 $8,9,12$ の中央値は $Q_3=9$ である。四分位範囲は $6$ である。
  2. $n=6$:$1,3,4,6,7,10$。$h=3$ である。$Q_2=\dfrac{x_{(3)}+x_{(4)}}2=\dfrac{4+6}2=5$。下半分 $1,3,4$ から $Q_1=3$、上半分 $6,7,10$ から $Q_3=7$ である。四分位範囲は $4$ である。

$Q_1$ は、下半分のさらに真ん中なので、データの小さいほうからおよそ 4 分の 1 のところにある。ただし「ちょうど 4 分の 1」ではない(ex-qbp-quarter)。$Q_1$ から $Q_3$ までの間には、データのおよそ半分が入る。

四分位数は何番目の値で決まるか

def-qbp-quartile の $Q_1,Q_2,Q_3$ は、どれも「ある番号 $k$ の $x_{(k)}$」か「隣り合う番号の平均 $\dfrac{x_{(k)}+x_{(k+1)}}2$」である。しかも番号 $k$ は データの個数 $n$ だけで決まり、データの値にはよらない。たとえば

$n$$Q_1$$Q_2$$Q_3$
$6$$x_{(2)}$$\frac{x_{(3)}+x_{(4)}}2$$x_{(5)}$
$7$$x_{(2)}$$x_{(4)}$$x_{(6)}$
$8$$\frac{x_{(2)}+x_{(3)}}2$$\frac{x_{(4)}+x_{(5)}}2$$\frac{x_{(6)}+x_{(7)}}2$
$11$$x_{(3)}$$x_{(6)}$$x_{(9)}$
$12$$\frac{x_{(3)}+x_{(4)}}2$$\frac{x_{(6)}+x_{(7)}}2$$\frac{x_{(9)}+x_{(10)}}2$

である。この性質を主定理 thm-qbp-robust で使う。

箱ひげ図と外れ値

箱ひげ図と外れ値の基準

数直線に沿って次のものを描いた図を 箱ひげ図 という。

  • 箱:$Q_1$ から $Q_3$ までの長方形。
  • 箱の中の線:$Q_2$ の位置。
  • ひげ:箱の両端から最小値・最大値まで引いた線分。
    データの中で $Q_1-1.5(Q_3-Q_1)$ より小さい値、または $Q_3+1.5(Q_3-Q_1)$ より大きい値を 外れ値 と呼ぶ基準がよく使われる。この基準を使うときは、外れ値を点で別に描き、ひげは外れ値でない値の最小・最大までにする(NIS12 1.3.3.7)。教科書によっては、等号を含めて「以下」「以上」とするものもある。違うのは境目ちょうどの値の扱いだけで、この記事では上の「より小さい」「より大きい」の定め方に従う。$1.5$ という数は約束であり、数学の定理から決まるものではない。

20 人の通学時間のヒストグラムと箱ひげ図。山の位置と箱の位置、右に長い裾とひげ・外れ値が対応する 20 人の通学時間のヒストグラムと箱ひげ図。山の位置と箱の位置、右に長い裾とひげ・外れ値が対応する

通学時間のデータ

20 人の通学時間(分)が、小さい順に
$$ 5,7,8,10,10,12,12,13,15,15,\quad 16,18,20,22,25,28,30,35,45,60 $$
であったとする(左の 10 個が下半分、右の 10 個が上半分)。

  • $Q_2=\dfrac{x_{(10)}+x_{(11)}}2=\dfrac{15+16}2=15.5$。
  • 下半分の中央値は $\dfrac{x_{(5)}+x_{(6)}}2=\dfrac{10+12}2=11$ なので $Q_1=11$。
  • 上半分の中央値は $\dfrac{x_{(15)}+x_{(16)}}2=\dfrac{25+28}2=26.5$ なので $Q_3=26.5$。
  • 四分位範囲は $26.5-11=15.5$。上の基準は $26.5+1.5\cdot15.5=26.5+23.25=49.75$、下の基準は $11-23.25=-12.25$ である。
    $60>49.75$ なので $60$ は外れ値で、ひげの右端は外れ値でない最大の値 $45$ になる。平均は $\dfrac{406}{20}=20.3$ で、中央値 $15.5$ より大きい。
    図 1 の上は、幅 10 分で区切ったヒストグラムである。度数は $0$〜$10$ 分が $3$、$10$〜$20$ 分が $9$、$20$〜$30$ 分が $4$、$30$〜$40$ 分が $2$、$40$〜$50$ 分が $1$、$50$〜$60$ 分が $0$、$60$〜$70$ 分が $1$ である(各階級は左端を含み右端を含まない)。山は左に寄り、右に長い裾がある。箱ひげ図では、$Q_2$ が箱の左寄りにあり、右のひげが左のひげより長い。平均が中央値より大きいのも、右の裾の大きな値に平均が引っ張られるからである。

箱ひげ図は、分布の中心($Q_2$)、真ん中の半分の広がり(箱の長さ)、左右の偏り(箱の中の線の位置、ひげの長さ)を 1 本の図に縮める。いくつかのデータを並べて比べるのに向いている。一方で、5 つの数しか使わないので、分布の細かい形は失われる(ex-qbp-same-summary)。

主定理:1 つの値を変えても四分位数は大きく動かない

ex-qbp-even の外れ値 $20$ を $200$ に変えても、上半分の中央値は $\dfrac{10+11}2=10.5$ のままで、四分位数は 1 つも変わらない。一方、平均は大きく変わる。この違いを定理にする。まず、「$j$ 番目に小さい値」を個数で言い換える。
以下、データは $n$ 個の「もの」の並び $x_1,\dots,x_n$ と考え、同じ値が何個あってもそれぞれ 1 個と数える。

$j$ 番目に小さい値を個数で言い換える

$n$ 個のデータ、$1\le j\le n$、実数 $c$ について、次が成り立つ。
(1) $x_{(j)}\le c$ であることと、「$c$ 以下のデータが $j$ 個以上ある」ことは同値である。
(2) $x_{(j)}\ge c$ であることと、「$c$ 以上のデータが $n-j+1$ 個以上ある」ことは同値である。

並べた列の前と後ろを数える

方針:どちらも、並べ替えた列 $x_{(1)}\le\dots\le x_{(n)}$ の前の部分・後ろの部分の個数を数える。(2) は (1) の向きを逆にしたものなので、(1) を丁寧に示し、(2) は同じ手順を書く。
段 1((1) の「ならば」)。$x_{(j)}\le c$ とする。並べ替えた列は小さい順なので $x_{(1)}\le x_{(2)}\le\dots\le x_{(j)}$ で、この $j$ 個はどれも $x_{(j)}$ 以下、したがって $c$ 以下である。よって $c$ 以下のデータは $j$ 個以上ある。
段 2((1) の逆)。$c$ 以下のデータが $j$ 個以上あるとする。仮に $x_{(j)}>c$ だったとすると、$x_{(j)}\le x_{(j+1)}\le\dots\le x_{(n)}$ の $n-j+1$ 個はどれも $c$ より大きい。すると $c$ 以下になれるのは残りの $x_{(1)},\dots,x_{(j-1)}$ の $j-1$ 個だけで、$c$ 以下のデータが $j$ 個以上あることに反する。よって $x_{(j)}\le c$ である。
段 3((2))。$x_{(j)}\ge c$ なら、$x_{(j)},x_{(j+1)},\dots,x_{(n)}$ の $n-j+1$ 個はどれも $c$ 以上である。逆に、$c$ 以上のデータが $n-j+1$ 個以上あるとき、仮に $x_{(j)}< c$ なら $x_{(1)},\dots,x_{(j)}$ の $j$ 個が $c$ 未満で、$c$ 以上になれるのは残りの $n-j$ 個だけになり、仮定に反する。よって $x_{(j)}\ge c$ である。$\square$

個数で言い換えを確かめる

ex-qbp-odd のデータ $3,5,6,7,8,8,9,10,12,13,15$ で $j=6$ とする。$x_{(6)}=8$ である。

  • $c=8$:$8$ 以下のデータは $3,5,6,7,8,8$ の $6$ 個で、$6\ge j$。確かに $x_{(6)}\le8$。
  • $c=7.5$:$7.5$ 以下のデータは $3,5,6,7$ の $4$ 個で、$6$ 個に足りない。確かに $x_{(6)}=8>7.5$。
    1. で $c=8$:$8$ 以上のデータは $8,8,9,10,12,13,15$ の $7$ 個で、$n-j+1=11-6+1=6$ 個以上ある。確かに $x_{(6)}\ge8$。
1 つ入れ替えたときの順位のずれ

$n\ge2$ 個のデータ $x_1,\dots,x_n$ のうち 1 つ($x_i$ とする)を任意の実数 $t$ に取り替えたデータを $y_1,\dots,y_n$ とし、小さい順に $y_{(1)}\le\dots\le y_{(n)}$ と並べる。このとき
$$ x_{(j-1)}\le y_{(j)}\le x_{(j+1)}\qquad(2\le j\le n-1) $$
である。端では $y_{(1)}\le x_{(2)}$、$y_{(n)}\ge x_{(n-1)}$ が成り立つ。

入れ替わるのは 1 個だけであることを使う

方針:取り替えで変わるのは 1 個だけなので、「$x_{(j+1)}$ 以下の $j+1$ 個」のうち少なくとも $j$ 個は新しいデータにも残る。これと lem-qbp-count を組み合わせる。
段 1(右の不等式 $y_{(j)}\le x_{(j+1)}$、$1\le j\le n-1$)。並べ替えた列の前から $j+1$ 個 $x_{(1)},\dots,x_{(j+1)}$ は、どれも $x_{(j+1)}$ 以下である。取り替えたのは 1 個だけなので、この $j+1$ 個のうち取り替えられたのは多くても 1 個である。したがって少なくとも $j$ 個はそのまま新しいデータ $y_1,\dots,y_n$ に残っている。よって新しいデータの中に、$x_{(j+1)}$ 以下のものが $j$ 個以上ある。lem-qbp-count (1) を新しいデータと $c=x_{(j+1)}$ に使うと、$y_{(j)}\le x_{(j+1)}$ である。
段 2(左の不等式 $y_{(j)}\ge x_{(j-1)}$、$2\le j\le n$)。並べ替えた列の後ろの $x_{(j-1)},x_{(j)},\dots,x_{(n)}$ は $n-j+2$ 個あり、どれも $x_{(j-1)}$ 以上である。取り替えられたのは多くても 1 個なので、少なくとも $n-j+1$ 個は新しいデータに残る。lem-qbp-count (2) を新しいデータと $c=x_{(j-1)}$ に使うと、$y_{(j)}\ge x_{(j-1)}$ である。
段 3(まとめ)。$2\le j\le n-1$ なら段 1・段 2 の両方が使えて、$x_{(j-1)}\le y_{(j)}\le x_{(j+1)}$ である。$j=1$ では段 1 だけが、$j=n$ では段 2 だけが使える。$\square$

四分位数の動く範囲

$n\ge6$ とする。$n$ 個のデータのうち 1 つを任意の実数に取り替えたとき、取り替えた後の四分位数 $Q_1',Q_2',Q_3'$ は次の範囲にある。rem-qbp-index のとおり、もとの $Q_m$($m=1,2,3$)が

  • $Q_m=x_{(k)}$ の形なら、$x_{(k-1)}\le Q_m'\le x_{(k+1)}$。
  • $Q_m=\dfrac{x_{(k)}+x_{(k+1)}}2$ の形なら、$\dfrac{x_{(k-1)}+x_{(k)}}2\le Q_m'\le\dfrac{x_{(k+1)}+x_{(k+2)}}2$。
    ここに現れる番号はどれも $1$ 以上 $n$ 以下であり、したがって $Q_1',Q_2',Q_3'$ はどれも、取り替える値 $t$ をどう選んでも、もとのデータだけで決まる範囲に収まる。一方、平均値は、取り替える値を選べばどんな実数にもできる。
番号の範囲を確かめてから補題を使う

方針:四分位数を作る番号が $n$ だけで決まることを使い、各番号に lem-qbp-interlace を当てはめる。そのために、番号が補題の使える範囲($2$ 以上 $n-1$ 以下)にあることを先に確かめる。
段 1(番号は取り替えの前後で同じ)。取り替えてもデータの個数は $n$ のままである。rem-qbp-index のとおり、$Q_m$ を作る番号は $n$ だけで決まるので、$Q_m=x_{(k)}$ なら $Q_m'=y_{(k)}$、$Q_m=\dfrac{x_{(k)}+x_{(k+1)}}2$ なら $Q_m'=\dfrac{y_{(k)}+y_{(k+1)}}2$ である。
段 2($Q_1$ の番号は $2$ 以上)。$h$ を $\dfrac n2$ 以下の最大の整数とする。$n\ge6$ なので $h\ge3$ である。下半分 $x_{(1)},\dots,x_{(h)}$ の中央値が $Q_1$ である。$h$ が奇数なら $Q_1=x_{\left(\frac{h+1}2\right)}$ で、$h\ge3$ から $\dfrac{h+1}2\ge2$ である。$h$ が偶数なら $h\ge4$ で、$Q_1=\dfrac{x_{(h/2)}+x_{(h/2+1)}}2$、$\dfrac h2\ge2$ である。どちらの場合も、$Q_1$ に使う最小の番号は $2$ 以上である。
段 3($Q_3$ の番号は $n-1$ 以下)。上半分は $x_{(n-h+1)},\dots,x_{(n)}$ の $h$ 個である。$h$ が奇数なら、その真ん中は前から $\dfrac{h+1}2$ 番目で、番号は $n-h+\dfrac{h+1}2=n-\dfrac{h-1}2\le n-1$($h\ge3$ より $\dfrac{h-1}2\ge1$)である。$h$ が偶数なら、使う番号は $n-h+\dfrac h2=n-\dfrac h2$ と $n-\dfrac h2+1$ で、大きいほうは $h\ge4$ より $n-1$ 以下である。$Q_2$ の番号は $Q_1$ と $Q_3$ の番号の間にあるので、これも $2$ 以上 $n-1$ 以下である。
段 4(補題を使う)。段 2・段 3 より、$Q_1,Q_2,Q_3$ に使うすべての番号 $k$ について $2\le k\le n-1$ である。lem-qbp-interlace から $x_{(k-1)}\le y_{(k)}\le x_{(k+1)}$ である。$Q_m=x_{(k)}$ の形なら、これがそのまま主張である。$Q_m=\dfrac{x_{(k)}+x_{(k+1)}}2$ の形なら、番号 $k$ と $k+1$ の両方に補題を使って
$$ x_{(k-1)}\le y_{(k)}\le x_{(k+1)},\qquad x_{(k)}\le y_{(k+1)}\le x_{(k+2)} $$
を得る。2 つを足して $2$ で割ると、主張の不等式になる。
段 5(平均値)。$x_i$ を $t$ に取り替えると、合計は $t-x_i$ だけ変わるので、新しい平均値は $\bar x+\dfrac{t-x_i}n$ である。どんな実数 $u$ についても $t=x_i+n(u-\bar x)$ と選べば、新しい平均値は $u$ になる。$\square$

$Q_1$ に使う番号が $2$ 以上であることが効いている。$n\le5$ ではこれが崩れ、定理も成り立たない(ex-qbp-small-n)。

定理の範囲を確かめる

ex-qbp-odd のデータ($n=11$)では、rem-qbp-index の表から $Q_1=x_{(3)}$、$Q_2=x_{(6)}$、$Q_3=x_{(9)}$ である。定理の範囲は
$$ x_{(2)}=5\le Q_1'\le x_{(4)}=7,\qquad x_{(5)}=8\le Q_2'\le x_{(7)}=9,\qquad x_{(8)}=10\le Q_3'\le x_{(10)}=13 $$
である。

  • 2 つある $8$ の 1 つを $100$ に取り替えると、並べ替えて $3,5,6,7,8,9,10,12,13,15,100$ となり、$Q_1'=6$、$Q_2'=9$、$Q_3'=13$ である。$Q_2'$ と $Q_3'$ は範囲の右端にちょうど届いている。
  • 同じ $8$ を $-100$ に取り替えると、$-100,3,5,6,7,8,9,10,12,13,15$ となり、$Q_1'=5$、$Q_2'=8$、$Q_3'=12$ である。$Q_1'$ は範囲の左端に届いている。
    どちらの場合も範囲に入っており、範囲の端に届く取り替え方もある。

15 を 60 に取り替えると、平均(×、箱の下)は右に動くが、箱(Q1 から Q3)と中央値の線は動かない。ひげの右端は 15 から 13 になる 15 を 60 に取り替えると、平均(×、箱の下)は右に動くが、箱(Q1 から Q3)と中央値の線は動かない。ひげの右端は 15 から 13 になる

平均と分散は 1 つの値で大きく動く

ex-qbp-odd の最大値 $15$ を $60$ に取り替える。

  • 平均値:合計は $96$ から $96-15+60=141$ に変わり、平均値は $\dfrac{96}{11}=8.727\ldots$ から $\dfrac{141}{11}=12.818\ldots$ に上がる。
  • 分散:$\dfrac{1410}{121}=11.65\ldots$ から $\dfrac{27870}{121}=230.33\ldots$ に、約 $20$ 倍になる。標準偏差は $3.41\ldots$ から $15.17\ldots$ になる。
  • 四分位数:上半分は $9,10,12,13,60$ になるが、その中央値は $12$ のままで、$Q_1=6$、$Q_2=8$、$Q_3=12$ はどれも変わらない。
    $60$ は $Q_3+1.5(Q_3-Q_1)=12+9=21$ を超えるので外れ値として点で描かれ、ひげの右端は $13$ になる(図 2)。平均は外れ値に引っ張られ、四分位数は引っ張られない。

平均値が「ずれの 2 乗の和」を最小にする値であることは 平均値と二乗誤差 で、中央値が「ずれの絶対値の和」を最小にする値であることは 中央値と絶対誤差 で示した。2 乗は大きなずれをさらに大きく数えるので、平均は遠くの 1 点に強く引かれる。絶対値はずれを比例でしか数えないので、中央値や四分位数は遠くの 1 点にあまり引かれない。thm-qbp-robust は、この違いを「動く範囲」として正確に述べたものである。

例と反例

thm-qbp-robust と箱ひげ図について、条件を外すと何が崩れるかを先にまとめる。

外した仮定・思い込み崩れる主張ボックス
$n\ge6$1 つの値の取り替えで $Q_1$ がいくらでも動くex-qbp-small-n
取り替えるのは 1 つだけ3 つ取り替えると $Q_3$ がいくらでも動くex-qbp-many
「四分位数でちょうど 4 等分される」$Q_1$ 以下の割合は $\frac14$ からずれるex-qbp-quarter
「箱ひげ図が同じなら分布も同じ」五数要約が同じでも分散が違うex-qbp-same-summary
「四分位数の定め方は 1 通り」方式によって値が違うex-qbp-conventions
反例:データが 5 個以下だと定理は成り立たない

$n=5$ のデータ $1,2,3,4,5$ を考える。$h=2$ なので、下半分は $1,2$、上半分は $4,5$ で、
$$ Q_1=\frac{1+2}2=1.5,\qquad Q_2=3,\qquad Q_3=\frac{4+5}2=4.5 $$
である。最小値 $1$ を $-100$ に取り替えると、下半分は $-100,2$ になり、$Q_1'=\dfrac{-100+2}2=-49$ である。$-100$ の代わりに $-10^6$ にすれば $Q_1'=\dfrac{-10^6+2}2=-499999$ で、取り替える値を小さくするほど $Q_1'$ はいくらでも小さくなる。
崩れたのは、prf-qbp-robust の段 2 である。$n=5$ では $h=2$ で、$Q_1$ に最小値 $x_{(1)}$ そのものが使われる。番号 $1$ には lem-qbp-interlace の左の不等式がないので、$Q_1'$ を下から押さえるものがない。$n\le5$ ではいつも $h\le2$ で、$Q_1$ に $x_{(1)}$ が使われるので、同じことが起こる。

反例:3 つ取り替えると第 3 四分位数も動く

ex-qbp-odd のデータ($n=11$)では $Q_3=x_{(9)}=12$ である。

  • 大きいほうから 2 つ($13,15$)を $1000$ に取り替えると、並べて $3,5,6,7,8,8,9,10,12,1000,1000$ となり、$9$ 番目は $12$ のままで $Q_3'=12$ である。
  • 大きいほうから 3 つ($12,13,15$)を $1000$ に取り替えると、$3,5,6,7,8,8,9,10,1000,1000,1000$ となり、$Q_3'=x_{(9)}=1000$ である。$1000$ の代わりにどんな大きな数を入れても、$Q_3'$ はその数になる。
    $x_{(9)}$ 以上のデータは $x_{(9)},x_{(10)},x_{(11)}$ の $3$ 個である。この 3 個をすべて大きな値に取り替えると、lem-qbp-count (2) の「$c$ 以上のデータが $n-9+1=3$ 個以上ある」がどんな大きな $c$ でも成り立ち、$x_{(9)}$ を上から押さえるものがなくなる。2 個まで取り替えても、$c$ 以上のデータを 3 個そろえるには、もとの値が少なくとも 1 個要る。もとの値はどれも $x_{(11)}=15$ 以下なので、$Q_3'\le15$ に押さえられる。たとえば $3,5$ の 2 個を $1000$ に取り替えると、並べて $6,7,8,8,9,10,12,13,15,1000,1000$ となり、$Q_3'=x_{(9)}=15$ である。押さえているのは $12$ ではなく $15$ であることに注意する。平均は 1 個の取り替えで動いたのに対し、$Q_3$ を動かすには 3 個の取り替えが要る。
反例:四分位数でちょうど 4 等分されるとは限らない

rem-qbp-index の表から、$Q_1$ 以下にある番号の割合を見る。

  • $n=6$:$Q_1=x_{(2)}$ で、$x_{(1)},x_{(2)}$ の $2$ 個が $Q_1$ 以下にある。割合は $\dfrac26=0.333\ldots$ である。
  • $n=11$:$Q_1=x_{(3)}$ で、$3$ 個が $Q_1$ 以下にある。割合は $\dfrac3{11}=0.2727\ldots$ である。ex-qbp-odd では $3,5,6$ の $3$ 個が $Q_1=6$ 以下である。
  • $n=12$:$Q_1=\dfrac{x_{(3)}+x_{(4)}}2$ で、$x_{(3)}< x_{(4)}$ なら $Q_1$ より小さい値はちょうど $3$ 個、割合は $\dfrac3{12}=0.25$ である。ex-qbp-even では $2,4,4$ の $3$ 個が $Q_1=4.5$ より小さい。
    データの個数が 4 で割り切れるときは 4 等分にぴったり合うが、そうでないときは少しずれる。個数が大きくなるほど、ずれの割合は小さくなる。
反例:五数要約が同じでも分布は違う

9 個ずつの 2 つのデータ
$$ \text{P}:1,2,3,4,5,6,7,8,9,\qquad \text{Q}:1,\ 2.5,\ 2.5,\ 2.5,\ 5,\ 7.5,\ 7.5,\ 7.5,\ 9 $$
を比べる。どちらも $h=4$ である。

  • P:$Q_2=x_{(5)}=5$。下半分 $1,2,3,4$ から $Q_1=\dfrac{2+3}2=2.5$、上半分 $6,7,8,9$ から $Q_3=\dfrac{7+8}2=7.5$。
  • Q:$Q_2=5$。下半分 $1,2.5,2.5,2.5$ から $Q_1=\dfrac{2.5+2.5}2=2.5$、上半分 $7.5,7.5,7.5,9$ から $Q_3=7.5$。
    五数要約はどちらも $1,\ 2.5,\ 5,\ 7.5,\ 9$ で、箱ひげ図はまったく同じになる(図 3)。平均もどちらも $5$ である。しかし分散は、P が
    $$ \frac{(-4)^2+(-3)^2+(-2)^2+(-1)^2+0^2+1^2+2^2+3^2+4^2}{9}=\frac{60}9=\frac{20}3=6.666\ldots $$
    Q が
    $$ \frac{(-4)^2+3\cdot(-2.5)^2+0^2+3\cdot2.5^2+4^2}{9}=\frac{16+18.75+18.75+16}{9}=\frac{69.5}9=\frac{139}{18}=7.722\ldots $$
    で、違う。P は 1 から 9 まで均等に並び、Q は $2.5$ と $7.5$ の 2 か所に固まっている。箱ひげ図はこの違いを描かない。

五数要約が同じ 2 つのデータ。点の並び方は違うが、箱ひげ図は一致する 五数要約が同じ 2 つのデータ。点の並び方は違うが、箱ひげ図は一致する

四分位数の定め方はいくつもある

def-qbp-quartile は日本の高校の教科書の方式である。統計ソフトや表計算ソフトは別の方式を使うことが多い。代表的なものを 2 つ挙げる。$0< p<1$ に対し、「$p$ の割合のところの値」を次のように決める。

  • 方式 A:番号 $1+(n-1)p$ の位置の値。番号が整数でないときは、前後の $x_{(k)}$ と $x_{(k+1)}$ を直線で結んで(線形補間で)決める。つまり番号が $k+d$($k$ は整数、$0\le d<1$)なら $x_{(k)}+d\bigl(x_{(k+1)}-x_{(k)}\bigr)$ とする。
  • 方式 B:番号 $(n+1)p$ の位置の値を、同じように線形補間で決める。
    $p=\frac14,\frac12,\frac34$ の値を $Q_1,Q_2,Q_3$ とする。表計算ソフト Excel では、方式 A が QUARTILE.INC 関数の方式、方式 B が QUARTILE.EXC 関数の方式である。これは関数の説明ページ(MSQI、MSQE)の計算例で確かめられる。たとえば QUARTILE.INC の例では、$1,2,4,7,8,9,10,12$($n=8$)の第 1 四分位数が $3.5$ である。方式 A では番号が $1+7\cdot\frac14=2.75$ で $2+0.75\cdot(4-2)=3.5$ となって合い、方式 B では番号が $9\cdot\frac14=2.25$ で $2.5$ となって合わない。統計ソフトで使われている方式を 9 通りに整理した論文がある(HF96。方式 A はその第 7 方式、方式 B は第 6 方式にあたる)。教科書の方式の $Q_2$ と、方式 A・方式 B の $p=\frac12$ の値は、どれも中央値に一致する(HF96 の 9 方式の中には、一致しないものもある)。一方、$Q_1,Q_3$ は一般に一致しない。どれが正しいということはなく、データが多いと差は小さくなる。
3 つの方式で四分位数を比べる

ex-qbp-odd のデータ($n=11$)で、方式 A の $Q_1$ の番号は $1+10\cdot\frac14=3.5$ なので、
$$ Q_1=x_{(3)}+0.5\bigl(x_{(4)}-x_{(3)}\bigr)=6+0.5\cdot(7-6)=6.5 $$
である。$Q_3$ の番号は $1+10\cdot\frac34=8.5$ なので、$Q_3=x_{(8)}+0.5(x_{(9)}-x_{(8)})=10+0.5\cdot2=11$ である。方式 B では番号が $12\cdot\frac14=3$ と $12\cdot\frac34=9$ でどちらも整数なので、$Q_1=x_{(3)}=6$、$Q_3=x_{(9)}=12$ である。
ex-qbp-even のデータ($n=12$)では、方式 A の番号は $1+11\cdot\frac14=3.75$ と $1+11\cdot\frac34=9.25$ で、
$$ Q_1=4+0.75\cdot(5-4)=4.75,\qquad Q_3=10+0.25\cdot(11-10)=10.25 $$
である。方式 B の番号は $13\cdot\frac14=3.25$ と $13\cdot\frac34=9.75$ で、$Q_1=4+0.25\cdot1=4.25$、$Q_3=10+0.75\cdot1=10.75$ である。まとめると次のようになる。

データ教科書の方式方式 A方式 B
ex-qbp-odd($n=11$)$Q_1=6$、$Q_3=12$$Q_1=6.5$、$Q_3=11$$Q_1=6$、$Q_3=12$
ex-qbp-even($n=12$)$Q_1=4.5$、$Q_3=10.5$$Q_1=4.75$、$Q_3=10.25$$Q_1=4.25$、$Q_3=10.75$

中央値はこの 3 つの方式のどれでも $8$ と $7.5$ である。ex-qbp-even の外れ値の判定は、方式 A でも変わらない。四分位範囲は $10.25-4.75=5.5$、上の基準は $10.25+1.5\cdot5.5=18.5$ で、$20$ はこれを超える。

大学数学で見る:分位点と損失関数

ここからは、四分位数を大学の統計学の言葉で見直す。まず高校数学で解ける問題を 1 つ置き、次にその背後の構造を述べる。

問題:傾きを変えた絶対値の和を最小にする

データ $1,3,4,8,9$($n=5$)について、
$$ L(a)=\sum_{x_i\ge a}\frac14(x_i-a)+\sum_{x_i< a}\frac34(a-x_i) $$
を最小にする $a$ を求めよ。$a$ より大きいデータとの差には重み $\frac14$、$a$ より小さいデータとの差には重み $\frac34$ を掛けて足している。重みがどちらも $\frac12$ なら $L(a)=\frac12\sum|x_i-a|$ で、最小にする $a$ は中央値である(中央値と絶対誤差)。
データの値での $L$ を計算すると、次のようになる。

$a$$1$$3$$4$$8$$9$
$L(a)$$5$$4.5$$5.25$$12.25$$15$

たとえば $a=3$ では、$3$ 以上の $3,4,8,9$ との差 $0,1,5,6$ の和 $12$ に $\frac14$ を掛けて $3$、$3$ より小さい $1$ との差 $2$ に $\frac34$ を掛けて $1.5$、合わせて $4.5$ である。

高校数学で解く:傾きを数える

方針:$L(a)$ は、データの値で区切った各区間の上で 1 次関数になる。各区間での傾き($a$ が 1 増えたときの $L$ の増え方)を求め、傾きが負から正に変わるところを探す。
段 1(傾きの式)。$a$ がどのデータの値とも等しくないとき、$a$ より小さいデータの個数を $m$ とする。$a$ を少し増やすと、$a$ より大きい $5-m$ 個の各項 $\frac14(x_i-a)$ は $a$ の増え分の $\frac14$ 倍だけ減り、$a$ より小さい $m$ 個の各項 $\frac34(a-x_i)$ は $\frac34$ 倍だけ増える。よって、その区間での傾きは
$$ -\frac14(5-m)+\frac34m=m-\frac54 $$
である。
段 2(傾きの符号)。$a<1$ では $m=0$ で傾きは $-\frac54$、$1< a<3$ では $m=1$ で傾きは $-\frac14$、$3< a<4$ では $m=2$ で傾きは $\frac34$、それより右では $m\ge3$ で傾きはさらに大きく、正である。
段 3(結論)。$L(a)$ は $a$ について連続で(各項が連続なので)、$a<3$ では傾きが負なので減り、$a>3$ では傾きが正なので増える。よって $L(a)$ は $a=3$ で最小になり、最小値は表のとおり $L(3)=4.5$ である。$3$ は小さいほうから $2$ 番目の値で、$\frac14\cdot5=1.25$ を切り上げた番号にあたる。$\square$

大学数学で見る:損失関数と分位点

段 1 の傾き $m-\frac54$ は、$m-\tau n$($\tau=\frac14$、$n=5$)の形をしている。一般に $0<\tau<1$ に対し
$$ \rho_\tau(u)=\begin{cases}\tau u&(u\ge0)\\(\tau-1)u&(u<0)\end{cases},\qquad L_\tau(a)=\sum_{i=1}^n\rho_\tau(x_i-a) $$
とおくと、同じ計算で傾きは「$a$ より小さいデータの個数 $-\tau n$」になる。したがって $\tau n$ が整数でないとき、$L_\tau$ を最小にする $a$ は $x_{(k)}$($k$ は $\tau n$ を切り上げた整数)である。$\tau n$ が整数 $k$ のときは、$x_{(k)}$ から $x_{(k+1)}$ までの区間で傾きが $0$ になり、その区間のどの点でも最小になる。$\rho_\tau$ をチェック関数(pinball loss)といい、$\tau=\frac12$ が中央値、$\tau=\frac14,\frac34$ が四分位数にあたる。

  • ex-qbp-odd($n=11$)で $\tau=\frac14$ とすると $\tau n=2.75$ で、最小は $x_{(3)}=6=Q_1$ である。$\tau=\frac34$ では $\tau n=8.25$ で、最小は $x_{(9)}=12=Q_3$ である。
  • ex-qbp-even($n=12$)で $\tau=\frac14$ とすると $\tau n=3$ が整数で、$x_{(3)}=4$ から $x_{(4)}=5$ までのすべての点で最小になる。教科書の $Q_1=4.5$ はこの区間の真ん中である。
    直線 $y=\alpha+\beta x$ を、2 乗の和の代わりに $\sum\rho_\tau(y_i-\alpha-\beta x_i)$ の最小で決める方法を 分位点回帰 という(KB78)。
    また、$F(c)=\dfrac{c\text{ 以下のデータの個数}}n$ とおくと、lem-qbp-count (1) は「$x_{(j)}\le c$ と $F(c)\ge\dfrac jn$ は同値」と言い換えられる。ここから、$F(c)\ge p$ となる最小の $c$ は $x_{(k)}$($k$ は $np$ を切り上げた整数)である。この「$F$ の逆関数」を 分位点関数 という(HF96 の第 1 方式)。$F$ は確率分布の累積分布関数のデータ版で、確率分布の中央値も同じように定める(確率分布の中央値)。
大学数学で見る:ブレークダウン点

ex-qbp-many のように、「データのうち何個を取り替えれば値をいくらでも大きく(小さく)できるか」の最小の個数を $n$ で割った割合を、有限標本の ブレークダウン点 という。ブレークダウン点の考え方は Ham71 が導入した(ここで使った有限標本の形は、その後に定められたものである)。ex-qbp-odd の $n=11$ では

値平均値$Q_1=x_{(3)}$$Q_2=x_{(6)}$$Q_3=x_{(9)}$
いくらでも動かすのに要る取り替えの個数$1$$3$$6$$3$
割合$\frac1{11}$$\frac3{11}$$\frac6{11}$$\frac3{11}$

である。$Q_1=x_{(3)}$ を小さくするには $x_{(1)},x_{(2)},x_{(3)}$ の 3 個を、大きくするには $x_{(3)}$ から $x_{(11)}$ までの 9 個を取り替える必要があり、少ないほうの 3 個が表の数である。$n$ が大きくなると、平均値の割合は $0$ に、中央値は約 $\frac12$ に、四分位数は約 $\frac14$ に近づく。thm-qbp-robust は「$n\ge6$ なら 1 個の取り替えでは足りない」ことを示している。

さらに先へ

  • 四分位数は、データを 4 つに分ける 分位点 の特別な場合である。100 に分ける値を百分位数(パーセンタイル)という。確率分布についての分位点は、累積分布関数の逆関数で定める(分位点関数)。
  • $j$ 番目に小さい値 $x_{(j)}$ を確率変数とみたものを 順序統計量 といい、中央値や四分位数の分布を調べる道具になる(順序統計量)。
  • 外れ値に強い統計の方法は 頑健統計 と呼ばれる。平均値と中央値の違いは、2 乗の和と絶対値の和の違いであった(平均値と二乗誤差、中央値と絶対誤差)。
  • 箱ひげ図で 2 つのデータの違いを見たあと、その違いが偶然で説明できるかを確率で判断するのが 仮説検定の考え方 である。

関連項目

参考文献

[2]
Rob J. Hyndman, Yanan Fan, Sample Quantiles in Statistical Packages, The American Statistician 50(4), pp. 361–365 (doi:10.1080/00031305.1996.10473566), 1996, 9 通りの標本分位点の定義(Definition 1, 6, 7)
[3]
Roger Koenker, Gilbert Bassett Jr., Regression Quantiles, Econometrica 46(1), pp. 33–50 (doi:10.2307/1913643), 1978, 分位点回帰の定義(チェック関数の和の最小化)
[4]
Frank R. Hampel, A General Qualitative Definition of Robustness, The Annals of Mathematical Statistics 42(6), pp. 1887–1896 (doi:10.1214/aoms/1177693054), 1971, ブレークダウン点の考え方の導入(漸近的な定義。有限標本の形は後の文献による)

Mathpediaは寄付と、参考文献の書籍リンク(Amazonアソシエイト)の紹介料で運営されています。 支援について / 寄付する