四分位数と箱ひげ図は、データを小さい順に並べて 4 つに分ける 3 つの値 $Q_1,Q_2,Q_3$($Q_2$ は中央値、$Q_1,Q_3$ は下半分・上半分の中央値)と、最小値・$Q_1$・$Q_2$・$Q_3$・最大値の五数要約を描いた図である。四分位範囲 $Q_3-Q_1$ の 1.5 倍より外の値を外れ値とする基準がよく使われる。データが 6 個以上なら、1 つの値をどんな実数に取り替えても四分位数はもとのデータで決まる範囲に収まるが、平均値はいくらでも動く。四分位数の定め方はソフトによって異なり、五数要約が同じでも分布は同じとは限らない。四分位数は、傾きを変えた絶対値の和を最小にする値(分位点)とも見られる。
前提知識: 平均・中央値・分散
データを小さい順に並べ、真ん中で 2 つに分けたところが 中央値 である。前半と後半をさらにそれぞれ真ん中で分けると、データはおよそ 4 等分される。この 3 つの区切りの値を 四分位数 といい、小さい順に第 1 四分位数 $Q_1$、第 2 四分位数 $Q_2$(中央値)、第 3 四分位数 $Q_3$ と書く。平均値・中央値・分散の定義は 平均・中央値・分散 で扱った。この記事では、四分位数とそれを絵にした 箱ひげ図 を調べる。まず教科書の方式で 2 つのデータの四分位数を求めてみる。
11 人の小テスト(15 点満点)の得点が、小さい順に
$$
3,\ 5,\ 6,\ 7,\ 8,\ 8,\ 9,\ 10,\ 12,\ 13,\ 15
$$
であったとする。
12 個のデータ
$$
2,\ 4,\ 4,\ 5,\ 6,\ 7,\ 8,\ 9,\ 10,\ 11,\ 13,\ 20
$$
では、個数が偶数なので中央値は 6 番目と 7 番目の平均で、$Q_2=\dfrac{7+8}2=7.5$ である。
2 つの例から、次の問いが出てくる。
| 高校の計算 | この記事の言葉 | 大学の言葉 |
|---|---|---|
| 小さい順に並べて何番目かを見る | $j$ 番目に小さい値 $x_{(j)}$ | 順序統計量 |
| 下半分・上半分の中央値 | 四分位数 | 分位点(分位点関数の値) |
| 箱ひげ図の箱の長さ | 四分位範囲 | ばらつきの頑健な尺度 |
| 外れ値を 1 つ変えても箱は動かない | 四分位数の動く範囲の評価 | 頑健性(ブレークダウン点) |
| 中央値は絶対値の和を最小にする | 四分位数は傾きを変えた絶対値の和を最小にする | 分位点回帰の損失関数 |
データを $x_1,x_2,\dots,x_n$ とする。これを小さい順に並べ替えたものを
$$
x_{(1)}\le x_{(2)}\le\dots\le x_{(n)}
$$
と書く。$x_{(j)}$ を $j$ 番目に小さい値 という。同じ値が何個あっても、並べ替えた列は 1 通りに決まる。たとえば ex-qbp-odd では $x_{(5)}=x_{(6)}=8$ である。
$n\ge2$ 個のデータ $x_{(1)}\le\dots\le x_{(n)}$ について、$h$ を $\dfrac n2$ 以下の最大の整数とする($n$ が偶数なら $h=\dfrac n2$、奇数なら $h=\dfrac{n-1}2$)。
ここで「中央値」は、平均・中央値・分散 と同じく、個数が奇数なら真ん中の値、偶数なら真ん中の 2 つの平均である。この定め方を、この記事では 教科書の方式 と呼ぶ。ほかの方式は rem-qbp-conventions で見る。
$Q_1$ は、下半分のさらに真ん中なので、データの小さいほうからおよそ 4 分の 1 のところにある。ただし「ちょうど 4 分の 1」ではない(ex-qbp-quarter)。$Q_1$ から $Q_3$ までの間には、データのおよそ半分が入る。
def-qbp-quartile の $Q_1,Q_2,Q_3$ は、どれも「ある番号 $k$ の $x_{(k)}$」か「隣り合う番号の平均 $\dfrac{x_{(k)}+x_{(k+1)}}2$」である。しかも番号 $k$ は データの個数 $n$ だけで決まり、データの値にはよらない。たとえば
| $n$ | $Q_1$ | $Q_2$ | $Q_3$ |
|---|---|---|---|
| $6$ | $x_{(2)}$ | $\frac{x_{(3)}+x_{(4)}}2$ | $x_{(5)}$ |
| $7$ | $x_{(2)}$ | $x_{(4)}$ | $x_{(6)}$ |
| $8$ | $\frac{x_{(2)}+x_{(3)}}2$ | $\frac{x_{(4)}+x_{(5)}}2$ | $\frac{x_{(6)}+x_{(7)}}2$ |
| $11$ | $x_{(3)}$ | $x_{(6)}$ | $x_{(9)}$ |
| $12$ | $\frac{x_{(3)}+x_{(4)}}2$ | $\frac{x_{(6)}+x_{(7)}}2$ | $\frac{x_{(9)}+x_{(10)}}2$ |
である。この性質を主定理 thm-qbp-robust で使う。
数直線に沿って次のものを描いた図を 箱ひげ図 という。
20 人の通学時間のヒストグラムと箱ひげ図。山の位置と箱の位置、右に長い裾とひげ・外れ値が対応する
20 人の通学時間(分)が、小さい順に
$$
5,7,8,10,10,12,12,13,15,15,\quad 16,18,20,22,25,28,30,35,45,60
$$
であったとする(左の 10 個が下半分、右の 10 個が上半分)。
箱ひげ図は、分布の中心($Q_2$)、真ん中の半分の広がり(箱の長さ)、左右の偏り(箱の中の線の位置、ひげの長さ)を 1 本の図に縮める。いくつかのデータを並べて比べるのに向いている。一方で、5 つの数しか使わないので、分布の細かい形は失われる(ex-qbp-same-summary)。
ex-qbp-even の外れ値 $20$ を $200$ に変えても、上半分の中央値は $\dfrac{10+11}2=10.5$ のままで、四分位数は 1 つも変わらない。一方、平均は大きく変わる。この違いを定理にする。まず、「$j$ 番目に小さい値」を個数で言い換える。
以下、データは $n$ 個の「もの」の並び $x_1,\dots,x_n$ と考え、同じ値が何個あってもそれぞれ 1 個と数える。
$n$ 個のデータ、$1\le j\le n$、実数 $c$ について、次が成り立つ。
(1) $x_{(j)}\le c$ であることと、「$c$ 以下のデータが $j$ 個以上ある」ことは同値である。
(2) $x_{(j)}\ge c$ であることと、「$c$ 以上のデータが $n-j+1$ 個以上ある」ことは同値である。
方針:どちらも、並べ替えた列 $x_{(1)}\le\dots\le x_{(n)}$ の前の部分・後ろの部分の個数を数える。(2) は (1) の向きを逆にしたものなので、(1) を丁寧に示し、(2) は同じ手順を書く。
段 1((1) の「ならば」)。$x_{(j)}\le c$ とする。並べ替えた列は小さい順なので $x_{(1)}\le x_{(2)}\le\dots\le x_{(j)}$ で、この $j$ 個はどれも $x_{(j)}$ 以下、したがって $c$ 以下である。よって $c$ 以下のデータは $j$ 個以上ある。
段 2((1) の逆)。$c$ 以下のデータが $j$ 個以上あるとする。仮に $x_{(j)}>c$ だったとすると、$x_{(j)}\le x_{(j+1)}\le\dots\le x_{(n)}$ の $n-j+1$ 個はどれも $c$ より大きい。すると $c$ 以下になれるのは残りの $x_{(1)},\dots,x_{(j-1)}$ の $j-1$ 個だけで、$c$ 以下のデータが $j$ 個以上あることに反する。よって $x_{(j)}\le c$ である。
段 3((2))。$x_{(j)}\ge c$ なら、$x_{(j)},x_{(j+1)},\dots,x_{(n)}$ の $n-j+1$ 個はどれも $c$ 以上である。逆に、$c$ 以上のデータが $n-j+1$ 個以上あるとき、仮に $x_{(j)}< c$ なら $x_{(1)},\dots,x_{(j)}$ の $j$ 個が $c$ 未満で、$c$ 以上になれるのは残りの $n-j$ 個だけになり、仮定に反する。よって $x_{(j)}\ge c$ である。$\square$
ex-qbp-odd のデータ $3,5,6,7,8,8,9,10,12,13,15$ で $j=6$ とする。$x_{(6)}=8$ である。
$n\ge2$ 個のデータ $x_1,\dots,x_n$ のうち 1 つ($x_i$ とする)を任意の実数 $t$ に取り替えたデータを $y_1,\dots,y_n$ とし、小さい順に $y_{(1)}\le\dots\le y_{(n)}$ と並べる。このとき
$$
x_{(j-1)}\le y_{(j)}\le x_{(j+1)}\qquad(2\le j\le n-1)
$$
である。端では $y_{(1)}\le x_{(2)}$、$y_{(n)}\ge x_{(n-1)}$ が成り立つ。
方針:取り替えで変わるのは 1 個だけなので、「$x_{(j+1)}$ 以下の $j+1$ 個」のうち少なくとも $j$ 個は新しいデータにも残る。これと lem-qbp-count を組み合わせる。
段 1(右の不等式 $y_{(j)}\le x_{(j+1)}$、$1\le j\le n-1$)。並べ替えた列の前から $j+1$ 個 $x_{(1)},\dots,x_{(j+1)}$ は、どれも $x_{(j+1)}$ 以下である。取り替えたのは 1 個だけなので、この $j+1$ 個のうち取り替えられたのは多くても 1 個である。したがって少なくとも $j$ 個はそのまま新しいデータ $y_1,\dots,y_n$ に残っている。よって新しいデータの中に、$x_{(j+1)}$ 以下のものが $j$ 個以上ある。lem-qbp-count (1) を新しいデータと $c=x_{(j+1)}$ に使うと、$y_{(j)}\le x_{(j+1)}$ である。
段 2(左の不等式 $y_{(j)}\ge x_{(j-1)}$、$2\le j\le n$)。並べ替えた列の後ろの $x_{(j-1)},x_{(j)},\dots,x_{(n)}$ は $n-j+2$ 個あり、どれも $x_{(j-1)}$ 以上である。取り替えられたのは多くても 1 個なので、少なくとも $n-j+1$ 個は新しいデータに残る。lem-qbp-count (2) を新しいデータと $c=x_{(j-1)}$ に使うと、$y_{(j)}\ge x_{(j-1)}$ である。
段 3(まとめ)。$2\le j\le n-1$ なら段 1・段 2 の両方が使えて、$x_{(j-1)}\le y_{(j)}\le x_{(j+1)}$ である。$j=1$ では段 1 だけが、$j=n$ では段 2 だけが使える。$\square$
$n\ge6$ とする。$n$ 個のデータのうち 1 つを任意の実数に取り替えたとき、取り替えた後の四分位数 $Q_1',Q_2',Q_3'$ は次の範囲にある。rem-qbp-index のとおり、もとの $Q_m$($m=1,2,3$)が
方針:四分位数を作る番号が $n$ だけで決まることを使い、各番号に lem-qbp-interlace を当てはめる。そのために、番号が補題の使える範囲($2$ 以上 $n-1$ 以下)にあることを先に確かめる。
段 1(番号は取り替えの前後で同じ)。取り替えてもデータの個数は $n$ のままである。rem-qbp-index のとおり、$Q_m$ を作る番号は $n$ だけで決まるので、$Q_m=x_{(k)}$ なら $Q_m'=y_{(k)}$、$Q_m=\dfrac{x_{(k)}+x_{(k+1)}}2$ なら $Q_m'=\dfrac{y_{(k)}+y_{(k+1)}}2$ である。
段 2($Q_1$ の番号は $2$ 以上)。$h$ を $\dfrac n2$ 以下の最大の整数とする。$n\ge6$ なので $h\ge3$ である。下半分 $x_{(1)},\dots,x_{(h)}$ の中央値が $Q_1$ である。$h$ が奇数なら $Q_1=x_{\left(\frac{h+1}2\right)}$ で、$h\ge3$ から $\dfrac{h+1}2\ge2$ である。$h$ が偶数なら $h\ge4$ で、$Q_1=\dfrac{x_{(h/2)}+x_{(h/2+1)}}2$、$\dfrac h2\ge2$ である。どちらの場合も、$Q_1$ に使う最小の番号は $2$ 以上である。
段 3($Q_3$ の番号は $n-1$ 以下)。上半分は $x_{(n-h+1)},\dots,x_{(n)}$ の $h$ 個である。$h$ が奇数なら、その真ん中は前から $\dfrac{h+1}2$ 番目で、番号は $n-h+\dfrac{h+1}2=n-\dfrac{h-1}2\le n-1$($h\ge3$ より $\dfrac{h-1}2\ge1$)である。$h$ が偶数なら、使う番号は $n-h+\dfrac h2=n-\dfrac h2$ と $n-\dfrac h2+1$ で、大きいほうは $h\ge4$ より $n-1$ 以下である。$Q_2$ の番号は $Q_1$ と $Q_3$ の番号の間にあるので、これも $2$ 以上 $n-1$ 以下である。
段 4(補題を使う)。段 2・段 3 より、$Q_1,Q_2,Q_3$ に使うすべての番号 $k$ について $2\le k\le n-1$ である。lem-qbp-interlace から $x_{(k-1)}\le y_{(k)}\le x_{(k+1)}$ である。$Q_m=x_{(k)}$ の形なら、これがそのまま主張である。$Q_m=\dfrac{x_{(k)}+x_{(k+1)}}2$ の形なら、番号 $k$ と $k+1$ の両方に補題を使って
$$
x_{(k-1)}\le y_{(k)}\le x_{(k+1)},\qquad x_{(k)}\le y_{(k+1)}\le x_{(k+2)}
$$
を得る。2 つを足して $2$ で割ると、主張の不等式になる。
段 5(平均値)。$x_i$ を $t$ に取り替えると、合計は $t-x_i$ だけ変わるので、新しい平均値は $\bar x+\dfrac{t-x_i}n$ である。どんな実数 $u$ についても $t=x_i+n(u-\bar x)$ と選べば、新しい平均値は $u$ になる。$\square$
$Q_1$ に使う番号が $2$ 以上であることが効いている。$n\le5$ ではこれが崩れ、定理も成り立たない(ex-qbp-small-n)。
ex-qbp-odd のデータ($n=11$)では、rem-qbp-index の表から $Q_1=x_{(3)}$、$Q_2=x_{(6)}$、$Q_3=x_{(9)}$ である。定理の範囲は
$$
x_{(2)}=5\le Q_1'\le x_{(4)}=7,\qquad x_{(5)}=8\le Q_2'\le x_{(7)}=9,\qquad x_{(8)}=10\le Q_3'\le x_{(10)}=13
$$
である。
15 を 60 に取り替えると、平均(×、箱の下)は右に動くが、箱(Q1 から Q3)と中央値の線は動かない。ひげの右端は 15 から 13 になる
ex-qbp-odd の最大値 $15$ を $60$ に取り替える。
平均値が「ずれの 2 乗の和」を最小にする値であることは 平均値と二乗誤差 で、中央値が「ずれの絶対値の和」を最小にする値であることは 中央値と絶対誤差 で示した。2 乗は大きなずれをさらに大きく数えるので、平均は遠くの 1 点に強く引かれる。絶対値はずれを比例でしか数えないので、中央値や四分位数は遠くの 1 点にあまり引かれない。thm-qbp-robust は、この違いを「動く範囲」として正確に述べたものである。
thm-qbp-robust と箱ひげ図について、条件を外すと何が崩れるかを先にまとめる。
| 外した仮定・思い込み | 崩れる主張 | ボックス |
|---|---|---|
| $n\ge6$ | 1 つの値の取り替えで $Q_1$ がいくらでも動く | ex-qbp-small-n |
| 取り替えるのは 1 つだけ | 3 つ取り替えると $Q_3$ がいくらでも動く | ex-qbp-many |
| 「四分位数でちょうど 4 等分される」 | $Q_1$ 以下の割合は $\frac14$ からずれる | ex-qbp-quarter |
| 「箱ひげ図が同じなら分布も同じ」 | 五数要約が同じでも分散が違う | ex-qbp-same-summary |
| 「四分位数の定め方は 1 通り」 | 方式によって値が違う | ex-qbp-conventions |
$n=5$ のデータ $1,2,3,4,5$ を考える。$h=2$ なので、下半分は $1,2$、上半分は $4,5$ で、
$$
Q_1=\frac{1+2}2=1.5,\qquad Q_2=3,\qquad Q_3=\frac{4+5}2=4.5
$$
である。最小値 $1$ を $-100$ に取り替えると、下半分は $-100,2$ になり、$Q_1'=\dfrac{-100+2}2=-49$ である。$-100$ の代わりに $-10^6$ にすれば $Q_1'=\dfrac{-10^6+2}2=-499999$ で、取り替える値を小さくするほど $Q_1'$ はいくらでも小さくなる。
崩れたのは、prf-qbp-robust の段 2 である。$n=5$ では $h=2$ で、$Q_1$ に最小値 $x_{(1)}$ そのものが使われる。番号 $1$ には lem-qbp-interlace の左の不等式がないので、$Q_1'$ を下から押さえるものがない。$n\le5$ ではいつも $h\le2$ で、$Q_1$ に $x_{(1)}$ が使われるので、同じことが起こる。
ex-qbp-odd のデータ($n=11$)では $Q_3=x_{(9)}=12$ である。
rem-qbp-index の表から、$Q_1$ 以下にある番号の割合を見る。
9 個ずつの 2 つのデータ
$$
\text{P}:1,2,3,4,5,6,7,8,9,\qquad \text{Q}:1,\ 2.5,\ 2.5,\ 2.5,\ 5,\ 7.5,\ 7.5,\ 7.5,\ 9
$$
を比べる。どちらも $h=4$ である。
五数要約が同じ 2 つのデータ。点の並び方は違うが、箱ひげ図は一致する
def-qbp-quartile は日本の高校の教科書の方式である。統計ソフトや表計算ソフトは別の方式を使うことが多い。代表的なものを 2 つ挙げる。$0< p<1$ に対し、「$p$ の割合のところの値」を次のように決める。
ex-qbp-odd のデータ($n=11$)で、方式 A の $Q_1$ の番号は $1+10\cdot\frac14=3.5$ なので、
$$
Q_1=x_{(3)}+0.5\bigl(x_{(4)}-x_{(3)}\bigr)=6+0.5\cdot(7-6)=6.5
$$
である。$Q_3$ の番号は $1+10\cdot\frac34=8.5$ なので、$Q_3=x_{(8)}+0.5(x_{(9)}-x_{(8)})=10+0.5\cdot2=11$ である。方式 B では番号が $12\cdot\frac14=3$ と $12\cdot\frac34=9$ でどちらも整数なので、$Q_1=x_{(3)}=6$、$Q_3=x_{(9)}=12$ である。
ex-qbp-even のデータ($n=12$)では、方式 A の番号は $1+11\cdot\frac14=3.75$ と $1+11\cdot\frac34=9.25$ で、
$$
Q_1=4+0.75\cdot(5-4)=4.75,\qquad Q_3=10+0.25\cdot(11-10)=10.25
$$
である。方式 B の番号は $13\cdot\frac14=3.25$ と $13\cdot\frac34=9.75$ で、$Q_1=4+0.25\cdot1=4.25$、$Q_3=10+0.75\cdot1=10.75$ である。まとめると次のようになる。
| データ | 教科書の方式 | 方式 A | 方式 B |
|---|---|---|---|
| ex-qbp-odd($n=11$) | $Q_1=6$、$Q_3=12$ | $Q_1=6.5$、$Q_3=11$ | $Q_1=6$、$Q_3=12$ |
| ex-qbp-even($n=12$) | $Q_1=4.5$、$Q_3=10.5$ | $Q_1=4.75$、$Q_3=10.25$ | $Q_1=4.25$、$Q_3=10.75$ |
中央値はこの 3 つの方式のどれでも $8$ と $7.5$ である。ex-qbp-even の外れ値の判定は、方式 A でも変わらない。四分位範囲は $10.25-4.75=5.5$、上の基準は $10.25+1.5\cdot5.5=18.5$ で、$20$ はこれを超える。
ここからは、四分位数を大学の統計学の言葉で見直す。まず高校数学で解ける問題を 1 つ置き、次にその背後の構造を述べる。
データ $1,3,4,8,9$($n=5$)について、
$$
L(a)=\sum_{x_i\ge a}\frac14(x_i-a)+\sum_{x_i< a}\frac34(a-x_i)
$$
を最小にする $a$ を求めよ。$a$ より大きいデータとの差には重み $\frac14$、$a$ より小さいデータとの差には重み $\frac34$ を掛けて足している。重みがどちらも $\frac12$ なら $L(a)=\frac12\sum|x_i-a|$ で、最小にする $a$ は中央値である(中央値と絶対誤差)。
データの値での $L$ を計算すると、次のようになる。
| $a$ | $1$ | $3$ | $4$ | $8$ | $9$ |
|---|---|---|---|---|---|
| $L(a)$ | $5$ | $4.5$ | $5.25$ | $12.25$ | $15$ |
たとえば $a=3$ では、$3$ 以上の $3,4,8,9$ との差 $0,1,5,6$ の和 $12$ に $\frac14$ を掛けて $3$、$3$ より小さい $1$ との差 $2$ に $\frac34$ を掛けて $1.5$、合わせて $4.5$ である。
方針:$L(a)$ は、データの値で区切った各区間の上で 1 次関数になる。各区間での傾き($a$ が 1 増えたときの $L$ の増え方)を求め、傾きが負から正に変わるところを探す。
段 1(傾きの式)。$a$ がどのデータの値とも等しくないとき、$a$ より小さいデータの個数を $m$ とする。$a$ を少し増やすと、$a$ より大きい $5-m$ 個の各項 $\frac14(x_i-a)$ は $a$ の増え分の $\frac14$ 倍だけ減り、$a$ より小さい $m$ 個の各項 $\frac34(a-x_i)$ は $\frac34$ 倍だけ増える。よって、その区間での傾きは
$$
-\frac14(5-m)+\frac34m=m-\frac54
$$
である。
段 2(傾きの符号)。$a<1$ では $m=0$ で傾きは $-\frac54$、$1< a<3$ では $m=1$ で傾きは $-\frac14$、$3< a<4$ では $m=2$ で傾きは $\frac34$、それより右では $m\ge3$ で傾きはさらに大きく、正である。
段 3(結論)。$L(a)$ は $a$ について連続で(各項が連続なので)、$a<3$ では傾きが負なので減り、$a>3$ では傾きが正なので増える。よって $L(a)$ は $a=3$ で最小になり、最小値は表のとおり $L(3)=4.5$ である。$3$ は小さいほうから $2$ 番目の値で、$\frac14\cdot5=1.25$ を切り上げた番号にあたる。$\square$
段 1 の傾き $m-\frac54$ は、$m-\tau n$($\tau=\frac14$、$n=5$)の形をしている。一般に $0<\tau<1$ に対し
$$
\rho_\tau(u)=\begin{cases}\tau u&(u\ge0)\\(\tau-1)u&(u<0)\end{cases},\qquad L_\tau(a)=\sum_{i=1}^n\rho_\tau(x_i-a)
$$
とおくと、同じ計算で傾きは「$a$ より小さいデータの個数 $-\tau n$」になる。したがって $\tau n$ が整数でないとき、$L_\tau$ を最小にする $a$ は $x_{(k)}$($k$ は $\tau n$ を切り上げた整数)である。$\tau n$ が整数 $k$ のときは、$x_{(k)}$ から $x_{(k+1)}$ までの区間で傾きが $0$ になり、その区間のどの点でも最小になる。$\rho_\tau$ をチェック関数(pinball loss)といい、$\tau=\frac12$ が中央値、$\tau=\frac14,\frac34$ が四分位数にあたる。
ex-qbp-many のように、「データのうち何個を取り替えれば値をいくらでも大きく(小さく)できるか」の最小の個数を $n$ で割った割合を、有限標本の ブレークダウン点 という。ブレークダウン点の考え方は Ham71 が導入した(ここで使った有限標本の形は、その後に定められたものである)。ex-qbp-odd の $n=11$ では
| 値 | 平均値 | $Q_1=x_{(3)}$ | $Q_2=x_{(6)}$ | $Q_3=x_{(9)}$ |
|---|---|---|---|---|
| いくらでも動かすのに要る取り替えの個数 | $1$ | $3$ | $6$ | $3$ |
| 割合 | $\frac1{11}$ | $\frac3{11}$ | $\frac6{11}$ | $\frac3{11}$ |
である。$Q_1=x_{(3)}$ を小さくするには $x_{(1)},x_{(2)},x_{(3)}$ の 3 個を、大きくするには $x_{(3)}$ から $x_{(11)}$ までの 9 個を取り替える必要があり、少ないほうの 3 個が表の数である。$n$ が大きくなると、平均値の割合は $0$ に、中央値は約 $\frac12$ に、四分位数は約 $\frac14$ に近づく。thm-qbp-robust は「$n\ge6$ なら 1 個の取り替えでは足りない」ことを示している。
Mathpediaは寄付と、参考文献の書籍リンク(Amazonアソシエイト)の紹介料で運営されています。 支援について / 寄付する