中心極限定理(高校数学)

同義語:central limit theorem (high school mathematics)

概要

中心極限定理(central limit theorem)とは、独立で同じ分布に従い、平均 $\mu$ と分散 $\sigma^2>0$ をもつ確率変数の和 $S_n$ について、標準化した $(S_n-n\mu)/(\sigma\sqrt n)$ が区間に入る確率が、$n\to\infty$ で標準正規分布の確率に近づくという定理である。和の平均は $n\mu$、分散は $n\sigma^2$ であり、さいころの目の和や一様乱数の和の分布は項の数が増えると正規分布の形に近づく。定理は極限を述べるだけで、何個で十分かは保証しない。独立でないとき、分散が有限でない Cauchy 分布、1 つの項が全体を支配するときは成り立たない。

$$\newcommand{C}[0]{\mathbb{C}} \newcommand{div}[0]{\mathbin{÷}} \newcommand{N}[0]{\mathbb{N}} \newcommand{Q}[0]{\mathbb{Q}} \newcommand{R}[0]{\mathbb{R}} \newcommand{Z}[0]{\mathbb{Z}} $$

前提知識: 正規分布(高校数学), 標本平均の分散, 確率変数の期待値と分散, 確率密度関数と連続型確率変数

高校での出発点:さいころの目の和の形

数学 B の「統計的な推測」では、標本の大きさ $n$ が大きいとき、標本平均 $\bar X$ の分布を正規分布で近似して、母平均を推定したり検定したりする(区間推定(高校数学)、仮説検定(高校数学))。母集団の分布が正規分布でなくても、この近似を使ってよいとされる。その根拠が 中心極限定理 である。
この定理の証明は高校の範囲を超えるので、本記事では 証明しない。その代わりに、定理が何を主張し、何を主張しないかをはっきりさせ、高校の道具で計算できる例と、計算機のシミュレーションで確かめる。まず、さいころの目の和の分布を数えてみる。

さいころ 2 個の目の和

さいころを 2 個振ったときの目の和 $S_2$ は $2$ から $12$ までの値をとる。$6\times6=36$ 通りの出方のうち、和が $s$ になるものの数は次のとおりである。

和 $s$$2$$3$$4$$5$$6$$7$$8$$9$$10$$11$$12$
通り数$1$$2$$3$$4$$5$$6$$5$$4$$3$$2$$1$

1 個のときは $1$ から $6$ がどれも $\frac16$ の平らな分布だったが、2 個の和は $7$ を頂上とする三角形の形になる。

さいころ 3 個の目の和

3 個の和 $S_3$ は $3$ から $18$ までの値をとる。$6^3=216$ 通りのうち、和が $s$ になるものの数は、$s=3,4,\dots,18$ の順に
$$ 1,\ 3,\ 6,\ 10,\ 15,\ 21,\ 25,\ 27,\ 27,\ 25,\ 21,\ 15,\ 10,\ 6,\ 3,\ 1 $$
である(計算は prop-clt-convolution の方法による)。たとえば和が $10$ になるのは $27$ 通りで、確率は $\frac{27}{216}=0.125$ である。三角形の角がとれて、なめらかな山の形に近づいている。

さいころ 1 個・2 個・5 個・30 個の目の和の正確な分布を標準化し、棒の面積が確率になるように描いて、標準正規分布の密度(赤)と重ねた図。個数が増えるほど棒の上の辺が赤い曲線に近づくことを見る。 さいころ 1 個・2 個・5 個・30 個の目の和の正確な分布を標準化し、棒の面積が確率になるように描いて、標準正規分布の密度(赤)と重ねた図。個数が増えるほど棒の上の辺が赤い曲線に近づくことを見る。
図 1 は、さいころ $1$ 個・$2$ 個・$5$ 個・$30$ 個の和の分布を、平均が $0$、標準偏差が $1$ になるように目盛りを直して(標準化して)描いたものである。$1$ 個のときの平らな分布が、個数を増やすと釣鐘の形の 正規分布 の曲線に近づいていく。元の分布が平らでも、偏っていても、同じことが起こる、というのが中心極限定理の主張である。
ここで次の問いが出てくる。

  1. 和の平均と標準偏差は、個数 $n$ とともにどう変わるのか。→ prop-clt-mean-var
  2. 「正規分布に近づく」とは、正確には何が何に近づくことなのか。→ thm-clt-main
  3. 中心極限定理は何を保証し、何を保証しないのか。→ rem-clt-scope
  4. 高校の道具で、どこまで確かめられるのか。→ prop-clt-convolution、prop-clt-uniform3、ex-clt-simulation
  5. どんな場合に成り立たないのか。→ ex-clt-counter-same、ex-clt-counter-cauchy、ex-clt-counter-dominant
    高校の計算この記事での見方ボックス
    標本平均の平均 $\mu$、分散 $\frac{\sigma^2}n$和を標準化した $Z_n$ は平均 $0$、分散 $1$prop-clt-mean-var
    $\bar X$ を正規分布 $N\bigl(\mu,\frac{\sigma^2}n\bigr)$ で近似する$Z_n$ の区間の確率が標準正規分布の値に近づくthm-clt-main、cor-clt-mean
    二項分布の正規近似1 回の結果が $0$ か $1$ の場合二項分布から正規分布へ
    さいころの目の和を数える畳み込みprop-clt-convolution

和の平均と分散

さいころを $n$ 個振る、くじを $n$ 回引く、母集団から $n$ 個を復元抽出する、といった場面を、同じ形の確率変数の列として扱う。

独立で同じ分布に従う確率変数と標準化した和

確率変数 $X_1,X_2,\dots,X_n$ が次の 2 つを満たすとき、独立で同じ分布に従う という。
(R1) どの $X_i$ も同じ確率分布に従う。
(R1) $X_1,\dots,X_n$ は独立である。値がとびとびの場合は、どの値 $x_1,\dots,x_n$ についても $P(X_1=x_1,\ \dots,\ X_n=x_n)=P(X_1=x_1)\cdots P(X_n=x_n)$ が成り立つことをいう。
共通の平均を $\mu$、分散を $\sigma^2$($\sigma>0$)とする。和 $S_n=X_1+\cdots+X_n$ と標本平均 $\bar X=\frac{S_n}n$ に対して
$$ Z_n:=\frac{S_n-n\mu}{\sigma\sqrt n}=\frac{\bar X-\mu}{\sigma/\sqrt n} $$
を 標準化した和 という。

2 つの式が同じであることは、分子と分母を $n$ で割ると分かる:$\frac{S_n-n\mu}{\sigma\sqrt n}=\frac{(S_n-n\mu)/n}{\sigma\sqrt n/n}=\frac{\bar X-\mu}{\sigma/\sqrt n}$。和で考えても標本平均で考えても、標準化すれば同じものになる。

和の平均と分散

def-clt-iid の状況で
$$ E(S_n)=n\mu,\qquad V(S_n)=n\sigma^2,\qquad E(Z_n)=0,\qquad V(Z_n)=1 $$
である。和の標準偏差は $\sigma\sqrt n$、標本平均の標準偏差は $\frac{\sigma}{\sqrt n}$ である。

期待値の線形性と独立な和の分散

方針:和の期待値は線形性で、和の分散は独立性で求め、標準化は 1 次式の変換の公式で扱う。
段 1(和の期待値)。期待値の線形性により $E(S_n)=E(X_1)+\cdots+E(X_n)=n\mu$ である。
段 2(和の分散)。独立な確率変数の和の分散は、分散の和である(標本平均の分散 の主定理の証明。そこでは「どの 2 つも無相関」だけを使っていて、独立なら無相関である)。よって $V(S_n)=V(X_1)+\cdots+V(X_n)=n\sigma^2$ である。
段 3(標準化)。$Z_n=aS_n+b$、$a=\frac1{\sigma\sqrt n}$、$b=-\frac{n\mu}{\sigma\sqrt n}$ と書ける。1 次式の変換の公式 $E(aX+b)=aE(X)+b$、$V(aX+b)=a^2V(X)$(確率変数の期待値と分散)から
$$ E(Z_n)=\frac{n\mu}{\sigma\sqrt n}-\frac{n\mu}{\sigma\sqrt n}=0,\qquad V(Z_n)=\frac{1}{\sigma^2n}\cdot n\sigma^2=1 $$
である。標準偏差は分散の正の平方根なので、和は $\sqrt{n\sigma^2}=\sigma\sqrt n$、標本平均は $\frac{\sigma\sqrt n}{n}=\frac{\sigma}{\sqrt n}$ である。$\square$

さいころの目の和の平均と標準偏差

さいころ 1 個の目は $\mu=\frac72$、$\sigma^2=\frac{35}{12}$ である(確率変数の期待値と分散)。$n$ 個の和は平均 $\frac72n$、標準偏差 $\sqrt{\frac{35}{12}n}$ で

個数 $n$$1$$2$$5$$30$
和の平均$3.5$$7$$17.5$$105$
和の標準偏差$1.708$$2.415$$3.819$$9.354$
平均 $\pm$ 標準偏差に入る確率(正確な値)$0.6667$$0.6667$$0.6960$$0.6887$

となる。最後の行は、和が「平均 $\pm$ 標準偏差」の範囲に入る確率を、すべての出方を数えて求めたものである(計算機による)。正規分布ならこの確率は $0.6827$ である(正規分布(高校数学))。$n=30$ ではかなり近いが、ぴったり同じにはならない。和がとびとびの値しかとらないので、範囲の端にどの値が入るかで確率が少し上下するからである。

prop-clt-mean-var は、分布の 中心と幅 について述べている。和の平均と分散は、元の分布の平均と分散だけで決まる。しかし、これだけでは和の分布の 形 は分からない。形について述べるのが次の定理である。

主定理:中心極限定理(証明しない)

標準正規分布の密度を $\varphi(x)=\frac1{\sqrt{2\pi}}e^{-x^2/2}$ とし、正規分布表の値を $u(z)=\int_0^z\varphi(x)\,dx$($z\ge0$)とする(正規分布(高校数学))。

中心極限定理

$X_1,X_2,X_3,\dots$ は独立で同じ分布に従う確率変数で、その分布はとびとびの値をとるものか、密度関数をもつものとする。共通の平均 $\mu$ と分散 $\sigma^2$ が存在し、$\sigma^2>0$ であるとする。$Z_n=\dfrac{S_n-n\mu}{\sigma\sqrt n}$(def-clt-iid)とすると、どの実数 $a< b$ についても
$$ \lim_{n\to\infty}P(a\le Z_n\le b)=\int_a^b\varphi(x)\,dx $$
が成り立つ。

言葉で言えば、「分散が有限な同じ分布の独立な確率変数を $n$ 個足して標準化すると、区間に入る確率は、$n$ を大きくすると標準正規分布の確率に近づく」ということである。元の分布が何であっても、行き先はいつも同じ標準正規分布である。

この定理の証明について

本記事ではこの定理を証明しない。とびとびの値の場合は GS06 Theorem 9.4、密度をもつ場合は Theorem 9.6 に主張があり、証明の概略は同書 §10.3 にある(値の範囲が有限の区間に入る場合)。一般の場合の証明には、大学の確率論の道具(特性関数とその収束についての定理)が必要になる。その方針は rem-clt-mgf で紹介する。
高校で扱える範囲で証明がついているのは、1 回ごとの結果が $0$ か $1$ の場合(二項分布)で、de Moivre–Laplace の定理として 二項分布から正規分布へ で Stirling の公式から証明している。

thm-clt-main を標本平均の言葉に直すと、区間推定・仮説検定で使う形になる。

標本平均の正規近似

thm-clt-main の仮定のもとで、$c>0$ について
$$ \lim_{n\to\infty}P\Bigl(\mu-c\,\frac{\sigma}{\sqrt n}\le\bar X\le\mu+c\,\frac{\sigma}{\sqrt n}\Bigr)=\int_{-c}^{c}\varphi(x)\,dx $$
である。特に $c=1.96$ なら右辺は $0.95$ である。

同じ事象を標準化した和で書く

$\sigma>0$ なので、不等式 $\mu-c\frac{\sigma}{\sqrt n}\le\bar X\le\mu+c\frac{\sigma}{\sqrt n}$ の各辺から $\mu$ を引いて $\frac{\sigma}{\sqrt n}$ で割っても向きは変わらず、$-c\le\frac{\bar X-\mu}{\sigma/\sqrt n}\le c$ と同じ事象になる。def-clt-iid の式から、真ん中は $Z_n$ である。よって左辺の確率は $P(-c\le Z_n\le c)$ で、thm-clt-main で $a=-c$、$b=c$ とすればよい。$c=1.96$ のときの値 $2u(1.96)=0.95$ は 正規分布(高校数学) の正規分布表による。$\square$

さいころ 30 個の目の和

さいころを $30$ 個振った和 $S_{30}$ は、平均 $105$、標準偏差 $\sqrt{87.5}=9.354$ である(ex-clt-dice-mean-var)。$6^{30}$ 通りすべてを数えた正確な確率(prop-clt-convolution の方法、計算機による)と、正規分布による近似を比べる。和は整数の値しかとらないので、区間の端を $0.5$ ずつ広げる 連続補正 をした近似も並べる(二項分布から正規分布へ)。

確率正確な値正規近似(補正なし)正規近似(連続補正)
$P(95\le S_{30}\le115)$$0.7371$$0.7150$$0.7383$
$P(S_{30}\ge120)$$0.0607$—$0.0606$

連続補正の近似は、たとえば $P(S_{30}\ge120)\approx P\bigl(Z\ge\frac{119.5-105}{9.354}\bigr)=P(Z\ge1.550)$ として求めた。$n=30$ でも、連続補正の近似と正確な値の差は $0.002$ 未満である。

中心極限定理は極限についての定理なので、使うときは何を保証しているかを確かめておく必要がある。

中心極限定理が主張すること・主張しないこと
主張すること主張しないこと
近づくもの標準化した和 $Z_n$ の、区間に入る確率標準化しない和 $S_n$ の分布($S_n$ の標準偏差 $\sigma\sqrt n$ は限りなく大きくなる)
元の分布分散が有限なら、どんな分布でもよい分散が有限でない分布(ex-clt-counter-cauchy)
独立性独立で同じ分布独立でない場合(ex-clt-counter-same)
$n$ の大きさ$n\to\infty$ の極限何個あれば十分か。「$n\ge30$ なら十分」などは経験による目安で、定理ではない
1 点の確率—$P(S_n=k)$ そのものが $\frac{1}{\sigma\sqrt n}\varphi\bigl(\frac{k-n\mu}{\sigma\sqrt n}\bigr)$ に近いこと(とる値の差の最大公約数が $1$ などの条件がいる別の定理。GS06 Theorem 9.3)
まれな事象—裾の小さな確率の比が $1$ に近いこと(二項分布から正規分布へ の裾の反例)

特に、極限の定理から「$n=30$ ならこの誤差以下」という保証は出てこない。どれくらいの $n$ で近似がよくなるかは、元の分布の形で大きく変わる(ex-clt-simulation)。

高校の道具で確かめる 1:さいころの和を正確に数える

ex-clt-dice3 や ex-clt-dice30 の正確な確率は、次の漸化式で $n=1,2,3,\dots$ と順に求められる。

和の分布の漸化式(畳み込み)

$X_1,X_2,\dots$ をさいころの目とし、独立とする。$S_n=X_1+\cdots+X_n$ について、どの整数 $s$ についても
$$ P(S_{n+1}=s)=\sum_{j=1}^{6}\frac16\,P(S_n=s-j) $$
が成り立つ($P(S_n=t)$ は、$t$ が $S_n$ のとりうる値でなければ $0$ とする)。$6^n$ 通りのうち和が $t$ になる通り数を $N_n(t)$ と書けば、$N_{n+1}(s)=N_n(s-1)+N_n(s-2)+\cdots+N_n(s-6)$ である。

最後のさいころの目で場合分けする

方針:$S_{n+1}=S_n+X_{n+1}$ なので、最後の目 $X_{n+1}=j$ で場合分けし、独立性で確率を積に分ける。
段 1(場合分け)。$S_{n+1}=s$ となるのは、ある $j\in\{1,\dots,6\}$ について「$X_{n+1}=j$ かつ $S_n=s-j$」となるときで、$j$ が違えば同時には起こらない。よって
$$ P(S_{n+1}=s)=\sum_{j=1}^{6}P(S_n=s-j,\ X_{n+1}=j) $$
である。
段 2(積に分ける)。事象「$S_n=t$ かつ $X_{n+1}=j$」は、和が $t$ になる目の組 $(x_1,\dots,x_n)$ のそれぞれについての事象「$X_1=x_1,\dots,X_n=x_n,\ X_{n+1}=j$」を、重ならないように合わせたものである。独立性(def-clt-iid の (ii))により、それぞれの確率は $P(X_1=x_1)\cdots P(X_n=x_n)\cdot P(X_{n+1}=j)$ である。これを和が $t$ になる組すべてについて足すと、$P(X_{n+1}=j)=\frac16$ をくくり出せて、残りの和は(同じく独立性により)$P(S_n=t)$ である。よって $P(S_n=t,\ X_{n+1}=j)=\frac16P(S_n=t)$ である。
段 3(まとめ)。段 2 を段 1 に代入すると主張の式になる。両辺に $6^{n+1}$ を掛けると、$6^{n+1}P(S_{n+1}=s)=N_{n+1}(s)$、$6^nP(S_n=t)=N_n(t)$ なので、通り数の式になる。$\square$

2 個の和から 3 個の和を求める

ex-clt-dice2 の通り数 $N_2(2),\dots,N_2(12)=1,2,3,4,5,6,5,4,3,2,1$ から、prop-clt-convolution で $N_3$ を求める。

  1. $N_3(5)=N_2(4)+N_2(3)+N_2(2)+N_2(1)+N_2(0)+N_2(-1)=3+2+1+0+0+0=6$。
  2. $N_3(10)=N_2(9)+N_2(8)+N_2(7)+N_2(6)+N_2(5)+N_2(4)=4+5+6+5+4+3=\boxed{27}$。
    $N_3(s)$ は、$N_2$ の表の上で「連続する 6 個」を足したものになっている。6 個ずつ足す操作をくり返すたびに、角がならされて山がなめらかになる。これが ex-clt-dice3 の数の列の出どころである。

この漸化式は、多項式 $(x+x^2+\cdots+x^6)^n$ を展開したときの $x^s$ の係数が $N_n(s)$ になる、ということと同じである(1 個増やすたびに $x+x^2+\cdots+x^6$ を掛けるので)。和が $s$ になる組を集める計算を 畳み込み といい、掛け算の筆算で同じ桁の積を集めるのと同じ形をしている(掛け算の筆算と畳み込み、母関数:数列を関数として扱う)。この計算を $30$ 回くり返して、図 1 と ex-clt-dice30 の正確な値を得た。

高校の道具で確かめる 2:一様乱数の和の密度

次に、密度関数をもつ場合を見る。$0$ から $1$ の数をどこも同じ出やすさで選ぶ確率変数(一様分布)を $U$ とする(確率密度関数と連続型確率変数)。平均は $\frac12$、分散は $\frac1{12}$ である。独立な $U_1,U_2$ について、点 $(U_1,U_2)$ が一辺 $1$ の正方形の中の図形に入る確率はその面積に等しく、3 個なら立方体の中の図形に入る確率はその体積に等しい。これを計算の出発点にする。

一様乱数 2 個の和の密度

$U_1,U_2$ を独立な $[0,1]$ 上の一様分布とすると、$S=U_1+U_2$ の分布関数 $F_2(t)=P(S\le t)$ と密度 $f_2(t)=F_2'(t)$ は
$$ F_2(t)=\begin{cases}\dfrac{t^2}{2}&(0\le t\le1)\\[2mm]1-\dfrac{(2-t)^2}{2}&(1\le t\le2)\end{cases},\qquad f_2(t)=\begin{cases}t&(0\le t\le1)\\ 2-t&(1\le t\le2)\end{cases} $$
である($t<0$ で $F_2=0$、$t>2$ で $F_2=1$)。密度のグラフは三角形である。

正方形の中の三角形の面積

要点:「$S\le t$」は、点 $(U_1,U_2)$ が正方形の中で直線 $x+y=t$ の下側にあることなので、$F_2(t)$ はその部分の面積である。$0\le t\le1$ では左下の直角二等辺三角形、$1\le t\le2$ では正方形から右上の直角二等辺三角形を除いた部分になる。

詳しい証明を開く

段 1($0\le t\le1$)。正方形の中で $x+y\le t$ の部分は、直角をはさむ 2 辺が $t$ の直角二等辺三角形なので、面積は $\frac{t^2}2$ である。

段 2($1\le t\le2$)。正方形の中で $x+y>t$ の部分は、右上の角にある直角をはさむ 2 辺が $2-t$ の直角二等辺三角形なので、面積は $\frac{(2-t)^2}2$ である。よって $F_2(t)=1-\frac{(2-t)^2}2$ である。

段 3(微分)。$\bigl(\frac{t^2}2\bigr)'=t$、$\bigl(1-\frac{(2-t)^2}2\bigr)'=-\frac{2(2-t)\cdot(-1)}{2}=2-t$ である。$\square$

一様乱数 3 個の和の密度

$U_1,U_2,U_3$ を独立な $[0,1]$ 上の一様分布とすると、$S=U_1+U_2+U_3$ の分布関数 $F_3$ と密度 $f_3$ は
$$ F_3(t)=\begin{cases}\dfrac{t^3}{6}&(0\le t\le1)\\[2mm]\dfrac{t^3}{6}-\dfrac{3(t-1)^3}{6}&(1\le t\le2)\\[2mm]1-\dfrac{(3-t)^3}{6}&(2\le t\le3)\end{cases},\qquad f_3(t)=\begin{cases}\dfrac{t^2}{2}&(0\le t\le1)\\[2mm]\dfrac{-2t^2+6t-3}{2}&(1\le t\le2)\\[2mm]\dfrac{(3-t)^2}{2}&(2\le t\le3)\end{cases} $$
である。$f_3$ は 3 つの放物線をつないだ形で、$t=1$、$t=2$ でなめらかにつながる。

立方体から三角錐を切り取る

要点:$F_3(t)$ は、立方体 $0\le x,y,z\le1$ のうち $x+y+z\le t$ の部分の体積である。$x,y,z\ge0$、$x+y+z\le a$ で表される三角錐(3 つの辺が長さ $a$ で直交する)の体積 $\frac13\cdot\frac{a^2}2\cdot a=\frac{a^3}6$ を使う。$0\le t\le1$ ではこの三角錐そのもの($a=t$)、$1\le t\le2$ では三角錐から立方体をはみ出す 3 つの小さな三角錐($a=t-1$)を除いたもの、$2\le t\le3$ は立方体の対称性で $0\le t\le1$ に帰着する。最後に微分して $f_3$ を得る。

詳しい証明を開く

段 1($0\le t\le1$)。$x,y,z\ge0$、$x+y+z\le t$ なら、どの座標も $t$ 以下で、$t\le1$ なので、この三角錐は立方体に入っている。よって $F_3(t)=\frac{t^3}6$ である。

段 2($1\le t\le2$)。三角錐 $x,y,z\ge0$、$x+y+z\le t$(体積 $\frac{t^3}6$)から、立方体からはみ出す部分を除く。はみ出すのは $x>1$、$y>1$、$z>1$ のどれかを満たす部分である。2 つの座標が同時に $1$ を超えると和が $2\ge t$ を超えるので、この 3 つの部分は重ならない。$x>1$ の部分は $x'=x-1$ とおくと $x',y,z\ge0$、$x'+y+z\le t-1$ で、辺の長さ $t-1$ の三角錐(体積 $\frac{(t-1)^3}6$)である($t-1\le1$ なので、この中では $y,z\le1$ も満たされる)。$y>1$、$z>1$ の部分も同じなので、$F_3(t)=\frac{t^3}6-3\cdot\frac{(t-1)^3}6$ である。

段 3($2\le t\le3$)。$(x,y,z)$ を $(1-x,1-y,1-z)$ に移すと、立方体は自分自身に移り、体積は変わらない。$x+y+z>t$ の部分は $x+y+z<3-t$ の部分に移り、$3-t\le1$ なので段 1 からその体積は $\frac{(3-t)^3}6$ である。よって $F_3(t)=1-\frac{(3-t)^3}6$ である。

段 4(微分)。$\bigl(\frac{t^3}6\bigr)'=\frac{t^2}2$、$\bigl(\frac{t^3}6-\frac{(t-1)^3}2\bigr)'=\frac{t^2}2-\frac{3(t-1)^2}2=\frac{t^2-3t^2+6t-3}{2}=\frac{-2t^2+6t-3}2$、$\bigl(1-\frac{(3-t)^3}6\bigr)'=\frac{(3-t)^2}2$ である。$t=1$ では $\frac{1}{2}$ と $\frac{-2+6-3}2=\frac12$、$t=2$ では $\frac{-8+12-3}{2}=\frac12$ と $\frac12$ で、値がつながっている。$\square$

0 から 1 の一様乱数 1 個・2 個・3 個の和の密度を標準化して、標準正規分布の密度(破線)と重ねた図。長方形が三角形になり、3 個では放物線をつないだ形になって、正規分布の曲線にかなり近づくことを見る。 0 から 1 の一様乱数 1 個・2 個・3 個の和の密度を標準化して、標準正規分布の密度(破線)と重ねた図。長方形が三角形になり、3 個では放物線をつないだ形になって、正規分布の曲線にかなり近づくことを見る。

3 個の和と正規分布を比べる

$S=U_1+U_2+U_3$ は平均 $\frac32$、分散 $3\times\frac1{12}=\frac14$、標準偏差 $\frac12$ である(prop-clt-mean-var)。

  1. 平均 $\pm$ 標準偏差の範囲に入る確率は、prop-clt-uniform3 から $P(1\le S\le2)=F_3(2)-F_3(1)=\bigl(\frac86-\frac36\bigr)-\frac16=\frac46=\frac23=0.6667$ である。正規分布の $0.6827$ に近い。
  2. 密度の最大値は $f_3\bigl(\frac32\bigr)=\frac{-2\cdot\frac94+9-3}{2}=\frac{-\frac92+6}{2}=\frac34=0.75$ で、平均 $\frac32$、標準偏差 $\frac12$ の正規分布の密度の最大値 $\frac{1}{\sqrt{2\pi}\cdot\frac12}=0.798$ に近い。
  3. ただし $S$ は $0$ から $3$ の外の値をとらない。平均から標準偏差の $3$ 倍より遠い値($S<0$ または $S>3$)の確率は $0$ で、正規分布の $0.0027$ とは違う。裾まで一致するわけではない。

図 2 のように、平らな長方形の分布でも、3 個足すだけで正規分布の曲線にかなり近い形になる。$[0,1]$ の一様乱数を $12$ 個足して $6$ を引くと、平均 $0$、分散 $12\times\frac1{12}=1$ になるので、正規分布に近い乱数を一様乱数から作る簡単な方法になる(正規分布そのものではない。一様乱数から試行を作る方法は 乱数とシミュレーション で扱う)。2 個の和・$n$ 個の和の密度は GS06 Example 7.3、Example 7.9 にもある。

高校の道具で確かめる 3:シミュレーション

さいころや一様分布は左右対称なので、正規分布に早く近づく。左右対称でない分布では、どうなるだろうか。すべての場合を数えるのが大変なときは、計算機の乱数で試行を何度もくり返し、結果のヒストグラムを描いて確かめる(乱数の作り方と精度は 乱数とシミュレーション で扱う)。

くじの賞金の合計のシミュレーション

1 回引くと、確率 $0.7$ で $0$ 円、$0.2$ で $100$ 円、$0.1$ で $1000$ 円が当たるくじを考える。1 回の賞金 $X$ は
$$ \mu=0\times0.7+100\times0.2+1000\times0.1=120,\qquad E(X^2)=100^2\times0.2+1000^2\times0.1=102000 $$
なので、分散 $\sigma^2=102000-120^2=87600$、標準偏差 $\sigma=295.97\ldots$ である。平均 $120$ 円に比べて、ときどき $1000$ 円が当たるので、右に長く偏った分布である。
このくじを $n$ 回引いた合計を標準化した $Z_n$ を、計算機の乱数で $10000$ 回作り、ヒストグラムにした(図 3。乱数の種を固定して作った)。$Z_n$ が区間に入った割合は次のとおりである。

$n$$1$$10$$50$$500$正規分布
$-1\le Z_n\le1$ の割合$0.902$$0.611$$0.680$$0.681$$0.683$
$-1.96\le Z_n\le1.96$ の割合$0.902$$0.940$$0.958$$0.950$$0.950$

$n=10$ や $n=50$ のヒストグラムには、$1000$ 円が何回当たったかで分かれた小さな山が並んでいて、形はまだ正規分布の曲線からずれている。$n=500$ では曲線にほぼ重なる。偏った分布では、さいころよりずっと大きな $n$ が必要になる。

くじ(0 円 70%、100 円 20%、1000 円 10%)を 1 回・10 回・50 回・500 回引いた合計を標準化し、10000 回くり返したヒストグラムと標準正規分布の密度(赤)を重ねた図。偏った分布でも、回数を増やすと曲線に近づくことを見る。 くじ(0 円 70%、100 円 20%、1000 円 10%)を 1 回・10 回・50 回・500 回引いた合計を標準化し、10000 回くり返したヒストグラムと標準正規分布の密度(赤)を重ねた図。偏った分布でも、回数を増やすと曲線に近づくことを見る。
シミュレーションの結果は、乱数を変えると少し変わる。ex-clt-simulation の割合は $10000$ 回の試行から出した値なので、それ自体に $\pm0.01$ 程度のばらつきがある($0.68$ 前後の割合なら、標準偏差は $\sqrt{0.68\times0.32/10000}=0.0047$ で、その 2 倍ほど。$0.95$ 前後なら標準偏差は $0.0022$ で、ばらつきはもっと小さい)。シミュレーションは定理の証明にはならないが、どのくらいの $n$ で近似が使えそうかの感覚を与えてくれる。

大数の法則との比較

中心極限定理は、大数の法則とさいころの平均 の大数の法則とよく並べられる。どちらも標本平均 $\bar X$ についての定理だが、見ているものが違う。

大数の法則中心極限定理
見る量標本平均 $\bar X$標準化した $Z_n=\dfrac{\bar X-\mu}{\sigma/\sqrt n}$
近づく先定数 $\mu$標準正規分布
分かること$\bar X$ が $\mu$ の近くに集まるずれ $\bar X-\mu$ が $\frac{\sigma}{\sqrt n}$ の目盛りでどう散らばるか
仮定(高校の記事での形)独立で同じ分布、分散が有限独立で同じ分布、分散が有限で正
高校数学での証明Chebyshev の不等式で証明できる二項分布の場合だけ(二項分布から正規分布へ)

大数の法則は「ずれが $0$ に近づく」ことを、中心極限定理は「ずれを $\sqrt n$ 倍に拡大して見ると、正規分布の形に落ち着く」ことを述べている。Chebyshev の不等式からは、たとえば「$\bar X$ が $\mu\pm2\frac{\sigma}{\sqrt n}$ に入る確率は $0.75$ 以上」しか言えないが、中心極限定理を使うと、その確率が $n$ が大きいとき約 $0.95$ であることまで分かる。

必要な標本の大きさを見積もる

ex-clt-simulation のくじを $n$ 回引いた賞金の平均 $\bar X$ が、$120\pm20$ 円に入る確率を約 $0.95$ にしたい。cor-clt-mean で $c=1.96$ とすると、$1.96\times\frac{295.97}{\sqrt n}\le20$ となればよく、$\sqrt n\ge\frac{1.96\times295.97}{20}=29.005\ldots$ から $n\ge841.3\ldots$、つまり $n=842$ 回程度である。Chebyshev の不等式で同じ確率 $0.95$ を保証しようとすると、$\frac{\sigma^2}{n\cdot20^2}\le0.05$ から $n\ge4380$ 回が必要になる。
ただし ex-clt-simulation で見たとおり、偏った分布では $n$ が小さいと近似が悪い。$842$ 回は $500$ 回より多いので、ここでは近似が使える範囲と考えてよいが、これは定理が保証する誤差ではなく、シミュレーションから得た目安である。

例と反例

thm-clt-main の仮定を 1 つずつ外すと、結論が崩れる。

外す条件反例成り立たなくなること
独立ex-clt-counter-same:1 個のさいころの目を $n$ 回足す和の分散が $n\sigma^2$、標準化した和が正規分布に近づく
分散が有限ex-clt-counter-cauchy:Cauchy 分布平均をとると散らばりが小さくなる、正規分布に近づく
同じ分布(どの項も全体に比べて小さい)ex-clt-counter-dominant:$X_k=\pm2^k$標準化した和が正規分布に近づく
反例:同じ値を $n$ 回足す

さいころを 1 個だけ振り、出た目 $X_1$ を $n$ 回足す。つまり $X_2=X_3=\cdots=X_n=X_1$ とする。どの $X_i$ もさいころの目の分布に従う((i) は満たす)が、独立ではない。

  1. $S_n=nX_1$ なので $V(S_n)=n^2V(X_1)=\frac{35}{12}n^2$ で、prop-clt-mean-var の $n\sigma^2$ ではない。
  2. def-clt-iid の $Z_n=\frac{S_n-n\mu}{\sigma\sqrt n}=\sqrt n\,\frac{X_1-3.5}{\sigma}$ で、$X_1-3.5$ は $\pm0.5$、$\pm1.5$、$\pm2.5$ のどれかである。$n\ge12$ なら $\frac{\sigma}{\sqrt n}=\frac{1.708\ldots}{\sqrt n}<0.5$ なので、$\lvert Z_n\rvert\le1$ となるのは $\lvert X_1-3.5\rvert<0.5$ のときだけで、そのような目はない。よって $P(-1\le Z_n\le1)=0$ で、$0.6827$ に近づかない。
  3. 本当の標準偏差 $n\sigma$ で割って標準化しても、$\frac{S_n-n\mu}{n\sigma}=\frac{X_1-\mu}{\sigma}$ は $n$ によらず 6 つの値を等しい確率でとる分布のままで、正規分布には近づかない。
    崩れている条件は「独立」である。同じ情報を何度足しても、新しい偶然が加わらないので、分布の形は変わらない。
反例:分散が有限でない Cauchy 分布

密度関数が
$$ f(x)=\frac{1}{\pi(1+x^2)} $$
の分布を Cauchy 分布 という。$\tan^{-1}$ を、$-\frac\pi2<\theta<\frac\pi2$ の範囲で $\tan\theta=x$ となる $\theta$ を返す関数とすると、$x=\tan\theta$ と置換して $\int_{-R}^{R}\frac{dx}{1+x^2}=2\tan^{-1}R\to\pi$ となるので、全体の積分は $1$ である。

  1. 平均が定まらない。$\int_0^R\frac{x}{\pi(1+x^2)}\,dx=\frac{1}{2\pi}\log(1+R^2)$ は $R\to\infty$ で限りなく大きくなるので、$\int_0^\infty x f(x)\,dx$ は収束しない。したがって平均も分散も存在せず、thm-clt-main の仮定を満たさない。
  2. 独立な $n$ 個の Cauchy 分布の平均 $\bar X$ は、ふたたび同じ Cauchy 分布に従うことが知られている(GS06 Example 7.6、Example 8.8。本記事では証明しない)。たとえば $P(-1\le\bar X\le1)=\int_{-1}^1f(x)\,dx=\frac2\pi\tan^{-1}1=\frac12$ は、$n$ をいくら大きくしても $\frac12$ のままである。
  3. 図 4 は、計算機で Cauchy 分布の乱数を作り、$1$ 個の値と $100$ 個の平均をそれぞれ $10000$ 回作ったヒストグラムである(乱数の種を固定した)。$-1\le\bar X\le1$ に入った割合は $n=1$ で $0.503$、$n=100$ で $0.499$ で、平均をとっても散らばりはまったく小さくならない。
    崩れている条件は「分散が有限」である。ときどき非常に大きな値が出て、その 1 つが平均全体を動かしてしまう。大数の法則とさいころの平均 の Cauchy 分布の反例も同じ現象である。
Cauchy 分布の乱数を一様乱数から作る方法を開く

$U$ を $0$ から $1$ の一様乱数とし、$X=\tan\bigl(\pi(U-\tfrac12)\bigr)$ とする。$\tan$ は $-\frac\pi2<\theta<\frac\pi2$ で増加するので、$X\le x$ は $U\le\frac12+\frac1\pi\tan^{-1}x$ と同じで、$P(X\le x)=\frac12+\frac1\pi\tan^{-1}x$ である。これを $x$ で微分すると $\frac{1}{\pi(1+x^2)}$ で、Cauchy 分布の密度になる。図 4 はこの方法で作った。

Cauchy 分布の乱数 1 個と 100 個の平均を、それぞれ 10000 回作ったヒストグラムと Cauchy 分布の密度を重ねた図。平均をとっても分布の形も幅も変わらないことを見る。 Cauchy 分布の乱数 1 個と 100 個の平均を、それぞれ 10000 回作ったヒストグラムと Cauchy 分布の密度を重ねた図。平均をとっても分布の形も幅も変わらないことを見る。

反例:1 つの項が全体を支配する

$\varepsilon_1,\varepsilon_2,\dots$ を、それぞれ確率 $\frac12$ で $1$ か $-1$ をとる独立な確率変数(公平な硬貨の表裏)とし、$X_k=2^k\varepsilon_k$ とする。$X_k$ は独立で、平均 $0$、分散 $4^k$ だが、同じ分布ではない。$S_n=X_1+\cdots+X_n$ とする。
段 1(分散)。独立なので $V(S_n)=4+4^2+\cdots+4^n=\frac{4^{n+1}-4}{3}$ である(等比数列の和)。最後の項の分散 $4^n$ は、全体の $\frac{3\cdot4^n}{4^{n+1}-4}$ で、$n$ が大きいと約 $\frac34$ を占める。
段 2(和の分布)。$b_k=\frac{\varepsilon_k+1}2$ とおくと $b_k$ は $0$ か $1$ で、$\varepsilon_k=2b_k-1$ なので
$$ S_n=\sum_{k=1}^n2^k(2b_k-1)=4\sum_{k=1}^nb_k2^{k-1}-(2^{n+1}-2) $$
である。$m=\sum_{k=1}^nb_k2^{k-1}$ は、$b_n\cdots b_2b_1$ を 2 進法で読んだ数で、$2^n$ 通りの $(b_1,\dots,b_n)$ に $0,1,\dots,2^n-1$ がちょうど 1 つずつ対応する(2 進法の表し方はただ 1 通り)。どの $(b_1,\dots,b_n)$ も確率 $\frac1{2^n}$ なので、$S_n$ は $4m-(2^{n+1}-2)$($m=0,1,\dots,2^n-1$)を等しい確率 $\frac1{2^n}$ でとる。等間隔の値を等しい確率でとる、平らな分布である。
段 3(正規分布に近づかない)。$\lvert S_n\rvert$ の最大値は $2^{n+1}-2$ なので、標準化した和 $\frac{S_n}{\sqrt{V(S_n)}}$ の絶対値は
$$ \frac{2^{n+1}-2}{\sqrt{(4^{n+1}-4)/3}}=\sqrt3\cdot\frac{2^{n+1}-2}{\sqrt{(2^{n+1}-2)(2^{n+1}+2)}}=\sqrt3\sqrt{\frac{2^{n+1}-2}{2^{n+1}+2}}<\sqrt3 $$
以下である。よって、どの $n$ でも標準化した和が $-2$ 以上 $2$ 以下に入る確率は $1$ で、標準正規分布の $2u(2)=0.9544$ に近づかない。実際、標準化した和の分布は区間 $[-\sqrt3,\sqrt3]$ 上の一様分布に近づく(図 5)。
崩れている条件は、「どの項も全体に比べて小さい」ことである。同じ分布なら各項の分散は全体の $\frac1n$ で、$n$ とともに小さくなるが、この例では最後の項が全体の約 $\frac34$ を占め続ける。

X_k = ±2^k(k = 1, …, 10)の和を標準化した正確な分布のヒストグラム。標準正規分布(赤)ではなく、区間 −√3 から √3 の一様分布(緑の破線)に近いことを見る図。 X_k = ±2^k(k = 1, …, 10)の和を標準化した正確な分布のヒストグラム。標準正規分布(赤)ではなく、区間 −√3 から √3 の一様分布(緑の破線)に近いことを見る図。

大学数学で見る

積率母関数による証明の方針

確率変数 $X$ について $M_X(t)=E(e^{tX})$ を 積率母関数 という。標準正規分布では $M(t)=e^{t^2/2}$ である(正規分布(高校数学) で平方完成により計算している)。中心極限定理は、$Z_n$ の積率母関数が $e^{t^2/2}$ に近づくことから、次の方針で証明される。

証明の方針を開く(平均 0、分散 1 の場合)

段 1(積に分かれる)。$Y_i=\frac{X_i-\mu}{\sigma}$ とおくと $Y_i$ は平均 $0$、分散 $1$ で、$Z_n=\frac{Y_1+\cdots+Y_n}{\sqrt n}$ である。独立なら $E(e^{tZ_n})=E\bigl(e^{tY_1/\sqrt n}\bigr)\cdots E\bigl(e^{tY_n/\sqrt n}\bigr)$ なので、$M_{Z_n}(t)=\bigl(M_Y(t/\sqrt n)\bigr)^n$ である。

段 2(2 次の近似)。$e^{s}=1+s+\frac{s^2}{2}+\cdots$ から、$M_Y(s)=E(e^{sY})=1+sE(Y)+\frac{s^2}2E(Y^2)+\cdots=1+\frac{s^2}{2}+R(s)$ と書ける。ここで $R(s)$ は、$s\to0$ のとき $s^2$ より速く $0$ に近づく部分である。

段 3(1 の $\infty$ 乗型の極限)。$s=\frac t{\sqrt n}$ とすると $M_{Z_n}(t)=\bigl(1+\frac{t^2}{2n}+R(\frac{t}{\sqrt n})\bigr)^n$ で、「(底 $-1$)× 指数」は $\frac{t^2}{2}$ に近づくので、1の∞乗型の極限 と同じ考え方で $M_{Z_n}(t)\to e^{t^2/2}$ となる。

段 4(分布の収束へ)。「母関数が近づけば分布も近づく」ことを示す定理を使う。積率母関数は存在しないことがある(Cauchy 分布など)ので、大学では $e^{tX}$ の代わりに $e^{itX}$($i$ は虚数単位)の期待値である 特性関数 を使い、「特性関数が近づけば分布も近づく」という Lévy の連続性定理を使う。段 2 の $R(s)$ の評価と段 4 の定理が大学の内容で、GS06 §10.3 は値が有界な場合に概略を述べている。

Lindeberg の条件

同じ分布でない独立な確率変数の和でも、「どの 1 つの項も、全体の標準偏差に比べて大きくなりすぎない」という条件(Lindeberg の条件)があれば中心極限定理が成り立つことが知られている(本記事では条件の正確な形も証明も扱わない)。ex-clt-counter-dominant は、最後の項が全体の約 $\frac34$ の分散を占めるので、この条件を満たさない例である。測定誤差や身長が正規分布に近いことの説明として「小さな独立な要因がたくさん足し合わさっている」と言われるのは、この形の中心極限定理による(正規分布(高校数学))。

演習

四捨五入の誤差の合計

$48$ 個の数をそれぞれ小数第 1 位で四捨五入して整数にしてから足す。1 個ごとの誤差(四捨五入した値 − もとの値)は $-0.5$ から $0.5$ の一様分布に従い、互いに独立とする。誤差の合計の絶対値が $3$ 以下になる確率を、中心極限定理で近似せよ。正規分布表の値 $u(1.5)=0.4332$ を使ってよい。

解答を開く

1 個の誤差 $E_i$ は、$[0,1]$ の一様分布を $0.5$ だけ左にずらしたものなので、平均 $0$、分散 $\frac1{12}$ である。合計 $T=E_1+\cdots+E_{48}$ は平均 $0$、分散 $\frac{48}{12}=4$、標準偏差 $2$ である(prop-clt-mean-var)。$\lvert T\rvert\le3$ は $\lvert T/2\rvert\le1.5$ と同じなので、thm-clt-main による近似は $P(-1.5\le Z\le1.5)=2u(1.5)=2\times0.4332=0.8664$ である。

和と平均の標準偏差

平均 $50$、標準偏差 $10$ の分布から、独立に $100$ 個の値をとる。

  1. 合計 $S$ の平均と標準偏差、標本平均 $\bar X$ の平均と標準偏差を求めよ。
  2. $\bar X$ が $48$ 以上 $52$ 以下になる確率を、中心極限定理で近似せよ($u(2)=0.4772$)。
解答を開く

1. prop-clt-mean-var から、$S$ は平均 $5000$、標準偏差 $10\sqrt{100}=100$、$\bar X$ は平均 $50$、標準偏差 $\frac{10}{\sqrt{100}}=1$ である。

2. $48\le\bar X\le52$ は $-2\le\frac{\bar X-50}{1}\le2$ と同じなので、cor-clt-mean で $c=2$ として、近似値は $2u(2)=0.9544$ である。

さらに先へ

  • 近似の誤差の大きさについては、Berry–Esseen の定理が $\frac{1}{\sqrt n}$ 程度の上限を与える(二項分布から正規分布へ の「さらに先へ」)。
  • 標本平均を使う 区間推定(高校数学) と 仮説検定(高校数学) は、cor-clt-mean を土台にしている。母標準偏差の代わりに標本から計算した値を使うと、正規分布の代わりに $t$ 分布が現れる(t分布)。
  • 大学では、ベクトルの値をとる確率変数の中心極限定理(多変量正規分布に近づく)や、独立でない場合(Markov 連鎖など)への拡張も扱う(中心極限定理)。

関連項目

参考文献

Mathpediaは寄付と、参考文献の書籍リンク(Amazonアソシエイト)の紹介料で運営されています。 支援について / 寄付する