大数の法則とさいころの平均(law of large numbers and the average of dice)とは、独立な試行の平均が期待値に近づくという大数の法則である。弱大数の法則は、平均 $\mu$ と有限な分散 $\sigma^2$ が共通で、どの 2 つも無相関(たとえば独立)な確率変数の標本平均 $\bar X_n$ について、各 $\varepsilon>0$ で $P(|\bar X_n-\mu|\ge\varepsilon)\le\sigma^2/(n\varepsilon^2)\to0$ となることで、$V[\bar X_n]=\sigma^2/n$ と Chebyshev の不等式で証明される。特に相対頻度は確率に確率収束する。ただし「必ず近づく」のではなく、ずれる確率が $0$ に近づく。平均をもたない Cauchy 分布では成り立たない。
高校では、確率を 2 通りに説明する。
さいころの目 $X$ の期待値は
$$
E[X]=\frac{1+2+3+4+5+6}6=\frac72=3.5
$$
であり、「さいころを何回も投げて目の平均をとると $3.5$ に近づく」と説明される。
さいころを $n$ 回投げたときの目の平均を $\bar X_n$ とし、それが $3.5$ から $0.5$ 以上ずれる確率 $P(|\bar X_n-3.5|\ge0.5)$ を、$6^n$ 通りの目の出方をすべて数えて正確に計算すると次のようになる。
| $n$ | $10$ | $100$ | $1000$ |
|---|---|---|---|
| $P(\lvert\bar X_n-3.5\rvert\ge0.5)$ | $0.410$ | $0.00365$ | $1.5\times10^{-20}$ |
確かに、$n$ が大きいほど平均は $3.5$ の近くに集まる。
しかし次の疑問が残る。
| 高校 | 大学 | ボックス |
|---|---|---|
| 平均が $3.5$ に近づく | 確率収束 | def-lnd-convergence |
| 独立な試行 | 確率変数の独立性 | def-lnd-independent |
| 標本平均の分散 $\frac{\sigma^2}n$ | 無相関な和の分散 | prop-lnd-mean-variance |
| 統計的確率 | Bernoulli の大数の法則 | cor-lnd-bernoulli |
この記事では主に、有限個または可算個の値 $a_1,a_2,\dots$ をとる確率変数(離散型の確率変数)を扱う。$X$ の期待値を
$$
E[X]:=\sum_ia_i\,P(X=a_i)
$$
で定める。ただし値が無限個のときは、$\sum_i|a_i|P(X=a_i)<\infty$(絶対収束)のときに限って期待値が存在するという。$E[X]=\mu$ が存在し、さらに $E[(X-\mu)^2]<\infty$ のとき、$V[X]:=E[(X-\mu)^2]$ を分散という。
次の事実は前提として使う。いずれも高校で扱う事実を、期待値が存在する場合に述べたものである。
離散型確率変数 $X_1,\dots,X_n$ が独立であるとは、それぞれのとりうるすべての値 $a_1,\dots,a_n$ について
$$
P(X_1=a_1,\,\dots,\,X_n=a_n)=P(X_1=a_1)\cdots P(X_n=a_n)
$$
が成り立つことをいう。確率変数の列 $X_1,X_2,\dots$ が独立であるとは、どの $n$ についても $X_1,\dots,X_n$ が独立であることをいう。さいころを何回も投げるときの各回の目は、独立な確率変数の列として表される。
確率変数 $X_1,\dots,X_n$ について
$$
\bar X_n:=\frac{X_1+X_2+\cdots+X_n}n
$$
を標本平均という。
確率変数の列 $Y_1,Y_2,\dots$ と実数 $c$ について、どの $\varepsilon>0$ についても
$$
\lim_{n\to\infty}P\bigl(|Y_n-c|\ge\varepsilon\bigr)=0
$$
が成り立つとき、$Y_n$ は $c$ に確率収束するという。
数列の収束の $\varepsilon$-$N$ による定義は 極限とε-δ で扱う。
確率収束は、「$n$ が大きいとき、$Y_n$ が $c$ から $\varepsilon$ 以上ずれる確率が小さい」という主張である。$Y_n$ の値そのものが $c$ に近いことを保証するものではない。
$Y_n$ が確率 $\frac1n$ で $1$、確率 $1-\frac1n$ で $0$ をとるとする。$0<\varepsilon\le1$ なら $P(|Y_n-0|\ge\varepsilon)=\frac1n\to0$、$\varepsilon>1$ なら $0$ なので、$Y_n$ は $0$ に確率収束する。それでもどの $n$ でも $Y_n=1$ となる確率は正である。
離散型確率変数 $X,Y$ が独立で、$E[X]$、$E[Y]$ が存在するとき、$E[XY]$ も存在して $E[XY]=E[X]\,E[Y]$ である。
$X$ の値を $a_i$、$Y$ の値を $b_j$ とする。独立性から $P(X=a_i,Y=b_j)=P(X=a_i)P(Y=b_j)$ なので、
$$
\sum_{i,j}|a_ib_j|\,P(X=a_i,Y=b_j)=\Bigl(\sum_i|a_i|P(X=a_i)\Bigr)\Bigl(\sum_j|b_j|P(Y=b_j)\Bigr)<\infty
$$
であり、$E[XY]$ は存在する。絶対収束する二重和は項の順序によらないので、同じ計算を絶対値なしで行えば $E[XY]=E[X]E[Y]$ を得る。$\square$
確率変数 $X_1,\dots,X_n$ が、どれも平均 $\mu$、分散 $\sigma^2$ をもち、どの 2 つも無相関、すなわち $i\ne j$ について $E[(X_i-\mu)(X_j-\mu)]=0$ であるとする。このとき
$$
E[\bar X_n]=\mu,\qquad V[\bar X_n]=\frac{\sigma^2}n
$$
である。特に $X_1,\dots,X_n$ が独立なら、どの 2 つも無相関なので、この結論が成り立つ。
線形性から $E[\bar X_n]=\frac1n\sum_iE[X_i]=\mu$ である。$Y_i:=X_i-\mu$ とおくと $\bar X_n-\mu=\frac1n\sum_iY_i$ であり、
$$
V[\bar X_n]=E\Bigl[\Bigl(\frac1n\sum_{i=1}^nY_i\Bigr)^2\Bigr]=\frac1{n^2}\Bigl(\sum_{i=1}^nE[Y_i^2]+\sum_{i\ne j}E[Y_iY_j]\Bigr)=\frac1{n^2}\cdot n\sigma^2=\frac{\sigma^2}n
$$
である。ここで $|Y_iY_j|\le\frac12(Y_i^2+Y_j^2)$ なので $E[Y_iY_j]$ は存在し、仮定によりすべて $0$ である。
$X_1,\dots,X_n$ が独立なら、def-lnd-independent の等式を $X_i,X_j$($i\ne j$)以外の変数のとりうる値すべてについて足し合わせて $P(X_i=a,X_j=b)=P(X_i=a)P(X_j=b)$ を得るので、$X_i$ と $X_j$ は独立である。すると $Y_i$ と $Y_j$ も独立であり($Y_i$ の値は $X_i$ の値から決まるので、def-lnd-independent の等式がそのまま $Y_i,Y_j$ についても成り立つ)、lem-lnd-product により $E[Y_iY_j]=E[Y_i]E[Y_j]=0\cdot0=0$ である。$\square$
和の分散の公式と、独立でなく無相関の仮定で足りる理由は 標本平均の分散 で扱う。
分散が $\frac1n$ 倍になるので、標準偏差は $\frac1{\sqrt n}$ 倍になる。
さいころの目の分散は $E[X^2]-E[X]^2=\frac{91}6-\frac{49}4=\frac{35}{12}$ なので、$n$ 回の平均 $\bar X_n$ の標準偏差は $\sqrt{35/12}/\sqrt n=1.7078\ldots/\sqrt n$ であり、$n=100$ で $0.17$、$n=10000$ で $0.017$ である。
分散が小さいことを、「ずれる確率が小さい」ことに変換するのが次の 2 つの不等式である。
$X$ を $0$ 以上の値だけをとる確率変数とし、$E[X]$ が存在するとする。$a>0$ について
$$
P(X\ge a)\le\frac{E[X]}a
$$
である。
$X$ の値を $a_i\ (\ge0)$ とすると、$a$ 未満の値の項を捨て、残りの項で $a_i\ge a$ を使って
$$
E[X]=\sum_ia_iP(X=a_i)\ge\sum_{i:\ a_i\ge a}a_iP(X=a_i)\ge a\sum_{i:\ a_i\ge a}P(X=a_i)=a\,P(X\ge a)
$$
である。両辺を $a$ で割ればよい。$\square$
同じ証明は、「$X\ge a$ のとき $1$、そうでないとき $0$」という確率変数 $I$ について $aI\le X$ がつねに成り立つことを使い、期待値の単調性で $a\,P(X\ge a)=E[aI]\le E[X]$ と書くこともできる。この形なら、密度をもつ確率変数など一般の確率変数にそのまま通用する。
確率変数 $X$ が平均 $\mu$ と分散 $\sigma^2$ をもつとき、$\varepsilon>0$ について
$$
P\bigl(|X-\mu|\ge\varepsilon\bigr)\le\frac{\sigma^2}{\varepsilon^2}
$$
である。
$|X-\mu|\ge\varepsilon$ と $(X-\mu)^2\ge\varepsilon^2$ は同じ事象である。$0$ 以上の確率変数 $(X-\mu)^2$ に thm-lnd-markov を $a=\varepsilon^2$ で使うと、$P\bigl((X-\mu)^2\ge\varepsilon^2\bigr)\le\frac{E[(X-\mu)^2]}{\varepsilon^2}=\frac{\sigma^2}{\varepsilon^2}$ である。$\square$
2 つの不等式は、一般には改良できない。
$0< t\le1$ とする。
一方、具体的な分布では Chebyshev の不等式はかなり粗い。
ex-lnd-dice-table と比べると、$\varepsilon=0.5$ のときの上界 $\frac{35/12}{n\cdot0.25}=\frac{35}{3n}$ は $n=10,100,1000$ で $1.17,\ 0.117,\ 0.0117$ であり、正確な値 $0.410,\ 0.00365,\ 1.5\times10^{-20}$ よりずっと大きい。それでも、$n\to\infty$ で $0$ に近づくことを示すには十分である。
確率変数の列 $X_1,X_2,\dots$ が、どれも平均 $\mu$ と(有限の)分散 $\sigma^2$ をもち、どの 2 つも無相関であるとする(特に、独立で同じ分布に従い分散をもつ場合はこれにあてはまる)。このとき、すべての $\varepsilon>0$ と $n\ge1$ について
$$
P\bigl(|\bar X_n-\mu|\ge\varepsilon\bigr)\le\frac{\sigma^2}{n\varepsilon^2}
$$
であり、したがって $\bar X_n$ は $\mu$ に確率収束する。
prop-lnd-mean-variance により $\bar X_n$ は平均 $\mu$、分散 $\frac{\sigma^2}n$ をもつ。cor-lnd-chebyshev を $\bar X_n$ に使うと $P(|\bar X_n-\mu|\ge\varepsilon)\le\frac{\sigma^2/n}{\varepsilon^2}$ である。$\varepsilon$ を固定して $n\to\infty$ とすると右辺は $0$ に近づく。$\square$
証明で使ったのは平均と分散だけであり、「どの 2 つも無相関」という仮定は、独立性よりずっと弱い。また、分散が共通でなくても、$V[X_i]\le M$ となる定数 $M$ があれば、同じ証明で $P(|\bar X_n-\mu|\ge\varepsilon)\le\frac M{n\varepsilon^2}$ が得られる。
事象の相対頻度は、次のように標本平均として表せる。
確率 $p$ で起こる事象 $E$ について独立な試行をくり返し、最初の $n$ 回で $E$ が起こる回数を $r_n$ とする。このとき、すべての $\varepsilon>0$ について
$$
P\Bigl(\Bigl|\frac{r_n}n-p\Bigr|\ge\varepsilon\Bigr)\le\frac{p(1-p)}{n\varepsilon^2}\le\frac1{4n\varepsilon^2}
$$
であり、相対頻度 $\frac{r_n}n$ は $p$ に確率収束する。
$i$ 回目に $E$ が起これば $1$、起こらなければ $0$ をとる確率変数を $X_i$ とする。$X_1,X_2,\dots$ は独立で、$E[X_i]=p$、$V[X_i]=E[X_i^2]-p^2=p-p^2=p(1-p)$ である。$\frac{r_n}n=\bar X_n$ なので、thm-lnd-weak から前半を得る。$p(1-p)=\frac14-\bigl(p-\frac12\bigr)^2\le\frac14$ である。$\square$
cor-lnd-bernoulli は、「$E$ の確率が $p$ である」という数学的なモデルのもとで、相対頻度が $p$ に確率収束することを示す。統計的確率で「相対頻度が近づく値を確率とみなす」のは、このモデルが現実の試行によく合っているときに、定理を逆向きに使って $p$ を推定していることにあたる。ただし定理はモデルの内部の主張であり、現実のさいころが「どの目も確率 $\frac16$ で、各回独立」というモデルに従うこと自体を証明するものではない。
cor-lnd-bernoulli の評価から、「相対頻度が $p$ から $0.01$ 以上ずれる確率を $0.05$ 以下にするには何回投げればよいか」に答えられる。$\frac1{4n\cdot0.01^2}\le0.05$ を解いて $n\ge50000$ であり、$p$ がわからなくてもこの回数で足りる。$p=\frac16$ とわかっていれば、$\frac{(1/6)(5/6)}{n\cdot0.01^2}\le0.05$ から $n\ge27778$ である。中心極限定理による正規近似(この記事では証明しない)を使うと、$n\ge\frac{1.96^2\,p(1-p)}{0.01^2}$、すなわち $p=\frac12$ で $n\ge9604$、$p=\frac16$ で $n\ge5336$ が目安になる($p=\frac12$、$n=9604$ で正確な確率を計算すると $P(|\frac{r_n}n-\frac12|<0.01)=0.9511$ である)。Chebyshev の不等式は保証を与えるが、粗い。
高校の統計で、母平均 $\mu$、母分散 $\sigma^2$ の母集団から大きさ $n$ の無作為標本をとると標本平均の分散が $\frac{\sigma^2}n$ になる、と習うのは prop-lnd-mean-variance である(復元抽出の場合)。弱大数の法則は、これに Chebyshev の不等式を組み合わせたものにすぎない。
さいころを $n$ 回投げて全部 6 が出る確率は $6^{-n}>0$ であり、そのとき $\bar X_n=6$ である。どれほど $n$ を大きくしても、$\bar X_n$ が $3.5$ から離れる可能性は $0$ にならない。弱大数の法則が述べるのは、「離れる確率が $0$ に近づく」ことだけである。
また弱大数の法則は、各 $n$ ごとの確率についての主張であり、1 本の無限に続く試行の列で $\bar X_n$ が数列として $\mu$ に収束するかどうかについては、直接には何も言わない。そちらは次に述べる強大数の法則の主題である。
公平な硬貨で最初に 10 回続けて表が出たとする。各回は独立なので、その後の $n$ 回の表の回数の期待値は $\frac n2$ のままであり、「そろそろ裏が出やすい」ということはない。それでも全体の表の割合の期待値 $\frac{10+n/2}{10+n}$ は $n\to\infty$ で $\frac12$ に近づく。最初の偏りは埋め合わされるのではなく、その後の多数の試行で薄められる。
表の割合は $\frac12$ に近づくが、表の回数と $\frac n2$ の差は $0$ に近づかない。実際、差 $r_n-\frac n2$ の分散は $\frac n4$ であり、$n$ とともに大きくなる。次の命題はこれを確率の言葉で述べる。
公平な硬貨を $n$ 回投げたときの表の回数を $r_n$ とする。すべての $k$ について $P(r_n=k)\le\frac1{\sqrt n}$ である。したがって、どの $c>0$ についても
$$
P\Bigl(\Bigl|r_n-\frac n2\Bigr|< c\Bigr)\le\frac{2c+1}{\sqrt n}\longrightarrow0\qquad(n\to\infty)
$$
であり、表の回数と $\frac n2$ の差が $c$ 未満にとどまる確率は $0$ に近づく。
$P(r_n=k)=\binom nk2^{-n}$ であり、$\frac{\binom n{k+1}}{\binom nk}=\frac{n-k}{k+1}$ が $1$ 以上になるのは $k\le\frac{n-1}2$ のときなので、最大は $k=\lfloor\frac n2\rfloor$ でとられる。
$n=2m$ のとき、最大値は
$$
a_m:=\binom{2m}m4^{-m}=\frac{(2m)!}{2^mm!\cdot2^mm!}=\frac{1\cdot3\cdots(2m-1)}{2\cdot4\cdots(2m)}=\prod_{j=1}^m\frac{2j-1}{2j}
$$
である。$(2j-1)(2j+1)<(2j)^2$ より $\frac{2j-1}{2j}<\frac{2j}{2j+1}$ なので
$$
a_m^2<\prod_{j=1}^m\frac{2j-1}{2j}\cdot\frac{2j}{2j+1}=\prod_{j=1}^m\frac{2j-1}{2j+1}=\frac1{2m+1}
$$
であり(最後の積は隣どうしで約分される)、$a_m<\frac1{\sqrt{2m+1}}<\frac1{\sqrt n}$ である。$n=2m+1$ のとき、最大値は $\binom{2m+1}m2^{-(2m+1)}=a_m\cdot\frac{2m+1}{2(m+1)}$ であり($\binom{2m+1}m=\binom{2m}m\frac{2m+1}{m+1}$ による。$m=0$ では $a_0=1$ と読む)、これは $\frac1{\sqrt{2m+1}}\cdot\frac{2m+1}{2m+2}<\frac1{\sqrt{2m+1}}=\frac1{\sqrt n}$ 以下である。
$|k-\frac n2|< c$ を満たす整数 $k$ は、長さ $2c$ の開区間に入る整数なので $2c+1$ 個以下である。それぞれの確率は $\frac1{\sqrt n}$ 以下なので、後半を得る。$\square$
$c=5$ とすると、$P(|r_n-\frac n2|<5)$ の正確な値は $n=100$ で $0.632$、$n=10000$ で $0.0717$ である。表と裏の回数がほぼ同じになる確率は、投げるほど小さくなる。
| 外した仮定 | 崩れる主張 | ボックス |
|---|---|---|
| どの 2 つも無相関 | $V[\bar X_n]=\frac{\sigma^2}n$ と確率収束 | ex-lnd-dependent |
| 平均と分散をもつ | 標本平均の確率収束 | ex-lnd-cauchy |
さいころを $n$ 回投げて 1 の目が出る相対頻度 $\frac{r_n}n$ が $\frac16$ から $0.05$ 以上ずれる確率は、正確に計算すると $n=100,\,1000,\,10000$ で $0.178,\ 2.6\times10^{-5},\ 1.3\times10^{-38}$ である。cor-lnd-bernoulli の上界 $\frac{5/36}{n\cdot0.05^2}$ は $0.556,\ 0.0556,\ 0.00556$ である。
さいころを 1 回だけ投げ、その目を $X_1$ とし、$X_2=X_3=\cdots=X_1$ とする。どの $X_i$ も平均 $3.5$、分散 $\frac{35}{12}$ をもつが、$\bar X_n=X_1$ なので、$P(|\bar X_n-3.5|\ge1)=P(X_1\in\{1,2,5,6\})=\frac23$ はどの $n$ でも変わらず、$\bar X_n$ は $3.5$ に確率収束しない。
破れている条件は「どの 2 つも無相関」である。実際 $E[(X_i-3.5)(X_j-3.5)]=V[X_1]=\frac{35}{12}\ne0$ であり、prop-lnd-mean-variance の $V[\bar X_n]=\frac{\sigma^2}n$ が成り立たず、$V[\bar X_n]=\frac{35}{12}$ のままである。
密度 $f(x)=\frac1{\pi(1+x^2)}$ をもつ確率変数 $X$ の分布を Cauchy 分布という($P(a\le X\le b)=\int_a^bf(x)\,dx$。$\int_{-\infty}^\infty f=\frac1\pi[\arctan x]_{-\infty}^\infty=1$ である)。密度をもつ確率変数の期待値は $\int xf(x)\,dx$ で定め、$\int|x|f(x)\,dx<\infty$ のときに存在するという。ところが
$$
\int_0^R\frac{x}{\pi(1+x^2)}\,dx=\frac{\log(1+R^2)}{2\pi}\longrightarrow\infty\qquad(R\to\infty)
$$
なので $E|X|=\infty$ であり、Cauchy 分布は平均をもたず、したがって分散ももたない。
独立で Cauchy 分布に従う $X_1,X_2,\dots$(密度をもつ確率変数の独立性は、区間に入る確率の積で同様に定める)について、標本平均 $\bar X_n$ はどの $n$ でもふたたび同じ Cauchy 分布に従うことが知られている(GS06 Example 8.8。この記事では証明しない)。これを認めると、$P(|\bar X_n|\ge1)=1-\frac2\pi\arctan1=\frac12$ がどの $n$ でも成り立つ。さらに、どの実数 $c$ についても $P(|\bar X_n-c|\ge1)=\int_{|x-c|\ge1}f(x)\,dx$ は $n$ によらない正の定数なので、$\bar X_n$ はどの値にも確率収束しない。何回平均をとっても、1 回の観測と同じだけ散らばっている。
破れている条件は「平均と分散をもつ」ことである。thm-lnd-weak の証明は $V[\bar X_n]=\frac{\sigma^2}n$ に依存しており、$\sigma^2$ が存在しなければ始まらない。
分散が有限という仮定は、この記事の証明に必要なだけで、弱大数の法則そのものには必要ではない。独立で同じ分布に従う列なら、平均 $\mu$ が存在するだけで $\bar X_n$ は $\mu$ に確率収束する(Khinchin の弱大数の法則。Dur19 §2.2。この記事では証明しない)。Cauchy 分布の反例は、平均も存在しない場合である。
弱大数の法則は、各 $n$ についての確率 $P(|\bar X_n-\mu|\ge\varepsilon)$ の極限を述べた。これに対し、無限に続く試行の列 1 本 1 本について、$\bar X_n$ が数列として $\mu$ に収束するかを問うのが強大数の法則である。
$X_1,X_2,\dots$ が独立で同じ分布に従い、平均 $\mu$ が存在するならば、
$$
P\Bigl(\lim_{n\to\infty}\bar X_n=\mu\Bigr)=1
$$
である。
この記事ではこの定理を証明しない(Dur19 §2.4)。主張を正確に述べるには、無限に続く試行の列全体の集合の上に確率を定める必要があり、それには測度論が要る。確率 $1$ で収束するといっても、rem-lnd-not-certain の「ずっと 6 が出続ける列」のように収束しない列は存在する。それらの列全体の確率が $0$ だというのが主張である。「確率 $1$」は「必ず」と同じではない。確率 $1$ の収束は確率収束を導くが、逆は一般には成り立たない(どちらもこの記事では証明しない)。
Mathpediaは寄付と、参考文献の書籍リンク(Amazonアソシエイト)の紹介料で運営されています。 支援について / 寄付する