大数の法則とさいころの平均

同義語:law of large numbers and the average of dice

概要

大数の法則とさいころの平均(law of large numbers and the average of dice)とは、独立な試行の平均が期待値に近づくという大数の法則である。弱大数の法則は、平均 $\mu$ と有限な分散 $\sigma^2$ が共通で、どの 2 つも無相関(たとえば独立)な確率変数の標本平均 $\bar X_n$ について、各 $\varepsilon>0$ で $P(|\bar X_n-\mu|\ge\varepsilon)\le\sigma^2/(n\varepsilon^2)\to0$ となることで、$V[\bar X_n]=\sigma^2/n$ と Chebyshev の不等式で証明される。特に相対頻度は確率に確率収束する。ただし「必ず近づく」のではなく、ずれる確率が $0$ に近づく。平均をもたない Cauchy 分布では成り立たない。

$$\newcommand{C}[0]{\mathbb{C}} \newcommand{N}[0]{\mathbb{N}} \newcommand{Q}[0]{\mathbb{Q}} \newcommand{R}[0]{\mathbb{R}} \newcommand{Z}[0]{\mathbb{Z}} $$

前提知識: 確率変数, 期待値, 分散, 独立な事象, 数列の極限

高校での出発点:統計的確率とさいころの平均

高校では、確率を 2 通りに説明する。

  • 起こりうる場合が $N$ 通りで、どれも同様に確からしいとき、事象 $E$ がそのうち $r$ 通りを含むなら、$E$ の確率を $\frac rN$ とする(数学的確率)。さいころで 1 の目が出る確率は $\frac16$ である。
  • 同じ条件で試行を $n$ 回くり返し、$E$ が $r_n$ 回起こったとする。$n$ を大きくすると相対頻度 $\frac{r_n}n$ がほぼ一定の値に近づくとき、その値を $E$ の確率とみなす(統計的確率)。画びょうを投げて針が上を向く確率のように、同様に確からしい場合に分けられないときに使う。
    同じことは平均についても言われる。
さいころの目の期待値

さいころの目 $X$ の期待値は
$$ E[X]=\frac{1+2+3+4+5+6}6=\frac72=3.5 $$
であり、「さいころを何回も投げて目の平均をとると $3.5$ に近づく」と説明される。

平均が 3.5 からずれる確率

さいころを $n$ 回投げたときの目の平均を $\bar X_n$ とし、それが $3.5$ から $0.5$ 以上ずれる確率 $P(|\bar X_n-3.5|\ge0.5)$ を、$6^n$ 通りの目の出方をすべて数えて正確に計算すると次のようになる。

$n$$10$$100$$1000$
$P(\lvert\bar X_n-3.5\rvert\ge0.5)$$0.410$$0.00365$$1.5\times10^{-20}$

確かに、$n$ が大きいほど平均は $3.5$ の近くに集まる。

しかし次の疑問が残る。

  • 「近づく」とはどういう意味か。さいころを 1000 回投げて全部 6 が出ることも、確率は小さいが起こりうる。そのとき平均は $6$ である(→ def-lnd-convergence、rem-lnd-not-certain)。
  • 統計的確率と数学的確率は、どういう関係にあるのか(→ cor-lnd-bernoulli)。
  • 平均が近づくのは、どんな確率変数でも成り立つのか(→ thm-lnd-weak、ex-lnd-cauchy)。
    この記事では、「近づく」を確率収束として定義し、弱大数の法則「独立な試行の平均は、期待値に確率収束する」を、分散が有限の場合に完全に証明する。道具は、標本平均の分散が $\frac{\sigma^2}n$ になることと、Markov の不等式から導く Chebyshev の不等式である。そのうえで、収束の意味についての注意(「必ず近づく」のではない、表と裏の回数の差は $0$ に近づかない)、分散が存在しない場合の反例(Cauchy 分布。紹介)、強大数の法則(紹介)を述べる。
    高校大学ボックス
    平均が $3.5$ に近づく確率収束def-lnd-convergence
    独立な試行確率変数の独立性def-lnd-independent
    標本平均の分散 $\frac{\sigma^2}n$無相関な和の分散prop-lnd-mean-variance
    統計的確率Bernoulli の大数の法則cor-lnd-bernoulli

取り出すべき構造

確率変数と期待値

この記事では主に、有限個または可算個の値 $a_1,a_2,\dots$ をとる確率変数(離散型の確率変数)を扱う。$X$ の期待値を
$$ E[X]:=\sum_ia_i\,P(X=a_i) $$
で定める。ただし値が無限個のときは、$\sum_i|a_i|P(X=a_i)<\infty$(絶対収束)のときに限って期待値が存在するという。$E[X]=\mu$ が存在し、さらに $E[(X-\mu)^2]<\infty$ のとき、$V[X]:=E[(X-\mu)^2]$ を分散という。
次の事実は前提として使う。いずれも高校で扱う事実を、期待値が存在する場合に述べたものである。

  • 複数の離散型確率変数 $X,Y$ の関数 $g(X,Y)$ の期待値は $\sum_{a,b}g(a,b)\,P(X=a,\,Y=b)$ で計算できる(絶対収束するとき)。
  • 期待値の線形性:$E[X+Y]=E[X]+E[Y]$、$E[cX]=cE[X]$。
  • 単調性:つねに $X\le Y$ なら $E[X]\le E[Y]$。
  • $V[X]=E[X^2]-E[X]^2$、$V[aX+b]=a^2V[X]$。
確率変数の独立性

離散型確率変数 $X_1,\dots,X_n$ が独立であるとは、それぞれのとりうるすべての値 $a_1,\dots,a_n$ について
$$ P(X_1=a_1,\,\dots,\,X_n=a_n)=P(X_1=a_1)\cdots P(X_n=a_n) $$
が成り立つことをいう。確率変数の列 $X_1,X_2,\dots$ が独立であるとは、どの $n$ についても $X_1,\dots,X_n$ が独立であることをいう。さいころを何回も投げるときの各回の目は、独立な確率変数の列として表される。

標本平均

確率変数 $X_1,\dots,X_n$ について
$$ \bar X_n:=\frac{X_1+X_2+\cdots+X_n}n $$
を標本平均という。

確率収束の定義

確率変数の列 $Y_1,Y_2,\dots$ と実数 $c$ について、どの $\varepsilon>0$ についても
$$ \lim_{n\to\infty}P\bigl(|Y_n-c|\ge\varepsilon\bigr)=0 $$
が成り立つとき、$Y_n$ は $c$ に確率収束するという。

数列の収束の $\varepsilon$-$N$ による定義は 極限とε-δ で扱う。
確率収束は、「$n$ が大きいとき、$Y_n$ が $c$ から $\varepsilon$ 以上ずれる確率が小さい」という主張である。$Y_n$ の値そのものが $c$ に近いことを保証するものではない。

確率 $\frac{1}{n}$ で 1 をとる列

$Y_n$ が確率 $\frac1n$ で $1$、確率 $1-\frac1n$ で $0$ をとるとする。$0<\varepsilon\le1$ なら $P(|Y_n-0|\ge\varepsilon)=\frac1n\to0$、$\varepsilon>1$ なら $0$ なので、$Y_n$ は $0$ に確率収束する。それでもどの $n$ でも $Y_n=1$ となる確率は正である。

主定理と証明

標本平均の平均と分散

独立な確率変数の積の期待値

離散型確率変数 $X,Y$ が独立で、$E[X]$、$E[Y]$ が存在するとき、$E[XY]$ も存在して $E[XY]=E[X]\,E[Y]$ である。

二重和を分ける

$X$ の値を $a_i$、$Y$ の値を $b_j$ とする。独立性から $P(X=a_i,Y=b_j)=P(X=a_i)P(Y=b_j)$ なので、
$$ \sum_{i,j}|a_ib_j|\,P(X=a_i,Y=b_j)=\Bigl(\sum_i|a_i|P(X=a_i)\Bigr)\Bigl(\sum_j|b_j|P(Y=b_j)\Bigr)<\infty $$
であり、$E[XY]$ は存在する。絶対収束する二重和は項の順序によらないので、同じ計算を絶対値なしで行えば $E[XY]=E[X]E[Y]$ を得る。$\square$

標本平均の平均と分散

確率変数 $X_1,\dots,X_n$ が、どれも平均 $\mu$、分散 $\sigma^2$ をもち、どの 2 つも無相関、すなわち $i\ne j$ について $E[(X_i-\mu)(X_j-\mu)]=0$ であるとする。このとき
$$ E[\bar X_n]=\mu,\qquad V[\bar X_n]=\frac{\sigma^2}n $$
である。特に $X_1,\dots,X_n$ が独立なら、どの 2 つも無相関なので、この結論が成り立つ。

展開して交差項を消す

線形性から $E[\bar X_n]=\frac1n\sum_iE[X_i]=\mu$ である。$Y_i:=X_i-\mu$ とおくと $\bar X_n-\mu=\frac1n\sum_iY_i$ であり、
$$ V[\bar X_n]=E\Bigl[\Bigl(\frac1n\sum_{i=1}^nY_i\Bigr)^2\Bigr]=\frac1{n^2}\Bigl(\sum_{i=1}^nE[Y_i^2]+\sum_{i\ne j}E[Y_iY_j]\Bigr)=\frac1{n^2}\cdot n\sigma^2=\frac{\sigma^2}n $$
である。ここで $|Y_iY_j|\le\frac12(Y_i^2+Y_j^2)$ なので $E[Y_iY_j]$ は存在し、仮定によりすべて $0$ である。
$X_1,\dots,X_n$ が独立なら、def-lnd-independent の等式を $X_i,X_j$($i\ne j$)以外の変数のとりうる値すべてについて足し合わせて $P(X_i=a,X_j=b)=P(X_i=a)P(X_j=b)$ を得るので、$X_i$ と $X_j$ は独立である。すると $Y_i$ と $Y_j$ も独立であり($Y_i$ の値は $X_i$ の値から決まるので、def-lnd-independent の等式がそのまま $Y_i,Y_j$ についても成り立つ)、lem-lnd-product により $E[Y_iY_j]=E[Y_i]E[Y_j]=0\cdot0=0$ である。$\square$

和の分散の公式と、独立でなく無相関の仮定で足りる理由は 標本平均の分散 で扱う。
分散が $\frac1n$ 倍になるので、標準偏差は $\frac1{\sqrt n}$ 倍になる。

さいころの標本平均の標準偏差

さいころの目の分散は $E[X^2]-E[X]^2=\frac{91}6-\frac{49}4=\frac{35}{12}$ なので、$n$ 回の平均 $\bar X_n$ の標準偏差は $\sqrt{35/12}/\sqrt n=1.7078\ldots/\sqrt n$ であり、$n=100$ で $0.17$、$n=10000$ で $0.017$ である。

Markov の不等式と Chebyshev の不等式

分散が小さいことを、「ずれる確率が小さい」ことに変換するのが次の 2 つの不等式である。

Markov の不等式

$X$ を $0$ 以上の値だけをとる確率変数とし、$E[X]$ が存在するとする。$a>0$ について
$$ P(X\ge a)\le\frac{E[X]}a $$
である。

大きい値だけを残す

$X$ の値を $a_i\ (\ge0)$ とすると、$a$ 未満の値の項を捨て、残りの項で $a_i\ge a$ を使って
$$ E[X]=\sum_ia_iP(X=a_i)\ge\sum_{i:\ a_i\ge a}a_iP(X=a_i)\ge a\sum_{i:\ a_i\ge a}P(X=a_i)=a\,P(X\ge a) $$
である。両辺を $a$ で割ればよい。$\square$

同じ証明は、「$X\ge a$ のとき $1$、そうでないとき $0$」という確率変数 $I$ について $aI\le X$ がつねに成り立つことを使い、期待値の単調性で $a\,P(X\ge a)=E[aI]\le E[X]$ と書くこともできる。この形なら、密度をもつ確率変数など一般の確率変数にそのまま通用する。

Chebyshev の不等式

確率変数 $X$ が平均 $\mu$ と分散 $\sigma^2$ をもつとき、$\varepsilon>0$ について
$$ P\bigl(|X-\mu|\ge\varepsilon\bigr)\le\frac{\sigma^2}{\varepsilon^2} $$
である。

2 乗して Markov の不等式を使う

$|X-\mu|\ge\varepsilon$ と $(X-\mu)^2\ge\varepsilon^2$ は同じ事象である。$0$ 以上の確率変数 $(X-\mu)^2$ に thm-lnd-markov を $a=\varepsilon^2$ で使うと、$P\bigl((X-\mu)^2\ge\varepsilon^2\bigr)\le\frac{E[(X-\mu)^2]}{\varepsilon^2}=\frac{\sigma^2}{\varepsilon^2}$ である。$\square$

2 つの不等式は、一般には改良できない。

等号が成り立つ分布

$0< t\le1$ とする。

  • $X$ が確率 $t$ で $a$、確率 $1-t$ で $0$ をとるなら、$E[X]=ta$ であり、$P(X\ge a)=t=\frac{E[X]}a$ で Markov の不等式は等号になる。
  • $X$ が確率 $\frac t2$ ずつで $\mu+\varepsilon$ と $\mu-\varepsilon$、確率 $1-t$ で $\mu$ をとるなら、$V[X]=t\varepsilon^2$ であり、$P(|X-\mu|\ge\varepsilon)=t=\frac{V[X]}{\varepsilon^2}$ で Chebyshev の不等式は等号になる。

一方、具体的な分布では Chebyshev の不等式はかなり粗い。

さいころの表と Chebyshev の上界

ex-lnd-dice-table と比べると、$\varepsilon=0.5$ のときの上界 $\frac{35/12}{n\cdot0.25}=\frac{35}{3n}$ は $n=10,100,1000$ で $1.17,\ 0.117,\ 0.0117$ であり、正確な値 $0.410,\ 0.00365,\ 1.5\times10^{-20}$ よりずっと大きい。それでも、$n\to\infty$ で $0$ に近づくことを示すには十分である。

弱大数の法則

弱大数の法則

確率変数の列 $X_1,X_2,\dots$ が、どれも平均 $\mu$ と(有限の)分散 $\sigma^2$ をもち、どの 2 つも無相関であるとする(特に、独立で同じ分布に従い分散をもつ場合はこれにあてはまる)。このとき、すべての $\varepsilon>0$ と $n\ge1$ について
$$ P\bigl(|\bar X_n-\mu|\ge\varepsilon\bigr)\le\frac{\sigma^2}{n\varepsilon^2} $$
であり、したがって $\bar X_n$ は $\mu$ に確率収束する。

標本平均に Chebyshev の不等式を使う

prop-lnd-mean-variance により $\bar X_n$ は平均 $\mu$、分散 $\frac{\sigma^2}n$ をもつ。cor-lnd-chebyshev を $\bar X_n$ に使うと $P(|\bar X_n-\mu|\ge\varepsilon)\le\frac{\sigma^2/n}{\varepsilon^2}$ である。$\varepsilon$ を固定して $n\to\infty$ とすると右辺は $0$ に近づく。$\square$

証明で使ったのは平均と分散だけであり、「どの 2 つも無相関」という仮定は、独立性よりずっと弱い。また、分散が共通でなくても、$V[X_i]\le M$ となる定数 $M$ があれば、同じ証明で $P(|\bar X_n-\mu|\ge\varepsilon)\le\frac M{n\varepsilon^2}$ が得られる。
事象の相対頻度は、次のように標本平均として表せる。

Bernoulli の大数の法則

確率 $p$ で起こる事象 $E$ について独立な試行をくり返し、最初の $n$ 回で $E$ が起こる回数を $r_n$ とする。このとき、すべての $\varepsilon>0$ について
$$ P\Bigl(\Bigl|\frac{r_n}n-p\Bigr|\ge\varepsilon\Bigr)\le\frac{p(1-p)}{n\varepsilon^2}\le\frac1{4n\varepsilon^2} $$
であり、相対頻度 $\frac{r_n}n$ は $p$ に確率収束する。

指示確率変数の平均

$i$ 回目に $E$ が起これば $1$、起こらなければ $0$ をとる確率変数を $X_i$ とする。$X_1,X_2,\dots$ は独立で、$E[X_i]=p$、$V[X_i]=E[X_i^2]-p^2=p-p^2=p(1-p)$ である。$\frac{r_n}n=\bar X_n$ なので、thm-lnd-weak から前半を得る。$p(1-p)=\frac14-\bigl(p-\frac12\bigr)^2\le\frac14$ である。$\square$

高校の計算は特別な場合

統計的確率と数学的確率

cor-lnd-bernoulli は、「$E$ の確率が $p$ である」という数学的なモデルのもとで、相対頻度が $p$ に確率収束することを示す。統計的確率で「相対頻度が近づく値を確率とみなす」のは、このモデルが現実の試行によく合っているときに、定理を逆向きに使って $p$ を推定していることにあたる。ただし定理はモデルの内部の主張であり、現実のさいころが「どの目も確率 $\frac16$ で、各回独立」というモデルに従うこと自体を証明するものではない。

必要な試行回数

相対頻度のずれを 0.01 未満にする回数

cor-lnd-bernoulli の評価から、「相対頻度が $p$ から $0.01$ 以上ずれる確率を $0.05$ 以下にするには何回投げればよいか」に答えられる。$\frac1{4n\cdot0.01^2}\le0.05$ を解いて $n\ge50000$ であり、$p$ がわからなくてもこの回数で足りる。$p=\frac16$ とわかっていれば、$\frac{(1/6)(5/6)}{n\cdot0.01^2}\le0.05$ から $n\ge27778$ である。中心極限定理による正規近似(この記事では証明しない)を使うと、$n\ge\frac{1.96^2\,p(1-p)}{0.01^2}$、すなわち $p=\frac12$ で $n\ge9604$、$p=\frac16$ で $n\ge5336$ が目安になる($p=\frac12$、$n=9604$ で正確な確率を計算すると $P(|\frac{r_n}n-\frac12|<0.01)=0.9511$ である)。Chebyshev の不等式は保証を与えるが、粗い。

標本平均の分散

高校の統計で、母平均 $\mu$、母分散 $\sigma^2$ の母集団から大きさ $n$ の無作為標本をとると標本平均の分散が $\frac{\sigma^2}n$ になる、と習うのは prop-lnd-mean-variance である(復元抽出の場合)。弱大数の法則は、これに Chebyshev の不等式を組み合わせたものにすぎない。

収束の意味についての注意

「必ず近づく」のではない

さいころを $n$ 回投げて全部 6 が出る確率は $6^{-n}>0$ であり、そのとき $\bar X_n=6$ である。どれほど $n$ を大きくしても、$\bar X_n$ が $3.5$ から離れる可能性は $0$ にならない。弱大数の法則が述べるのは、「離れる確率が $0$ に近づく」ことだけである。
また弱大数の法則は、各 $n$ ごとの確率についての主張であり、1 本の無限に続く試行の列で $\bar X_n$ が数列として $\mu$ に収束するかどうかについては、直接には何も言わない。そちらは次に述べる強大数の法則の主題である。

平均は「取り戻す」のではなく「薄める」

公平な硬貨で最初に 10 回続けて表が出たとする。各回は独立なので、その後の $n$ 回の表の回数の期待値は $\frac n2$ のままであり、「そろそろ裏が出やすい」ということはない。それでも全体の表の割合の期待値 $\frac{10+n/2}{10+n}$ は $n\to\infty$ で $\frac12$ に近づく。最初の偏りは埋め合わされるのではなく、その後の多数の試行で薄められる。

表の割合は $\frac12$ に近づくが、表の回数と $\frac n2$ の差は $0$ に近づかない。実際、差 $r_n-\frac n2$ の分散は $\frac n4$ であり、$n$ とともに大きくなる。次の命題はこれを確率の言葉で述べる。

表と裏の回数の差

公平な硬貨を $n$ 回投げたときの表の回数を $r_n$ とする。すべての $k$ について $P(r_n=k)\le\frac1{\sqrt n}$ である。したがって、どの $c>0$ についても
$$ P\Bigl(\Bigl|r_n-\frac n2\Bigr|< c\Bigr)\le\frac{2c+1}{\sqrt n}\longrightarrow0\qquad(n\to\infty) $$
であり、表の回数と $\frac n2$ の差が $c$ 未満にとどまる確率は $0$ に近づく。

中央の二項係数を積で抑える

$P(r_n=k)=\binom nk2^{-n}$ であり、$\frac{\binom n{k+1}}{\binom nk}=\frac{n-k}{k+1}$ が $1$ 以上になるのは $k\le\frac{n-1}2$ のときなので、最大は $k=\lfloor\frac n2\rfloor$ でとられる。
$n=2m$ のとき、最大値は
$$ a_m:=\binom{2m}m4^{-m}=\frac{(2m)!}{2^mm!\cdot2^mm!}=\frac{1\cdot3\cdots(2m-1)}{2\cdot4\cdots(2m)}=\prod_{j=1}^m\frac{2j-1}{2j} $$
である。$(2j-1)(2j+1)<(2j)^2$ より $\frac{2j-1}{2j}<\frac{2j}{2j+1}$ なので
$$ a_m^2<\prod_{j=1}^m\frac{2j-1}{2j}\cdot\frac{2j}{2j+1}=\prod_{j=1}^m\frac{2j-1}{2j+1}=\frac1{2m+1} $$
であり(最後の積は隣どうしで約分される)、$a_m<\frac1{\sqrt{2m+1}}<\frac1{\sqrt n}$ である。$n=2m+1$ のとき、最大値は $\binom{2m+1}m2^{-(2m+1)}=a_m\cdot\frac{2m+1}{2(m+1)}$ であり($\binom{2m+1}m=\binom{2m}m\frac{2m+1}{m+1}$ による。$m=0$ では $a_0=1$ と読む)、これは $\frac1{\sqrt{2m+1}}\cdot\frac{2m+1}{2m+2}<\frac1{\sqrt{2m+1}}=\frac1{\sqrt n}$ 以下である。
$|k-\frac n2|< c$ を満たす整数 $k$ は、長さ $2c$ の開区間に入る整数なので $2c+1$ 個以下である。それぞれの確率は $\frac1{\sqrt n}$ 以下なので、後半を得る。$\square$

回数の差が 5 未満の確率

$c=5$ とすると、$P(|r_n-\frac n2|<5)$ の正確な値は $n=100$ で $0.632$、$n=10000$ で $0.0717$ である。表と裏の回数がほぼ同じになる確率は、投げるほど小さくなる。

例と反例

外した仮定崩れる主張ボックス
どの 2 つも無相関$V[\bar X_n]=\frac{\sigma^2}n$ と確率収束ex-lnd-dependent
平均と分散をもつ標本平均の確率収束ex-lnd-cauchy
さいころの 1 の目の相対頻度

さいころを $n$ 回投げて 1 の目が出る相対頻度 $\frac{r_n}n$ が $\frac16$ から $0.05$ 以上ずれる確率は、正確に計算すると $n=100,\,1000,\,10000$ で $0.178,\ 2.6\times10^{-5},\ 1.3\times10^{-38}$ である。cor-lnd-bernoulli の上界 $\frac{5/36}{n\cdot0.05^2}$ は $0.556,\ 0.0556,\ 0.00556$ である。

反例:独立でないとき

さいころを 1 回だけ投げ、その目を $X_1$ とし、$X_2=X_3=\cdots=X_1$ とする。どの $X_i$ も平均 $3.5$、分散 $\frac{35}{12}$ をもつが、$\bar X_n=X_1$ なので、$P(|\bar X_n-3.5|\ge1)=P(X_1\in\{1,2,5,6\})=\frac23$ はどの $n$ でも変わらず、$\bar X_n$ は $3.5$ に確率収束しない。
破れている条件は「どの 2 つも無相関」である。実際 $E[(X_i-3.5)(X_j-3.5)]=V[X_1]=\frac{35}{12}\ne0$ であり、prop-lnd-mean-variance の $V[\bar X_n]=\frac{\sigma^2}n$ が成り立たず、$V[\bar X_n]=\frac{35}{12}$ のままである。

反例:平均も分散ももたない Cauchy 分布

密度 $f(x)=\frac1{\pi(1+x^2)}$ をもつ確率変数 $X$ の分布を Cauchy 分布という($P(a\le X\le b)=\int_a^bf(x)\,dx$。$\int_{-\infty}^\infty f=\frac1\pi[\arctan x]_{-\infty}^\infty=1$ である)。密度をもつ確率変数の期待値は $\int xf(x)\,dx$ で定め、$\int|x|f(x)\,dx<\infty$ のときに存在するという。ところが
$$ \int_0^R\frac{x}{\pi(1+x^2)}\,dx=\frac{\log(1+R^2)}{2\pi}\longrightarrow\infty\qquad(R\to\infty) $$
なので $E|X|=\infty$ であり、Cauchy 分布は平均をもたず、したがって分散ももたない。
独立で Cauchy 分布に従う $X_1,X_2,\dots$(密度をもつ確率変数の独立性は、区間に入る確率の積で同様に定める)について、標本平均 $\bar X_n$ はどの $n$ でもふたたび同じ Cauchy 分布に従うことが知られている(GS06 Example 8.8。この記事では証明しない)。これを認めると、$P(|\bar X_n|\ge1)=1-\frac2\pi\arctan1=\frac12$ がどの $n$ でも成り立つ。さらに、どの実数 $c$ についても $P(|\bar X_n-c|\ge1)=\int_{|x-c|\ge1}f(x)\,dx$ は $n$ によらない正の定数なので、$\bar X_n$ はどの値にも確率収束しない。何回平均をとっても、1 回の観測と同じだけ散らばっている。
破れている条件は「平均と分散をもつ」ことである。thm-lnd-weak の証明は $V[\bar X_n]=\frac{\sigma^2}n$ に依存しており、$\sigma^2$ が存在しなければ始まらない。

分散の有限性は十分条件

分散が有限という仮定は、この記事の証明に必要なだけで、弱大数の法則そのものには必要ではない。独立で同じ分布に従う列なら、平均 $\mu$ が存在するだけで $\bar X_n$ は $\mu$ に確率収束する(Khinchin の弱大数の法則。Dur19 §2.2。この記事では証明しない)。Cauchy 分布の反例は、平均も存在しない場合である。

強大数の法則(紹介)

弱大数の法則は、各 $n$ についての確率 $P(|\bar X_n-\mu|\ge\varepsilon)$ の極限を述べた。これに対し、無限に続く試行の列 1 本 1 本について、$\bar X_n$ が数列として $\mu$ に収束するかを問うのが強大数の法則である。

強大数の法則の主張

$X_1,X_2,\dots$ が独立で同じ分布に従い、平均 $\mu$ が存在するならば、
$$ P\Bigl(\lim_{n\to\infty}\bar X_n=\mu\Bigr)=1 $$
である。

この記事ではこの定理を証明しない(Dur19 §2.4)。主張を正確に述べるには、無限に続く試行の列全体の集合の上に確率を定める必要があり、それには測度論が要る。確率 $1$ で収束するといっても、rem-lnd-not-certain の「ずっと 6 が出続ける列」のように収束しない列は存在する。それらの列全体の確率が $0$ だというのが主張である。「確率 $1$」は「必ず」と同じではない。確率 $1$ の収束は確率収束を導くが、逆は一般には成り立たない(どちらもこの記事では証明しない)。

さらに先へ

  • ずれの大きさ:$\bar X_n-\mu$ の典型的な大きさは $\frac\sigma{\sqrt n}$ であり、$\frac{\sqrt n(\bar X_n-\mu)}\sigma$ の分布は標準正規分布に近づく(中心極限定理)。弱大数の法則は、それより粗い「$0$ に近づく」だけを述べている。
  • 指数的な評価:値が有界な独立な確率変数では、$P(|\bar X_n-\mu|\ge\varepsilon)$ は $n$ について指数関数的に小さくなる(Hoeffding の不等式、Chernoff の評価)。冒頭の表で $n=1000$ の確率が $10^{-20}$ だったのはこのためであり、Chebyshev の $\frac1n$ よりはるかに速い。
  • Monte Carlo 法:区間 $[0,1]$ で一様な独立な乱数 $U_1,U_2,\dots$ と連続関数 $g$ に対し、$\frac1n\sum g(U_i)$ は $\int_0^1g(x)\,dx$ に近づく。大数の法則は、乱数による数値積分の根拠である。
  • エルゴード定理:独立同分布の列を、時間をずらしても分布が変わらない列(定常な列)に広げたときの大数の法則である。定常性だけでは極限は一般に定数にならず、極限が期待値 $\mu$ になることはエルゴード性という条件を加えると保証される。
    これらはいずれもこの記事では証明しない。

関連項目

参考文献

Mathpediaは寄付と、参考文献の書籍リンク(Amazonアソシエイト)の紹介料で運営されています。 支援について / 寄付する