二項分布から正規分布へ

同義語:de Moivre–Laplaceの定理de Moivre–Laplace theorem

概要

二項分布から正規分布へ(binomial-to-normal approximation)とは、$B(n,p)$ に従う $S_n$ の標準化 $(S_n-np)/\sqrt{npq}$($q=1-p$)が、$0<p<1$ を固定して $n\to\infty$ とすると標準正規分布に近づくという現象である。$(k-np)/\sqrt{npq}$ が固定した有界区間にある範囲で一様に、$P(S_n=k)$ と $e^{-(k-np)^2/(2npq)}/\sqrt{2\pi npq}$ の比は $1$ に近づく(de Moivre–Laplace の局所極限定理)。これは Stirling の公式から導かれ、足し合わせた積分形の定理が正規分布表による近似の根拠になる。$np$ が一定のまま $n\to\infty$ の場合や裾では正規近似は悪い。

$$\newcommand{C}[0]{\mathbb{C}} \newcommand{N}[0]{\mathbb{N}} \newcommand{Q}[0]{\mathbb{Q}} \newcommand{R}[0]{\mathbb{R}} \newcommand{Z}[0]{\mathbb{Z}} $$

前提知識: 二項分布, 期待値, 分散, Taylorの定理, 広義積分

高校での出発点:二項分布と正規分布表

1 回の試行で事象 $E$ の起こる確率を $p$($0< p<1$)とし、$q:=1-p$ とおく。この試行を独立に $n$ 回くり返したとき、$E$ の起こる回数を $S_n$ とすると、$k=0,1,\dots,n$ について
$$ P(S_n=k)=\binom nk p^kq^{n-k} $$
である。この確率分布を二項分布 $B(n,p)$ という。高校では、$B(n,p)$ の平均が $np$、分散が $npq$ であることを習い、さらに「$n$ が大きいとき $S_n$ は近似的に正規分布 $N(np,npq)$ に従う」として、正規分布表で確率を求める。

硬貨 100 回の正規近似

硬貨を 100 回投げて表が 60 回以上出る確率を考える。$S_{100}$ は $B(100,\frac12)$ に従い、平均 $50$、標準偏差 $\sqrt{100\cdot\frac12\cdot\frac12}=5$ である。標準化した $Z=\frac{S_{100}-50}5$ が標準正規分布に従うとみなすと、正規分布表から
$$ P(S_{100}\ge60)=P(Z\ge2)\approx1-0.9772=0.0228 $$
となる。正確な値は $P(S_{100}\ge60)=0.02844\ldots$ である。後で述べる連続補正をして $P(Z\ge1.9)\approx0.0287$ とすると、差はずっと小さくなる。

ここで次の疑問が生じる。

  • 二項分布は整数の値だけをとるのに、なぜ連続な正規分布で近似できるのか。近似の根拠は何か(→ thm-btn-local)。
  • 正規分布の密度 $\frac1{\sqrt{2\pi}}e^{-x^2/2}$ に現れる $\sqrt{2\pi}$ はどこから来るのか(→ thm-btn-gauss)。
  • 近似はいつ良く、いつ悪いのか(→ ex-btn-small-p、ex-btn-small-n、ex-btn-tail)。
    以下、局所極限定理を Stirling の公式(証明せずに引用する)から証明し、Gauss 積分・区間の確率の近似・連続補正の意味を導く。中心極限定理は紹介にとどめる。
    高校大学ボックス
    平均 $np$、分散 $npq$吸収公式prop-btn-mean-variance
    正規分布表分布関数 $\Phi$def-btn-normal
    近似的に $N(np,npq)$ に従う標準化の分布の極限thm-btn-integral
    連続補正局所極限定理と中点thm-btn-local

取り出すべき構造

二項分布の平均と分散

二項分布の平均と分散

$S_n$ が二項分布 $B(n,p)$ に従うとき、$q=1-p$ として
$$ E[S_n]=np,\qquad E[S_n(S_n-1)]=n(n-1)p^2,\qquad V[S_n]=npq $$
である。

二項係数の吸収公式

$1\le k\le n$ のとき $k\binom nk=n\binom{n-1}{k-1}$ であり、$2\le k\le n$ のとき $k(k-1)\binom nk=n(n-1)\binom{n-2}{k-2}$ である(どちらも階乗で書けば確かめられる)。$k=0$ の項は $0$ なので、二項定理により
$$ E[S_n]=\sum_{k=1}^nk\binom nkp^kq^{n-k}=np\sum_{k=1}^{n}\binom{n-1}{k-1}p^{k-1}q^{n-k}=np\,(p+q)^{n-1}=np $$
である。同様に $n\ge2$ なら $E[S_n(S_n-1)]=n(n-1)p^2(p+q)^{n-2}=n(n-1)p^2$ であり、$n=1$ なら両辺とも $0$ である。したがって
$$ V[S_n]=E[S_n^2]-E[S_n]^2=E[S_n(S_n-1)]+E[S_n]-E[S_n]^2=n(n-1)p^2+np-n^2p^2=np(1-p)=npq $$
である。$\square$

$S_n$ を「$i$ 回目に $E$ が起これば $1$、起こらなければ $0$」という確率変数 $X_i$ の和 $X_1+\cdots+X_n$ とみると、$E[X_i]=p$、$V[X_i]=p-p^2=pq$ であり、上の結果は「独立な確率変数の和の平均・分散はそれぞれの和」という事実の特別な場合でもある。

標準化

以下、$S_n$ は $B(n,p)$ に従うとし、
$$ \sigma_n:=\sqrt{npq},\qquad x_{n,k}:=\frac{k-np}{\sigma_n}\quad(k=0,1,\dots,n) $$
とおく。

標準化

平均 $\mu$、標準偏差 $\sigma>0$ の確率変数 $X$ について、$Z:=\dfrac{X-\mu}\sigma$ を $X$ の標準化という。$E[Z]=0$、$V[Z]=1$ である。

$S_n$ の標準化 $Z_n:=\frac{S_n-np}{\sigma_n}$ は、値 $x_{n,0},x_{n,1},\dots,x_{n,n}$ をとる。隣り合う値の間隔は $\frac1{\sigma_n}$ であり、$n\to\infty$ で $0$ に近づく。一方、$Z_n$ の平均は $0$、分散は $1$ のままである。このとき、各点の確率 $P(Z_n=x_{n,k})$ は $0$ に近づくので、比べるべきものは確率そのものではなく、確率を間隔 $\frac1{\sigma_n}$ で割った高さ $\sigma_n\,P(S_n=k)$ である。棒グラフの各棒を幅 $\frac1{\sigma_n}$ の長方形に置き換えると、面積が確率、高さがこの値になる。

高さの比が教える形

隣り合う高さの比は
$$ \frac{P(S_n=k+1)}{P(S_n=k)}=\frac{(n-k)\,p}{(k+1)\,q} $$
であり、これが $1$ より大きいのは $k+1<(n+1)p$ のときに限る。したがって確率は $k$ が $(n+1)p$ 付近に達するまで増え、その後は減る。さらに $k=np+x\sigma_n$ と書いて $n$ を大きくすると、比の対数は、およそ $-\frac{x}{\sigma_n}$ に等しい(これは目安であり、正確な主張は thm-btn-local で証明する)。高さを $h(x)$ と書くと、これは $x$ が $\frac1{\sigma_n}$ 増えるごとに $\log h$ が $-\frac x{\sigma_n}$ だけ変わることを意味し、微分方程式 $(\log h)'=-x$、すなわち $h(x)=Ce^{-x^2/2}$ を示唆する。釣鐘形の曲線 $e^{-x^2/2}$ は、ここから現れる。

正規分布

標準正規分布の密度と分布関数

$$ \varphi(x):=\frac1{\sqrt{2\pi}}e^{-x^2/2},\qquad \Phi(z):=\int_{-\infty}^z\varphi(x)\,dx $$
とおく。$\varphi$ を標準正規分布の密度関数、$\Phi$ を標準正規分布の分布関数という。広義積分 $\int_{-\infty}^z\varphi(x)\,dx$ は収束し($x^2/2\ge|x|-\frac12$ より $0<\varphi(x)\le\frac{e^{1/2}}{\sqrt{2\pi}}e^{-|x|}$ なので)、$\int_{-\infty}^\infty\varphi(x)\,dx=1$ である(この等式は thm-btn-gauss で証明する)。
一般に、$0$ 以上の関数 $f$ で $\int_{-\infty}^\infty f(x)\,dx=1$ を満たすものを確率密度関数といい、すべての $a\le b$ について $P(a\le X\le b)=\int_a^bf(x)\,dx$ となる確率変数 $X$ を、密度 $f$ をもつ連続型の確率変数という。密度 $\varphi$ をもつ確率変数の分布を標準正規分布 $N(0,1)$ という。実数 $\mu$ と $\sigma>0$ について、$\mu+\sigma Z$($Z$ は $N(0,1)$ に従う)の分布を正規分布 $N(\mu,\sigma^2)$ という。その密度は $\frac1\sigma\varphi\bigl(\frac{x-\mu}\sigma\bigr)=\frac1{\sqrt{2\pi}\,\sigma}e^{-(x-\mu)^2/(2\sigma^2)}$ である。

$N(\mu,\sigma^2)$ の密度の式は、$P(a\le\mu+\sigma Z\le b)=P\bigl(\frac{a-\mu}\sigma\le Z\le\frac{b-\mu}\sigma\bigr)=\int_{(a-\mu)/\sigma}^{(b-\mu)/\sigma}\varphi(t)\,dt$ を $x=\mu+\sigma t$ と置換すれば得られる。

主定理と証明

Stirling の公式(引用)

証明の道具は、階乗の大きさを正確に見積もる Stirling の公式である。この記事では次の評価つきの形を証明せずに引用する(Rob55。Stirlingの公式 の記事でも扱う)。

Stirling の公式(評価つき)

正の整数 $m$ について、
$$ m!=\sqrt{2\pi m}\,\Bigl(\frac me\Bigr)^me^{\theta_m},\qquad 0<\theta_m<\frac1{12m} $$
を満たす実数 $\theta_m$ がある。

この評価の証明は 階乗の大きさの見積もり で扱う。

10 の階乗

$m=10$ では $10!/\bigl(\sqrt{20\pi}\,(10/e)^{10}\bigr)=1.008365\ldots$ であり、$e^{1/120}=1.008368\ldots$ より小さい。

正規分布の密度の定数 $\frac1{\sqrt{2\pi}}$ は、この公式の $\sqrt{2\pi}$ から来る。
もう 1 つ、対数の 2 次までの近似を用意する。

関数 $(1+t)\log(1+t)$ の近似

$|t|\le\frac12$ のとき
$$ (1+t)\log(1+t)=t+\frac{t^2}2+R(t),\qquad |R(t)|\le\frac23|t|^3 $$
である。

Taylor の定理

$f(t):=(1+t)\log(1+t)$ は $t>-1$ で何回でも微分でき、$f'(t)=\log(1+t)+1$、$f''(t)=\frac1{1+t}$、$f'''(t)=-\frac1{(1+t)^2}$ である。$f(0)=0$、$f'(0)=1$、$f''(0)=1$ なので、Taylorの定理(Lagrange の剰余)により、$0$ と $t$ の間の $\xi$ があって $f(t)=t+\frac{t^2}2+\frac{f'''(\xi)}6t^3$ となる。$|\xi|\le\frac12$ なので $|f'''(\xi)|=\frac1{(1+\xi)^2}\le4$ であり、$|R(t)|\le\frac46|t|^3=\frac23|t|^3$ である。$\square$

局所極限定理

de Moivre–Laplace の局所極限定理

$0< p<1$、$q=1-p$ を固定し、$A>0$ とする。$S_n$ が $B(n,p)$ に従うとき、
$$ \max_{k:\ |x_{n,k}|\le A}\left|\frac{\sigma_n\,P(S_n=k)}{\varphi(x_{n,k})}-1\right|\longrightarrow0\qquad(n\to\infty) $$
である。ここで $\sigma_n=\sqrt{npq}$、$x_{n,k}=\frac{k-np}{\sigma_n}$ であり、最大は $0\le k\le n$ かつ $|x_{n,k}|\le A$ を満たす $k$ 全体でとる(そのような $k$ がなければ左辺を $0$ と読む)。すなわち、$|x_{n,k}|\le A$ の範囲で一様に
$$ P(S_n=k)\approx\frac1{\sigma_n}\varphi(x_{n,k})=\frac1{\sqrt{2\pi npq}}\exp\Bigl(-\frac{(k-np)^2}{2npq}\Bigr) $$
であり、比は $1$ に近づく。

Stirling の公式を代入し、対数を 2 次まで展開する

$x:=x_{n,k}$ と書き、$|x|\le A$ とする。$k=np+x\sigma_n$、$n-k=nq-x\sigma_n$ なので
$$ u:=\frac{x\sigma_n}{np}=x\sqrt{\frac q{np}},\qquad v:=-\frac{x\sigma_n}{nq}=-x\sqrt{\frac p{nq}} $$
とおくと $k=np(1+u)$、$n-k=nq(1+v)$ であり、
$$ np\,u+nq\,v=0,\qquad np\,u^2+nq\,v^2=x^2\sigma_n^2\Bigl(\frac1{np}+\frac1{nq}\Bigr)=x^2\sigma_n^2\cdot\frac1{npq}=x^2 $$
が成り立つ(以下、この 2 つの等式を (1) と呼ぶ)。$n\ge 4A^2\max\bigl(\frac qp,\frac pq\bigr)$ とすると $|u|,|v|\le\frac12$ であり、したがって $k\ge\frac{np}2>0$、$n-k\ge\frac{nq}2>0$ なので $1\le k\le n-1$ である。以下この $n$ で考える。
thm-btn-stirling を $n!$、$k!$、$(n-k)!$ に使うと
$$ P(S_n=k)=\frac{n!}{k!\,(n-k)!}p^kq^{n-k} =\sqrt{\frac{n}{2\pi k(n-k)}}\Bigl(\frac{np}k\Bigr)^k\Bigl(\frac{nq}{n-k}\Bigr)^{n-k}e^{\theta_n-\theta_k-\theta_{n-k}} $$
となる($n^n=n^kn^{n-k}$ と $e^{-n}=e^{-k}e^{-(n-k)}$ を使った)。3 つの因子を順に調べる。
平方根の因子:$\frac n{k(n-k)}=\frac n{np(1+u)\,nq(1+v)}=\frac1{\sigma_n^2(1+u)(1+v)}$ なので、
$$ \sigma_n\sqrt{\frac{n}{2\pi k(n-k)}}=\frac1{\sqrt{2\pi}}\cdot\frac1{\sqrt{(1+u)(1+v)}} $$
である。
冪の因子の対数は
$$ -k\log(1+u)-(n-k)\log(1+v)=-np(1+u)\log(1+u)-nq(1+v)\log(1+v) $$
である。lem-btn-log と (1) により、これは
$$ -(npu+nqv)-\frac{npu^2+nqv^2}2-\rho=-\frac{x^2}2-\rho,\qquad \rho:=np\,R(u)+nq\,R(v) $$
に等しく、
$$ |\rho|\le\frac23\bigl(np|u|^3+nq|v|^3\bigr)=\frac23|x|^3\sigma_n^3\Bigl(\frac1{(np)^2}+\frac1{(nq)^2}\Bigr)=\frac23|x|^3\,\frac{p^2+q^2}{\sqrt{npq}}\le\frac{2A^3}{3\sigma_n} $$
である($\sigma_n^3=(npq)^{3/2}$ と $p^2+q^2\le1$ を使った)。
誤差の因子:$0<\theta_m<\frac1{12m}$ と $k\ge\frac{np}2$、$n-k\ge\frac{nq}2$ から
$$ |\theta_n-\theta_k-\theta_{n-k}|\le\frac1{12}\Bigl(\frac1n+\frac2{np}+\frac2{nq}\Bigr)\le\frac1{12}\cdot\frac{3}{npq}=\frac1{4\sigma_n^2} $$
である($\frac1n\le\frac1{npq}$、$\frac1{np}+\frac1{nq}=\frac1{npq}$ を使った)。
以上から
$$ \frac{\sigma_n\,P(S_n=k)}{\varphi(x)}=\frac1{\sqrt{(1+u)(1+v)}}\exp\bigl(-\rho+\theta_n-\theta_k-\theta_{n-k}\bigr) $$
である。$|u|\le A\sqrt{q/(np)}$、$|v|\le A\sqrt{p/(nq)}$、$|\rho|\le\frac{2A^3}{3\sigma_n}$、$|\theta_n-\theta_k-\theta_{n-k}|\le\frac1{4\sigma_n^2}$ はどれも $k$ によらない量で抑えられ、$n\to\infty$ で $0$ に近づく。よって右辺は $|x|\le A$ を満たす $k$ について一様に $1$ に近づく。$\square$

証明から、相対誤差はおよそ $\frac1{\sigma_n}$ の大きさであることもわかる。

局所近似の相対誤差

$A=2$ のとき相対誤差の最大は、$p=\frac15$ で $n=100,\,1000,\,10000$ に対してそれぞれ $0.055,\ 0.016,\ 0.0050$ で、ほぼ $\sqrt{10}$ 倍ずつ小さくなる。$p=\frac12$ では $0.0050,\ 0.00050,\ 0.000050$ とさらに小さい($p=q$ のときは 3 次の項 $npR(u)+nqR(v)$ の主要部が打ち消し合うためである。この点はここでは証明しない)。

Gauss 積分

局所極限定理から Gauss 積分の値が得られる。そのために 2 つの補題を用意する。

格子点での Riemann 和

$a< b$ とし、$g$ を $[a-1,b+1]$ で連続な関数とする。$h>0$ と実数 $c$ について、格子 $c+h\mathbb{Z}=\{c+jh : j\in\mathbb{Z}\}$ に属する $[a,b]$ の点全体にわたる和を $T(h,c):=h\sum_{t\in(c+h\mathbb{Z})\cap[a,b]}g(t)$ とおく。このとき $h\to0$ で、$c$ について一様に $T(h,c)\to\int_a^bg(x)\,dx$ である。

小区間ごとに比べる

$M:=\max_{[a-1,b+1]}|g|$ とし、$\omega(h):=\max\{|g(s)-g(t)| : s,t\in[a-1,b+1],\ |s-t|\le h\}$ とおく。閉区間上の連続関数は一様連続なので $\omega(h)\to0$ である(この事実は証明しない)。$0< h<\min(1,b-a)$ とし、$[a,b]$ に属する格子点を $t_1< t_2<\cdots< t_r$ とする($r\ge1$ であり、$t_1< a+h$、$t_r>b-h$)。
$$ T(h,c)-\int_{t_1}^{t_r+h}g(x)\,dx=\sum_{i=1}^r\int_{t_i}^{t_i+h}\bigl(g(t_i)-g(x)\bigr)\,dx $$
の絶対値は $rh\,\omega(h)\le(b-a+h)\,\omega(h)$ 以下である。また区間 $[t_1,t_r+h]$ と $[a,b]$ は両端でそれぞれ長さ $h$ 以下しか違わないので、$\bigl|\int_{t_1}^{t_r+h}g-\int_a^bg\bigr|\le2hM$ である。どちらの評価も $c$ によらず、$h\to0$ で $0$ に近づく。$\square$

高校の区分求積法 $\frac1n\sum_{k=1}^ng\bigl(\frac kn\bigr)\to\int_0^1g(x)\,dx$ は、$g$ を $[-1,2]$ へ連続に延ばせば $h=\frac1n$、$c=0$、$[a,b]=[0,1]$ の場合($t=0$ の項を除く)である。

二項分布の Chebyshev の不等式

$A>0$ について
$$ P\bigl(|S_n-np|\ge A\sigma_n\bigr)\le\frac1{A^2} $$
である。

分散の式で下から抑える

prop-btn-mean-variance により
$$ \sigma_n^2=\sum_{k=0}^n(k-np)^2P(S_n=k)\ge\sum_{k:\ |k-np|\ge A\sigma_n}(k-np)^2P(S_n=k)\ge A^2\sigma_n^2\,P\bigl(|S_n-np|\ge A\sigma_n\bigr) $$
である。両辺を $A^2\sigma_n^2>0$ で割ればよい。$\square$

Gauss 積分

$$ \int_{-\infty}^\infty e^{-x^2/2}\,dx=\sqrt{2\pi},\qquad\text{すなわち}\qquad\int_{-\infty}^\infty\varphi(x)\,dx=1 $$
である。

二項分布の確率の和が 1 であることを使う

$p=\frac12$ として $S_n$ を $B(n,\frac12)$ に従う確率変数とする(どの $0< p<1$ でも同じ議論ができる)。$A>0$ を固定し、
$$ P\bigl(|Z_n|\le A\bigr)=\sum_{k:\ |x_{n,k}|\le A}P(S_n=k)=\sum_{k:\ |x_{n,k}|\le A}\frac1{\sigma_n}\varphi(x_{n,k})\bigl(1+\varepsilon_{n,k}\bigr) $$
と書く。thm-btn-local により $\varepsilon_n:=\max_{|x_{n,k}|\le A}|\varepsilon_{n,k}|\to0$ である。点 $x_{n,k}$ は格子 $-\frac{np}{\sigma_n}+\frac1{\sigma_n}\mathbb{Z}$ の点なので、lem-btn-riemann($h=\frac1{\sigma_n}\to0$)により $J_n:=\sum_{|x_{n,k}|\le A}\frac1{\sigma_n}\varphi(x_{n,k})\to\int_{-A}^A\varphi(x)\,dx$ である。ここで、$|x_{n,k}|\le A$ を満たす格子点は $n$ が大きければすべて $0\le k\le n$ の範囲にあることに注意する($A\sigma_n< np$ かつ $A\sigma_n< nq$ となるため)。$|P(|Z_n|\le A)-J_n|\le\varepsilon_nJ_n\to0$ なので
$$ \lim_{n\to\infty}P\bigl(|Z_n|\le A\bigr)=\int_{-A}^A\varphi(x)\,dx $$
である。一方、確率の和は $1$ なので $P(|Z_n|\le A)\le1$ であり、lem-btn-chebyshev により $P(|Z_n|\le A)\ge1-\frac1{A^2}$ である。極限をとって
$$ 1-\frac1{A^2}\le\int_{-A}^A\varphi(x)\,dx\le1 $$
を得る。$A\to\infty$ とすると $\int_{-\infty}^\infty\varphi(x)\,dx=1$ である。$\varphi$ の定義から $\int_{-\infty}^\infty e^{-x^2/2}\,dx=\sqrt{2\pi}$ である。$\square$

Gauss 積分の値を高校の積分で示す方法は Gauss積分(高校数学) で扱う。
この証明は、定数 $\sqrt{2\pi}$ を Stirling の公式に負っている。逆に、Gauss 積分を別の方法(極座標や Wallis 積分)で求めておけば、Stirling の公式の定数が $\sqrt{2\pi}$ であることが同じ議論から導ける。$y=x/\sqrt2$ と置換すると、よく知られた形 $\int_{-\infty}^\infty e^{-y^2}\,dy=\sqrt\pi$ になる。

積分形の定理

de Moivre–Laplace の定理

$0< p<1$ を固定し、$Z_n=\frac{S_n-np}{\sigma_n}$ とする。実数 $a< b$ について
$$ \lim_{n\to\infty}P(a\le Z_n\le b)=\int_a^b\varphi(x)\,dx=\Phi(b)-\Phi(a) $$
である。また、すべての実数 $z$ について $\lim_{n\to\infty}P(Z_n\le z)=\Phi(z)$ である。

局所極限定理を足し合わせる

前半は、thm-btn-gauss の証明の前半で区間 $[-A,A]$ を $[a,b]$ に置き換えた議論そのものである($A:=\max(|a|,|b|)$ として thm-btn-local を使い、lem-btn-riemann を $[a,b]$ に使う)。
後半を示す。$\varepsilon>0$ をとり、$A>|z|$ を $\frac1{A^2}<\varepsilon$ かつ $\Phi(-A)<\varepsilon$ となるように選ぶ(thm-btn-gauss により $\Phi(-A)\to0$ である)。
$$ P(Z_n\le z)=P(-A\le Z_n\le z)+P(Z_n<-A) $$
の第 2 項は lem-btn-chebyshev により $\frac1{A^2}<\varepsilon$ 以下であり、第 1 項は前半により $\Phi(z)-\Phi(-A)$ に近づく。よって十分大きな $n$ で $|P(Z_n\le z)-\Phi(z)|<3\varepsilon$ である。$\square$

正規分布の平均と分散

正規分布の平均と分散

$Z$ が $N(0,1)$ に従うとき $E[Z]=\int_{-\infty}^\infty x\varphi(x)\,dx=0$、$V[Z]=\int_{-\infty}^\infty x^2\varphi(x)\,dx=1$ である。したがって $N(\mu,\sigma^2)$ の平均は $\mu$、分散は $\sigma^2$ である。

奇関数と部分積分

$|x|^j\varphi(x)$($j=1,2$)は $e^{-|x|/2}$ の定数倍で抑えられる($|x|^je^{-x^2/2}\le C_je^{-|x|/2}$)ので、広義積分は収束する。$x\varphi(x)$ は奇関数なので積分は $0$ である。$\varphi'(x)=-x\varphi(x)$ なので、部分積分により
$$ \int_{-R}^Rx^2\varphi(x)\,dx=\int_{-R}^Rx\cdot\bigl(-\varphi'(x)\bigr)\,dx=\Bigl[-x\varphi(x)\Bigr]_{-R}^R+\int_{-R}^R\varphi(x)\,dx $$
であり、$R\to\infty$ で $R\varphi(R)\to0$ と thm-btn-gauss から $V[Z]=1$ を得る。$\mu+\sigma Z$ の平均は $\mu$、分散は $\sigma^2V[Z]=\sigma^2$ である。$\square$

$N(np,npq)$ は、$B(n,p)$ と平均と分散が一致する正規分布である。thm-btn-integral は、標準化した二項分布が標準正規分布に近づくという主張であり、「$S_n$ は近似的に $N(np,npq)$ に従う」という高校の言い方の正確な意味はこれである。

高校の計算は特別な場合

正規分布表の意味

正規分布表は、$z\ge0$ に対する $\Phi(z)$(または $P(0\le Z\le z)=\Phi(z)-\frac12$)の数値の表である。$\varphi$ は偶関数なので $\Phi(-z)=1-\Phi(z)$ であり、$z\ge0$ の値だけで足りる。たとえば $\Phi(1)=0.8413$、$\Phi(1.96)=0.9750$、$\Phi(2)=0.9772$ である。$\Phi$ は初等関数では書けないことが知られており(証明しない)、表の値は数値計算で作られる。
高校で行う計算は、次の 2 つの段階に分かれる。

  1. 標準化:$X$ が $N(\mu,\sigma^2)$ に従うなら $\frac{X-\mu}\sigma$ は $N(0,1)$ に従うので、$P(a\le X\le b)=\Phi\bigl(\frac{b-\mu}\sigma\bigr)-\Phi\bigl(\frac{a-\mu}\sigma\bigr)$ である。これは def-btn-normal の直後の置換積分そのものであり、近似を含まない。
  2. 二項分布の正規近似:$S_n$ が $B(n,p)$ に従うとき、$P(a\le S_n\le b)\approx\Phi\bigl(\frac{b-np}{\sigma_n}\bigr)-\Phi\bigl(\frac{a-np}{\sigma_n}\bigr)$ とする。これは thm-btn-integral に基づく近似であり、$p$ を固定して $n\to\infty$ としたときに誤差が $0$ に近づく、という保証があるだけである。

連続補正

$S_n$ は整数値なので、$P(S_n\le k)$ と $P(S_n< k+1)$ は同じ値である。ところが正規近似をそのまま当てはめると、前者は $\Phi(x_{n,k})$、後者は $\Phi(x_{n,k+1})$ となって一致しない。連続補正とは、その中間をとって
$$ P(S_n\le k)\approx\Phi\Bigl(\frac{k+\frac12-np}{\sigma_n}\Bigr) $$
とする方法である。局所極限定理から、その理由がわかる。thm-btn-local により $P(S_n=j)\approx\frac1{\sigma_n}\varphi(x_{n,j})$ であり、右辺は、幅 $\frac1{\sigma_n}$、高さ $\varphi(x_{n,j})$ の長方形の面積である。この長方形は $x_{n,j}$ を中点とする区間 $\bigl[x_{n,j}-\frac1{2\sigma_n},\,x_{n,j}+\frac1{2\sigma_n}\bigr]$ の上に立てるのが自然で、その区間での $\varphi$ の積分とよく一致する(中点公式)。$j\le k$ の長方形を並べると右端は $x_{n,k}+\frac1{2\sigma_n}=\frac{k+\frac12-np}{\sigma_n}$ になる。
補正の有無による差は $\Phi\bigl(x+\frac1{2\sigma_n}\bigr)-\Phi(x)\le\frac{\varphi(0)}{2\sigma_n}$ 以下なので、$n\to\infty$ の極限では差がなく、どちらも thm-btn-integral と両立する。連続補正は、有限の $n$ での精度を上げる工夫である。改善の度合いの一般的な評価は証明せず、数値を ex-btn-coin に示す。

例と反例

外した仮定崩れる主張ボックス
$p$ を固定正規近似ex-btn-small-p
$x_{n,k}$ が有界比が $1$ に近づくex-btn-tail
硬貨を 100 回投げる

$S_{100}$ が $B(100,\frac12)$ に従うとき($\sigma_{100}=5$)、正確な値と正規近似は次のとおりである。

確率正確な値補正なし連続補正
$P(S_{100}\ge60)$$0.028444$$1-\Phi(2)=0.022750$$1-\Phi(1.9)=0.028717$
$P(45\le S_{100}\le55)$$0.728747$$\Phi(1)-\Phi(-1)=0.682689$$\Phi(1.1)-\Phi(-1.1)=0.728668$

1 点の確率では、$P(S_{100}=50)=\binom{100}{50}2^{-100}=0.079589$ に対し、局所極限定理の近似は $\frac{\varphi(0)}5=0.079788$ である。

さいころで 1 の目が出る回数

さいころを 600 回投げて 1 の目が出る回数 $S$ は $B(600,\frac16)$ に従い、平均 $100$、標準偏差 $\sigma=\sqrt{600\cdot\frac16\cdot\frac56}=9.1287\ldots$ である。$P(S\le90)$ の正確な値は $0.148715$、補正なしの近似は $\Phi(-10/\sigma)=0.136661$、連続補正つきの近似は $\Phi(-9.5/\sigma)=0.149014$ である。

反例:$p$ が 0 に近いとき

$n=100$、$p=\frac1{100}$ とすると、平均 $np=1$、分散 $npq=0.99$ である。正確な確率、Poisson 近似 $e^{-1}/k!$、連続補正つきの正規近似 $\Phi\bigl(\frac{k+\frac12-1}{\sigma}\bigr)-\Phi\bigl(\frac{k-\frac12-1}{\sigma}\bigr)$($\sigma=\sqrt{0.99}$)を比べると次のようになる。

$k$$P(S=k)$Poisson 近似正規近似
$0$$0.366032$$0.367879$$0.241817$
$1$$0.369730$$0.367879$$0.384697$
$2$$0.184865$$0.183940$$0.241817$
$3$$0.060999$$0.061313$$0.059842$

正規近似は $k=0$ と $k=2$ に同じ値を与える(正規分布は平均 $1$ について対称だからである)が、実際の分布は大きく非対称である。さらに正規近似は、起こりえない「負の回数」に確率 $\Phi\bigl(\frac{-\frac12-1}\sigma\bigr)=0.0658$ を与えてしまう。
破れている条件は「$p$ を固定して $n\to\infty$」である。thm-btn-local の証明の誤差の評価 $|\rho|\le\frac{2A^3}{3\sigma_n}$ などは $\sigma_n=\sqrt{npq}$ が大きいことを必要とするが、ここでは $\sigma_n\approx1$ であり、$n$ が大きくても誤差は小さくならない。この場合に正しい極限は、次の命題の Poisson 分布である。

少数の法則

$\lambda>0$ を固定し、$n>\lambda$ について $S_n$ が $B\bigl(n,\frac\lambda n\bigr)$ に従うとする。このとき各 $k=0,1,2,\dots$ について
$$ \lim_{n\to\infty}P(S_n=k)=e^{-\lambda}\frac{\lambda^k}{k!} $$
である。

因子ごとの極限

$n>k$ のとき
$$ P(S_n=k)=\binom nk\Bigl(\frac\lambda n\Bigr)^k\Bigl(1-\frac\lambda n\Bigr)^{n-k}=\frac{\lambda^k}{k!}\cdot\frac{n(n-1)\cdots(n-k+1)}{n^k}\cdot\Bigl(1-\frac\lambda n\Bigr)^n\cdot\Bigl(1-\frac\lambda n\Bigr)^{-k} $$
である。第 2 因子は $\prod_{i=0}^{k-1}\bigl(1-\frac in\bigr)\to1$、第 4 因子は $\to1$ である。第 3 因子は、ネイピア数の性質 $\lim_{n\to\infty}\bigl(1+\frac an\bigr)^n=e^a$($a=-\lambda$)により $e^{-\lambda}$ に近づく。$\square$

$(1-\frac\lambda n)^n\to e^{-\lambda}$ のような極限は 1の∞乗型の極限 で扱う。

注意:$n$ が小さいとき

$n=10$、$p=\frac12$ では $\sigma_{10}=\sqrt{2.5}=1.5811\ldots$ である。$P(S_{10}\ge9)=\frac{11}{1024}=0.010742$ に対し、補正なしの近似は $1-\Phi(4/\sigma_{10})=0.005706$(約半分)、連続補正つきは $1-\Phi(3.5/\sigma_{10})=0.013428$(25% ほど大きい)である。$P(S_{10}=10)=\frac1{1024}=0.000977$ に対しては、連続補正つきの近似 $1-\Phi(4.5/\sigma_{10})=0.002213$ が 2 倍以上になる。一方、中央の $P(S_{10}=5)=0.246094$ に対する局所近似 $\varphi(0)/\sigma_{10}=0.252313$ の誤差は 2.5% ほどである。
これは定理の反例でなく、有限の $n$ での精度の注意である。thm-btn-local の相対誤差は $\frac1{\sigma_n}$ 程度の大きさなので、$\sigma_n\approx1.6$ では端の方で精度が出ない。実用上は「$np\ge5$ かつ $nq\ge5$ なら正規近似を使ってよい」などの目安が使われるが、これは経験則であって定理ではない。

反例:分布の裾では比が 1 に近づかない

$p=\frac12$ で $k=n$(すべて表)の場合を考える。$x_{n,n}=\frac{n-n/2}{\sqrt n/2}=\sqrt n$ なので、局所近似は $\frac{\varphi(\sqrt n)}{\sigma_n}=\frac2{\sqrt{2\pi n}}e^{-n/2}$ であり、正確な値 $2^{-n}$ との比は
$$ \frac{\varphi(\sqrt n)/\sigma_n}{2^{-n}}=\frac2{\sqrt{2\pi n}}\Bigl(\frac2{\sqrt e}\Bigr)^n\longrightarrow\infty $$
である($\frac2{\sqrt e}=1.213\ldots>1$)。比は $n=10,50,100$ でそれぞれ $1.74$、$1764$、$1.95\times10^7$ になる。どちらの値も非常に小さいので差(絶対誤差)は小さいが、比(相対誤差)はまったく $1$ に近づかない。
破れている条件は thm-btn-local の「$|x_{n,k}|\le A$($A$ は $n$ によらない定数)」である。$x_{n,n}=\sqrt n$ はどんな固定した $A$ もいずれ超えるので、定理の範囲外にある。まれな事象の確率を正規近似で見積もると、桁違いの誤りになりうる。

中心極限定理(紹介)

$S_n$ は、成功なら $1$、失敗なら $0$ をとる独立な確率変数 $X_1,\dots,X_n$ の和であった。$X_i$ の分布を一般の離散型や密度をもつ型にしても同じことが成り立つ。これが中心極限定理である。この記事では証明しない(GS06 Theorem 9.4・9.6。値が有界な場合の証明の概略は同書 §10.3)。

中心極限定理の主張

$X_1,X_2,\dots$ を独立で同じ分布(離散型か、密度をもつもの)に従う確率変数とし、平均 $\mu$ と分散 $\sigma^2>0$ が存在する(有限である)とする。$S_n:=X_1+\cdots+X_n$ とすると、実数 $a< b$ について
$$ \lim_{n\to\infty}P\Bigl(a\le\frac{S_n-n\mu}{\sigma\sqrt n}\le b\Bigr)=\Phi(b)-\Phi(a) $$
である。

thm-btn-integral は、$X_i$ が値 $0,1$ を確率 $q,p$ でとる場合($\mu=p$、$\sigma^2=pq$)である。一般の分布の場合の証明には、特性関数などの別の道具が要る。

さいころの目の和

さいころを 100 回投げたときの目の和 $S$ は、平均 $350$、分散 $100\cdot\frac{35}{12}$、標準偏差 $17.078\ldots$ である。$P(S\ge380)$ の正確な値(100 回の畳み込みで計算)は $0.042032$ であり、中心極限定理による連続補正つきの近似 $1-\Phi\bigl(\frac{379.5-350}{17.078}\bigr)=0.042053$ とよく一致する(補正なしでは $0.039491$)。

分散が有限という仮定は外せない。たとえば密度 $\frac1{\pi(1+x^2)}$ の Cauchy 分布は平均も分散ももたず、独立な $n$ 個の平均がふたたび同じ Cauchy 分布に従うことが知られている(GS06 Example 8.8。証明しない)。したがって、どのように標準化しても正規分布には近づかない。

さらに先へ

  • 誤差の評価:中心極限定理の近似の誤差は、$E|X_i-\mu|^3$ が有限なら $\frac{C\,E|X_i-\mu|^3}{\sigma^3\sqrt n}$ 以下である(Berry–Esseen の定理。$C$ は分布によらない定数)。thm-btn-local の証明で相対誤差が $\frac1{\sigma_n}$ 程度だったことに対応する。
  • 大偏差:ex-btn-tail のような裾の確率は、正規近似ではなく $e^{-nI(x)}$ の形の評価(Cramér の定理)で正しく捉えられる。
  • 一般の局所極限定理:整数値の独立同分布の和についても、値の間隔についての条件のもとで成り立つ(GS06 Theorem 9.3)。
    これらはいずれもこの記事では証明しない。

関連項目

参考文献

Mathpediaは寄付と、参考文献の書籍リンク(Amazonアソシエイト)の紹介料で運営されています。 支援について / 寄付する