確率の公理では、有限集合 $\Omega$ の部分集合(事象)$A$ に、$P(A)\ge0$、$P(\Omega)=1$、交わらない $A,B$ で $P(A\cup B)=P(A)+P(B)$ を満たす数 $P(A)$ を与える。高校の「同様に確からしい」は各結果に $1/|\Omega|$ を置く場合にあたる。$P(B)>0$ のとき $P(A\mid B)=P(A\cap B)/P(B)$ で定める条件付き確率から乗法定理・全確率の公式・Bayes の定理が導かれ、有病率 $1\%$、病気の人の陽性率 $90\%$、偽陽性率 $5\%$ の検査では、陽性者が病気の確率は $2/13$ である。独立性は $P(A\cap B)=P(A)P(B)$ で定義され、2 つずつ独立でも互いに独立とは限らない。結果が無限個だと「無作為」が一つに決まらない場合がある(Bertrand の逆説)。
前提知識: 集合, 場合の数の数え方の体系, 二項係数
高校では、確率を次のように定める。起こりうる結果が有限個で、どの結果も同様に確からしいとき、事象 $A$ の確率は
$$
P(A)=\frac{A\text{ に含まれる結果の個数}}{\text{すべての結果の個数}}
$$
である。
さいころを 2 個投げて目の和が $7$ になる確率は、目の組 $(a,b)$ の $36$ 通りのうち $(1,6),(2,5),\dots,(6,1)$ の $6$ 通りなので $\frac6{36}=\frac16$ である。
この定義は分かりやすいが、3 つの弱点がある。
2 個のさいころを区別せず、結果を目の組 $\{a,b\}$(順序を問わない)とすると、結果は $21$ 通りになる。この $21$ 通りを同様に確からしいとすると $\{1,1\}$ の確率は $\frac1{21}$ になるが、実際のさいころでは $\frac1{36}$ である($\{1,2\}$ は $(1,2)$ と $(2,1)$ の 2 通りから生じ、$\frac2{36}$ である)。同じ実験でも、結果の書き方によって「同様に確からしい」が成り立ったり成り立たなかったりする。18 世紀の数学者 d'Alembert は、硬貨を 2 回投げたときの表の回数 $0,1,2$ を同様に確からしいとし、それぞれに確率 $\frac13$ を割り当てたという(GS06 §1.2 の Historical Remarks、pp. 30–31)。結果を $(\text{表},\text{表}),(\text{表},\text{裏}),(\text{裏},\text{表}),(\text{裏},\text{裏})$ の 4 通りとすれば、表の回数が $0,1,2$ である確率は $\frac14,\frac12,\frac14$ であり、硬貨を実際に投げた頻度もこちらに合う。玉を区別するか・しないかで数え方が変わるという場合の数の問題が、そのまま確率の問題になっている。
弱点 (2) について。表の出る確率が $0.3$ の硬貨や、出る目に偏りのあるさいころは、そのままでは扱えない。$0.3=\frac3{10}$ なら 10 通りの架空の結果を考える工夫もできるが、表の確率が $\frac1{\sqrt2}$ のような無理数なら、どんな有限個の同様に確からしい結果の個数の比にもならない。
弱点 (3) について。「正の整数を 1 つ無作為に選ぶ」「円の弦を無作為に引く」では、分母の「すべての結果の個数」が無限大になる。
本記事では、(2) を解決し(→ prop-pcp-weights、ex-pcp-loaded-die)(1) を「モデルの選び方」の問題として切り分ける有限確率空間の公理(→ def-pcp-finite-space)を述べ、その上で条件付き確率・乗法定理・全確率の公式・Bayes の定理・独立性を定義と証明つきで展開する。(3) の無限の場合は、Bertrand の逆説(→ ex-pcp-bertrand)を例に、何が問題になるかの紹介にとどめる。
高校の計算と大学の概念は次のように対応する。
| 高校 | 大学 | ボックス |
|---|---|---|
| 同様に確からしい | 一様な確率 $p(\omega)=\frac1N$ | prop-pcp-weights |
| 余事象・和事象の公式 | 公理から導く基本性質 | prop-pcp-basic |
| $B$ を全体とみて数える | $P(A\cap B)/P(B)$ | def-pcp-conditional |
| 確率の乗法定理 | 条件付き確率の積 | thm-pcp-multiplication |
| 原因の確率 | Bayes の定理 | thm-pcp-bayes |
| 独立な試行 | 確率空間の積 | prop-pcp-product |
「同様に確からしい」から取り出すべき性質は、確率が $0$ 以上であること、全体の確率が $1$ であること、互いに交わらない事象の確率は足し算になること、の 3 つである。これを定義にする。
$\Omega$ を空でない有限集合とする。$\Omega$ の部分集合を事象、$\Omega$ の元を根元事象(結果)という。$\Omega$ の部分集合全体の上で定義された実数値関数 $P$ が次の 3 条件を満たすとき、組 $(\Omega,P)$ を有限確率空間、$P(A)$ を事象 $A$ の確率という。
根元事象の確率 $p(\omega):=P(\{\omega\})$ を与えれば、確率はすべて決まる。
$(\Omega,P)$ を有限確率空間とすると、$p(\omega):=P(\{\omega\})$ は $p(\omega)\ge0$、$\sum_{\omega\in\Omega}p(\omega)=1$ を満たし、すべての事象 $A$ について $P(A)=\sum_{\omega\in A}p(\omega)$ である。逆に、$p(\omega)\ge0$、$\sum_{\omega\in\Omega}p(\omega)=1$ を満たす関数 $p\colon\Omega\to\mathbb{R}$ が与えられると、$P(A):=\sum_{\omega\in A}p(\omega)$ は 3 条件を満たす。
加法性を繰り返し使うと(帰納法)、互いに交わらない事象 $A_1,\dots,A_m$ について $P(A_1\cup\cdots\cup A_m)=P(A_1)+\cdots+P(A_m)$ である。空集合については $P(\emptyset)=P(\emptyset\cup\emptyset)=2P(\emptyset)$ から $P(\emptyset)=0$ である。$A\ne\emptyset$ は 1 点集合 $\{\omega\}$($\omega\in A$)の互いに交わらない和なので $P(A)=\sum_{\omega\in A}p(\omega)$ であり、$A=\Omega$ として $\sum_\omega p(\omega)=1$ を得る。$p(\omega)\ge0$ は条件 1 である。逆は、項が $0$ 以上であることから条件 1、$\sum_{\omega\in\Omega}p(\omega)=1$ から条件 2、$A\cap B=\emptyset$ なら $A\cup B$ 上の和が $A$ 上の和と $B$ 上の和に分かれることから条件 3 が従う。$\square$
高校の「同様に確からしい」は、$\Omega$ が $N$ 個の元をもち、すべての $\omega$ で $p(\omega)=\frac1N$ とした特別な場合(一様な確率)で、このとき $P(A)=\frac{|A|}N$ である。
表の確率が $0.3$ の硬貨は $\Omega=\{\text{表},\text{裏}\}$、$p(\text{表})=0.3$、$p(\text{裏})=0.7$ で表せる。6 の目が出やすいさいころを $p(6)=\frac14$、$p(1)=\cdots=p(5)=\frac3{20}$ とすると $\frac14+5\cdot\frac3{20}=1$ であり、prop-pcp-weights により偶数の目の確率は $\frac3{20}+\frac3{20}+\frac14=\frac{11}{20}$ である。
弱点 (1) については、公理は「どの $p$ が現実の実験に合うか」を決めない、という答えになる。$\Omega$ と $p$ の選び方はモデル化の問題で、2 個のさいころなら 36 通りの目の組に一様な確率を置くのが実験とよく合う。
高校で使う計算規則は、公理から導かれる。
有限確率空間の事象 $A,B$ について、次が成り立つ。$A^c:=\Omega\setminus A$ は $A$ の補事象である。
事象の包含・補集合と de Morgan の法則は 集合と論理:必要条件・十分条件 で扱う。
高校では、「$B$ が起こったときに $A$ が起こる確率」を、$B$ を新しい全体とみて $\frac{|A\cap B|}{|B|}$ と計算する。分母・分子を $|\Omega|$ で割れば $\frac{P(A\cap B)}{P(B)}$ であり、この形なら一様でない確率にも使える。
有限確率空間 $(\Omega,P)$ の事象 $A,B$ について、$P(B)>0$ のとき
$$
P(A\mid B):=\frac{P(A\cap B)}{P(B)}
$$
を、$B$ が起こったという条件のもとでの $A$ の条件付き確率という。$P(B)=0$ のときは定義しない。
一様な確率では $P(A\mid B)=\frac{|A\cap B|}{|B|}$ となり、高校の計算と一致する。条件付き確率は、「$B$ の外の結果の確率を $0$ にし、$B$ の中の結果の確率を、比を保ったまま合計 $1$ になるよう拡大する」操作である。実際、$\omega\in B$ なら $P(\{\omega\}\mid B)=\frac{p(\omega)}{P(B)}$、$\omega\notin B$ なら $0$ である。
2 個のさいころで、$B$ を「目の和が $7$」、$A$ を「少なくとも一方が $1$」とする。$A\cap B=\{(1,6),(6,1)\}$ なので $P(A\mid B)=\frac{2/36}{6/36}=\frac13$ である。条件をつけない $P(A)=\frac{11}{36}$ とは異なる。
$P(B)>0$ のとき、$A\mapsto P(A\mid B)$ は $\Omega$ 上の確率(def-pcp-finite-space の 3 条件を満たす関数)である。
$P(A\cap B)\ge0$ なので $P(A\mid B)\ge0$ である。$P(\Omega\mid B)=\frac{P(B)}{P(B)}=1$ である。$A_1\cap A_2=\emptyset$ なら $A_1\cap B$ と $A_2\cap B$ も交わらず、$(A_1\cup A_2)\cap B=(A_1\cap B)\cup(A_2\cap B)$ なので、$P(A_1\cup A_2\mid B)=\frac{P(A_1\cap B)+P(A_2\cap B)}{P(B)}=P(A_1\mid B)+P(A_2\mid B)$ である。$\square$
したがって prop-pcp-basic の性質は条件付き確率にもそのまま使える。例えば $P(A^c\mid B)=1-P(A\mid B)$ である。
定義の分母を払うと、積の確率を条件付き確率の積として計算する規則が得られる。
事象 $A_1,\dots,A_m$($m\ge2$)について $P(A_1\cap\cdots\cap A_{m-1})>0$ ならば
$$
P(A_1\cap\cdots\cap A_m)=P(A_1)\,P(A_2\mid A_1)\,P(A_3\mid A_1\cap A_2)\cdots P(A_m\mid A_1\cap\cdots\cap A_{m-1})
$$
である。特に $P(A)>0$ なら $P(A\cap B)=P(A)\,P(B\mid A)$ である。
$A_1\supset A_1\cap A_2\supset\cdots\supset A_1\cap\cdots\cap A_{m-1}$ なので、prop-pcp-basic の 2 により、右辺に現れる条件の事象の確率はすべて $P(A_1\cap\cdots\cap A_{m-1})$ 以上で正であり、右辺は定義される。$m=2$ では $P(A_2\mid A_1)=\frac{P(A_1\cap A_2)}{P(A_1)}$ の分母を払えばよい。$m-1$ 個で成り立つとすると、$C:=A_1\cap\cdots\cap A_{m-1}$ として $P(C\cap A_m)=P(C)\,P(A_m\mid C)$ であり、$P(C)$ に帰納法の仮定を使えば $m$ 個の場合を得る。$\square$
赤玉 3 個と白玉 2 個の入った袋から、戻さずに 1 個ずつ 2 回取り出す。$R_i$ を「$i$ 回目が赤」とすると、1 回目に赤を取り出した後の袋は赤 2 個・白 2 個なので $P(R_2\mid R_1)=\frac24$ であり、thm-pcp-multiplication により $P(R_1\cap R_2)=\frac35\cdot\frac24=\frac3{10}$ である。これは、5 個から 2 個を選ぶ $\binom52=10$ 通りのうち 2 個とも赤の $\binom32=3$ 通りという数え方と一致する。ここで「$P(R_2\mid R_1)=\frac24$」は袋の中身から判断したモデル化であり、これと $P(R_1)=\frac35$ を合わせて確率空間を作っている。
$\Omega$ を互いに交わらない事象 $B_1,\dots,B_m$ の和に分けたものを、$\Omega$ の分割という。「原因」$B_i$ ごとに結果 $A$ の起こりやすさが分かっているとき、$A$ の確率と、$A$ が起こったときの原因の確率を求める。
$B_1,\dots,B_m$ を $\Omega$ の分割で、すべての $i$ で $P(B_i)>0$ とする。すべての事象 $A$ について
$$
P(A)=\sum_{i=1}^mP(A\mid B_i)\,P(B_i)
$$
である。
$A=(A\cap B_1)\cup\cdots\cup(A\cap B_m)$ は互いに交わらない和なので、加法性により $P(A)=\sum_iP(A\cap B_i)$ である。thm-pcp-multiplication により $P(A\cap B_i)=P(B_i)\,P(A\mid B_i)$ である。$\square$
$B_1,\dots,B_m$ を $\Omega$ の分割で、すべての $i$ で $P(B_i)>0$ とし、$P(A)>0$ とする。各 $k$ について
$$
P(B_k\mid A)=\frac{P(A\mid B_k)\,P(B_k)}{\sum_{i=1}^mP(A\mid B_i)\,P(B_i)}
$$
である。
thm-pcp-multiplication により $P(A\cap B_k)=P(A)\,P(B_k\mid A)=P(B_k)\,P(A\mid B_k)$ である。$P(A)>0$ で割ると $P(B_k\mid A)=\frac{P(A\mid B_k)P(B_k)}{P(A)}$ であり、分母に thm-pcp-total-probability を代入すればよい。$\square$
$P(B_k)$ を事前確率、$P(B_k\mid A)$ を事後確率という。Bayes の定理は「$A$ を観測したことで、原因 $B_k$ の確率が $P(B_k)$ から $P(B_k\mid A)$ へ更新される」ことを表す。更新の倍率は $\frac{P(A\mid B_k)}{P(A)}$ である。
ある病気にかかっている人の割合が $1\%$ の集団で、検査を行う。病気の人が陽性になる確率は $90\%$、病気でない人が誤って陽性になる確率(偽陽性の確率)は $5\%$ とする。$D$ を「病気である」、$T$ を「陽性」とすると、$P(D)=0.01$、$P(T\mid D)=0.9$、$P(T\mid D^c)=0.05$ である。$D,D^c$ は $\Omega$ の分割なので、thm-pcp-total-probability により
$$
P(T)=0.9\times0.01+0.05\times0.99=0.009+0.0495=0.0585
$$
であり、thm-pcp-bayes により
$$
P(D\mid T)=\frac{0.009}{0.0585}=\frac2{13}=0.1538\ldots
$$
である。陽性でも、病気である確率は約 $15\%$ にすぎない。
人数で言い直すと分かりやすい。$10000$ 人のうち病気の人は $100$ 人で、そのうち $90$ 人が陽性になる。病気でない $9900$ 人のうち $495$ 人も陽性になる。陽性の $585$ 人のうち病気の人は $90$ 人で、$\frac{90}{585}=\frac2{13}$ である。病気でない人が圧倒的に多いので、偽陽性の確率が $5\%$ と小さくても、陽性者の大半は病気でない人になる。
同じ検査で、病気の人の割合が $10\%$ の集団なら $P(D\mid T)=\frac{0.09}{0.09+0.045}=\frac23$ となる。事後確率は、検査の精度だけでなく事前確率にも大きく依存する。
ex-pcp-false-positive では $P(T\mid D)=0.9$ だが $P(D\mid T)=\frac2{13}$ である。「$P(T\mid D)$ が大きいので $P(D\mid T)$ も大きい」という推論は正しくない。thm-pcp-bayes の $m=2$ の場合から $P(D\mid T)=P(T\mid D)\cdot\frac{P(D)}{P(T)}$ であり、両者が等しいのは $P(D)=P(T)$ のとき(または $P(T\mid D)=0$ のとき)に限る。ここでは $P(D)=0.01\ne0.0585=P(T)$ なので、両者は一致しない。
「$B$ が起こったと知っても $A$ の確率が変わらない」ことを、$P(A\mid B)=P(A)$ と書きたい。しかしこれは $P(B)>0$ のときしか意味をもたず、$A$ と $B$ について対称な形でもない。分母を払った形を定義に採る。
有限確率空間の事象 $A,B$ が
$$
P(A\cap B)=P(A)\,P(B)
$$
を満たすとき、$A$ と $B$ は独立であるという。事象 $A_1,\dots,A_m$ が互いに独立であるとは、$\{1,\dots,m\}$ の 2 個以上の元からなるすべての部分集合 $I$ について
$$
P\Bigl(\bigcap_{i\in I}A_i\Bigr)=\prod_{i\in I}P(A_i)
$$
が成り立つことをいう。$|I|=2$ のすべての $I$ について等式が成り立つとき、$A_1,\dots,A_m$ は 2 つずつ独立であるという(互いに独立なら 2 つずつ独立である)。
さいころを 1 回投げ、$A=\{2,4,6\}$、$B=\{1,2,3,4\}$ とする。$P(A\cap B)=P(\{2,4\})=\frac13=\frac12\cdot\frac23=P(A)P(B)$ なので、$A$ と $B$ は独立である。独立性は「別々の試行」でなくても成り立ちうる。
$P(B)>0$ のとき、$A$ と $B$ が独立であることと $P(A\mid B)=P(A)$ は同値である。また、$A$ と $B$ が独立なら $A$ と $B^c$ も独立である。
$P(A\mid B)=P(A)$ の両辺に $P(B)>0$ を掛けると $P(A\cap B)=P(A)P(B)$ になり、逆も同様である。後半は、$A$ が $A\cap B$ と $A\cap B^c$ の交わらない和であることから
$$
P(A\cap B^c)=P(A)-P(A\cap B)=P(A)-P(A)P(B)=P(A)\bigl(1-P(B)\bigr)=P(A)P(B^c)
$$
となることによる。$\square$
高校では「独立な試行」の確率を積で計算する。これは確率空間の積として正当化される。
有限確率空間 $(\Omega_1,P_1)$、$(\Omega_2,P_2)$ の根元事象の確率を $p_1,p_2$ とする。$\Omega:=\Omega_1\times\Omega_2$ 上に $p(\omega_1,\omega_2):=p_1(\omega_1)\,p_2(\omega_2)$ と定めると $(\Omega,P)$ は有限確率空間であり、事象 $A_1\subset\Omega_1$、$A_2\subset\Omega_2$ について、事象 $A_1\times\Omega_2$(1 回目の結果が $A_1$ に入る)と $\Omega_1\times A_2$(2 回目の結果が $A_2$ に入る)は独立で、$P(A_1\times A_2)=P_1(A_1)\,P_2(A_2)$ である。
$p\ge0$ であり、$\sum_{(\omega_1,\omega_2)}p_1(\omega_1)p_2(\omega_2)=\bigl(\sum_{\omega_1}p_1(\omega_1)\bigr)\bigl(\sum_{\omega_2}p_2(\omega_2)\bigr)=1$ なので、prop-pcp-weights により $(\Omega,P)$ は有限確率空間である。同じ分け方で $P(A_1\times A_2)=\sum_{\omega_1\in A_1}\sum_{\omega_2\in A_2}p_1(\omega_1)p_2(\omega_2)=P_1(A_1)P_2(A_2)$ である。$A_2=\Omega_2$ とすると $P(A_1\times\Omega_2)=P_1(A_1)$、$A_1=\Omega_1$ とすると $P(\Omega_1\times A_2)=P_2(A_2)$ であり、2 つの事象の共通部分は $A_1\times A_2$ なので、独立性の等式が成り立つ。$\square$
2 個のさいころの 36 通りの一様な確率は、1 個のさいころの一様な確率 2 つの積である。3 個以上の試行でも同様に積を作ると、各回の結果についての事象は互いに独立になる。
独立な試行の平均が期待値に近づく大数の法則は 大数の法則とさいころの平均 で扱う。
| 外した仮定 | 崩れる主張 | ボックス |
|---|---|---|
| $P(D)=P(T)$ | $P(T\mid D)=P(D\mid T)$ | ex-pcp-inverse-fallacy |
| 互いに独立(2 つずつ独立だけ) | 3 つの積の等式 | ex-pcp-pairwise-not-mutual |
| 2 つずつの等式(3 つの積の等式だけ) | 2 つずつの独立 | ex-pcp-triple-only |
| 独立(排反なだけ) | $P(A\cap B)=P(A)P(B)$ | ex-pcp-disjoint |
公平な硬貨を 2 回投げ、4 通りの結果に一様な確率を置く。$A$ を「1 回目が表」、$B$ を「2 回目が表」、$C$ を「2 回の結果が同じ」とする。$P(A)=P(B)=P(C)=\frac12$ であり、
$$
P(A\cap B)=P(A\cap C)=P(B\cap C)=P(\{(\text{表},\text{表})\})=\frac14
$$
なので、3 つの事象は 2 つずつ独立である。しかし $P(A\cap B\cap C)=\frac14\ne\frac18=P(A)P(B)P(C)$ なので、互いに独立ではない。実際、$A$ と $B$ が両方起これば $C$ は必ず起こり、$P(C\mid A\cap B)=1\ne\frac12=P(C)$ である。「2 つずつ独立ならば互いに独立」という含意は成り立たない。
$\Omega=\{1,2,\dots,8\}$ に一様な確率を置き、$A=B=\{1,2,3,4\}$、$C=\{1,5,6,7\}$ とする。$P(A\cap B\cap C)=P(\{1\})=\frac18=P(A)P(B)P(C)$ だが、$P(A\cap B)=\frac12\ne\frac14$、$P(A\cap C)=P(\{1\})=\frac18\ne\frac14$ なので、どの 2 つも独立でない。互いに独立の定義で、すべての部分集合 $I$ について等式を要求するのはこのためである。
さいころを 1 回投げ、$A$ を「1 の目」、$B$ を「2 の目」とする。$A\cap B=\emptyset$(排反)なので $P(A\cap B)=0\ne\frac1{36}=P(A)P(B)$ であり、$A$ と $B$ は独立でない。$A$ が起これば $B$ は決して起こらないので、$A$ が起こったことは $B$ について強い情報を与える。一般に $P(A)>0$、$P(B)>0$ の排反な事象は独立でない。「排反」と「独立」は別の概念である。
結果が無限個ある場合は、本記事の有限確率空間の範囲を超える。ここでは問題点を 2 つ紹介するにとどめ、一般論には立ち入らない。
加法性を、互いに交わらない可算無限個の事象の和にまで拡げた性質(可算加法性)を要求するとする。正の整数全体に、どの整数も同じ確率 $c$ で選ばれる確率があったとすると、$1=P(\{1,2,3,\dots\})=c+c+c+\cdots$ となるが、右辺は $c=0$ なら $0$、$c>0$ なら発散して $1$ にならない(GS06 §1.2 の Exercise 20、p. 37)。「無作為に選んだ整数が偶数である確率は $\frac12$」のような言い方は、$1$ から $N$ までの一様な確率での値の $N\to\infty$ での極限(自然密度)として理解する必要がある。
半径 $1$ の円に弦を無作為に引くとき、弦の長さが内接正三角形の 1 辺 $\sqrt3$ より長い確率を求める。「無作為に」の意味の取り方で答が変わる(GS06 §2.1 の Example 2.6、pp. 47–49。問題は Bertrand の 1889 年の著書による)。
3 つの計算はどれも正しい。違うのは確率空間(何を一様に選ぶか)であり、「無作為な弦」という言葉だけでは確率空間が 1 つに決まらない。有限の場合の弱点 (1) が、無限の場合にはさらに深刻な形で現れる。区間や円板の上の一様な確率を定義するには、長さや面積を一般の集合に拡げる必要があり、そのためにすべての部分集合ではなく特定の部分集合の族($\sigma$-加法族)の上で確率を定める。これが測度論にもとづく一般の確率空間である。
Mathpediaは寄付と、参考文献の書籍リンク(Amazonアソシエイト)の紹介料で運営されています。 支援について / 寄付する