確率変数の期待値と分散は、確率変数 $X$ のとる値 $x_i$ と確率 $p_i$ から $E(X)=\sum x_ip_i$、$V(X)=\sum(x_i-E(X))^2p_i$ として定まる、分布の中心(重心)とばらつきの量である。値が有限個の場合、期待値は根元事象ごとの和に書き直せ、そこから $E(aX+b)=aE(X)+b$、$V(aX+b)=a^2V(X)$、$V(X)=E(X^2)-E(X)^2$ と、独立性なしに成り立つ $E(X+Y)=E(X)+E(Y)$ が出る。$X$ と $Y$ が独立なら $E(XY)=E(X)E(Y)$ と $V(X+Y)=V(X)+V(Y)$ が成り立つが、独立でないと後者は一般に崩れる($Y=X$ など)。逆に、分散の和の公式が成り立っても独立とは限らない。分散は平均からの距離の 2 乗、共分散は内積とみることができる。
数学 B の「統計的な推測」は、確率変数とその期待値・分散から始まる。高校では、確率変数 $X$ のとる値と確率を表(確率分布)にまとめ、
$$
E(X)=\sum_{i}x_ip_i,\qquad V(X)=\sum_i\bigl(x_i-E(X)\bigr)^2p_i,\qquad \sigma(X)=\sqrt{V(X)}
$$
を計算する。データの平均値・分散(平均・中央値・分散)の「度数」を「確率」に置き換えたものである。まず 2 つの例で計算してみる。
公正なさいころを 1 回投げ、出た目を $X$ とする。$X$ は $1,2,\dots,6$ をそれぞれ確率 $\frac16$ でとる。
| $X$ | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| 確率 | $\frac16$ | $\frac16$ | $\frac16$ | $\frac16$ | $\frac16$ | $\frac16$ |
| $X-\frac72$ | $-\frac52$ | $-\frac32$ | $-\frac12$ | $\frac12$ | $\frac32$ | $\frac52$ |
期待値は
$$
E(X)=(1+2+3+4+5+6)\cdot\frac16=\frac{21}6=\frac72
$$
である。分散は、ずれ $X-\frac72$ の 2 乗に確率を掛けて足す。ずれは $\pm\frac12,\pm\frac32,\pm\frac52$ が 1 つずつなので
$$
V(X)=\Bigl(\frac14+\frac94+\frac{25}4\Bigr)\cdot2\cdot\frac16=\frac{35}4\cdot\frac13=\frac{35}{12}
$$
である。標準偏差は $\sigma(X)=\sqrt{35/12}=1.707\ldots$ である。
公正な硬貨を 3 枚投げ、表の枚数を $X$ とする。8 通りの出方は同様に確からしく、表が $k$ 枚の出方は $\binom3k$ 通りなので、分布は次のとおりである。
| $X$ | 0 | 1 | 2 | 3 |
|---|---|---|---|---|
| 確率 | $\frac18$ | $\frac38$ | $\frac38$ | $\frac18$ |
$$
E(X)=0\cdot\frac18+1\cdot\frac38+2\cdot\frac38+3\cdot\frac18=\frac{12}8=\frac32
$$
である。ずれ $X-\frac32$ は $-\frac32,-\frac12,\frac12,\frac32$ なので
$$
V(X)=\frac94\cdot\frac18+\frac14\cdot\frac38+\frac14\cdot\frac38+\frac94\cdot\frac18=\frac{9+3+3+9}{32}=\frac34
$$
である。
この 2 つの計算から、次の問いが出てくる。
| 高校の計算 | この記事での見方 | 大学の言葉 | ボックス |
|---|---|---|---|
| $E(X)=\sum x_ip_i$ | 根元事象ごとの和 $\sum_\omega X(\omega)P(\{\omega\})$ に等しい | 確率測度による積分 | lem-evr-omega-sum |
| $E(aX+b)=aE(X)+b$、$V(aX+b)=a^2V(X)$ | 和の線形性とずれの 2 乗 | 積分の線形性 | thm-evr-one |
| $V(X)=E(X^2)-E(X)^2$ | 2 乗を展開して期待値をとる | 平均からの距離の 2 乗 | thm-evr-one |
| $E(X+Y)=E(X)+E(Y)$ | いつでも成り立つ | 積分の線形性 | prop-evr-linearity |
| 独立なら $V(X+Y)=V(X)+V(Y)$ | ずれの積の期待値が 0 | 直交するベクトルのピタゴラスの定理 | thm-evr-indep、rem-evr-inner-product |
確率の土台は 確率の定義と条件付き確率 で扱った有限確率空間である。起こりうる結果(根元事象)全体の集合 $\Omega$ が有限集合で、各根元事象 $\omega$ に確率 $P(\{\omega\})\ge0$ が決まっていて、その総和が $1$ になっているものを考える。事象 $A$($\Omega$ の部分集合)の確率は $P(A)=\sum_{\omega\in A}P(\{\omega\})$ である。
有限確率空間 $(\Omega,P)$ の上の 確率変数 とは、各根元事象 $\omega$ に実数 $X(\omega)$ を 1 つずつ対応させる関数 $X\colon\Omega\to\mathbb{R}$ のことである。$X$ のとる相異なる値を $x_1,x_2,\dots,x_k$ とし、
$$
p_i:=P(X=x_i)=P\bigl(\{\omega\in\Omega\mid X(\omega)=x_i\}\bigr)\qquad(i=1,\dots,k)
$$
とおく。値と確率の組 $(x_i,p_i)_{i=1,\dots,k}$ を $X$ の 確率分布 という。$p_i\ge0$ であり、$p_1+p_2+\dots+p_k=1$ である。
最後の等式は、事象 $\{X=x_1\},\dots,\{X=x_k\}$ が互いに交わらず、合わせると $\Omega$ 全体になることから出る。各根元事象 $\omega$ では $X(\omega)$ がちょうど 1 つの値 $x_i$ に等しいからである。
公正なさいころを 2 個(1 個目と 2 個目を区別して)投げる。$\Omega$ は 36 個の組 $(a,b)$($a,b=1,\dots,6$)で、どの組も確率 $\frac1{36}$ である。
| $S$ | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 | 11 | 12 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 確率 $\times36$ | 1 | 2 | 3 | 4 | 5 | 6 | 5 | 4 | 3 | 2 | 1 |
確率変数 $X$ の確率分布を $(x_i,p_i)_{i=1,\dots,k}$ とする。
$$
E(X):=\sum_{i=1}^kx_ip_i
$$
を $X$ の 期待値(平均)という。$m:=E(X)$ とおくとき、
$$
V(X):=\sum_{i=1}^k(x_i-m)^2p_i,\qquad \sigma(X):=\sqrt{V(X)}
$$
をそれぞれ $X$ の 分散、標準偏差 という。
期待値は、数直線上の点 $x_i$ に重さ $p_i$ のおもりを置いたときの 重心(つり合う点)である。重心から見たずれに重さを掛けて足すと $0$ になる、というのがつり合いの式で、次の命題がそれを述べる。
確率変数 $X$ の確率分布を $(x_i,p_i)$、$m=E(X)$ とすると
$$
\sum_{i=1}^k(x_i-m)p_i=0
$$
である。
左辺を分けると $\sum_i(x_i-m)p_i=\sum_ix_ip_i-m\sum_ip_i$ である。第 1 項は定義により $m$ である。第 2 項は、def-evr-random-variable の後で見たとおり $\sum_ip_i=1$ なので $m\cdot1=m$ である。よって左辺は $m-m=0$ である。$\square$
分散は、重心からのずれの 2 乗を重さつきで平均したものである。ずれを 2 乗しないで足すと prop-evr-balance によりいつも $0$ になってしまうので、2 乗して符号を消している。定数 $a$ からのずれの 2 乗の期待値 $\sum(x_i-a)^2p_i$ が $a=m$ で最小になることは 平均値と二乗誤差 で示す。
ex-evr-two-dice の和 $S$ の期待値と分散を、定義どおりに計算する。分布は $7$ を中心に左右対称なので、ずれ $S-7$ が $-d$ と $+d$ になる確率は等しい。
$$
E(S)=\frac{2\cdot1+3\cdot2+4\cdot3+5\cdot4+6\cdot5+7\cdot6+8\cdot5+9\cdot4+10\cdot3+11\cdot2+12\cdot1}{36}=\frac{252}{36}=7.
$$
ずれ $S-7$ の 2 乗は $25,16,9,4,1,0,1,4,9,16,25$ なので
$$
V(S)=\frac{2(25\cdot1+16\cdot2+9\cdot3+4\cdot4+1\cdot5)}{36}=\frac{2\cdot105}{36}=\frac{35}6
$$
であり、$\sigma(S)=\sqrt{35/6}=2.415\ldots$ である。図1 は、この分布が $7$ でつり合う様子である。
$E(S)=7$ は 1 個の期待値 $\frac72$ の 2 倍、$V(S)=\frac{35}6$ は 1 個の分散 $\frac{35}{12}$ の 2 倍になっている。これが偶然でないことを prop-evr-linearity と thm-evr-indep で示す。
図1:さいころ 2 個の目の和の確率分布。棒の高さを重さとみると、期待値 7 の点でつり合う。緑の矢印は期待値から標準偏差 1 つ分(約 2.42)の範囲を表す。
高校では $E(X^2)$ を $\sum x_i^2p_i$ と計算する。しかし、定義 def-evr-mean-variance で $E(X^2)$ を求めるには、$X^2$ という確率変数の分布を作らなければならない。$X$ の値に $-1$ と $1$ があると、$X^2$ ではどちらも $1$ になり、値がまとまってしまう。それでも $\sum x_i^2p_i$ でよいことを保証するのが、次の補題である。
有限確率空間 $(\Omega,P)$ 上の確率変数 $X$ について
$$
E(X)=\sum_{\omega\in\Omega}X(\omega)P(\{\omega\})
$$
が成り立つ。さらに、実数から実数への関数 $g$ について、$g(X)$ を $\omega\mapsto g\bigl(X(\omega)\bigr)$ で定まる確率変数とすると、$X$ の確率分布 $(x_i,p_i)$ を使って
$$
E\bigl(g(X)\bigr)=\sum_{i=1}^kg(x_i)p_i
$$
と計算できる。
方針:右辺の和を、$X$ の値ごとの事象 $A_i:=\{\omega\mid X(\omega)=x_i\}$ に分けて計算する。
段 1(和を分ける)。def-evr-random-variable の後で見たとおり、$A_1,\dots,A_k$ は互いに交わらず、合わせると $\Omega$ である。したがって、$\Omega$ 全体の和は各 $A_i$ の上の和の合計に分けられる。
$$
\sum_{\omega\in\Omega}X(\omega)P(\{\omega\})=\sum_{i=1}^k\ \sum_{\omega\in A_i}X(\omega)P(\{\omega\}).
$$
段 2(各 $A_i$ の上では $X$ は一定)。$\omega\in A_i$ なら $X(\omega)=x_i$ なので、$x_i$ を和の外に出せる。
$$
\sum_{\omega\in A_i}X(\omega)P(\{\omega\})=x_i\sum_{\omega\in A_i}P(\{\omega\})=x_iP(A_i)=x_ip_i.
$$
2 つ目の等号は、事象の確率が根元事象の確率の和であること、3 つ目は $p_i$ の定義である。
段 3(まとめ)。段 1 と段 2 から右辺は $\sum_ix_ip_i=E(X)$ である。これで前半が示せた。
段 4($g(X)$ の場合)。前半を確率変数 $g(X)$ に使うと $E\bigl(g(X)\bigr)=\sum_{\omega\in\Omega}g\bigl(X(\omega)\bigr)P(\{\omega\})$ である。この和を段 1 と同じく $A_1,\dots,A_k$ に分ける。$\omega\in A_i$ なら $g\bigl(X(\omega)\bigr)=g(x_i)$ なので、段 2 と同じ計算で $A_i$ の上の和は $g(x_i)p_i$ になる。よって $E\bigl(g(X)\bigr)=\sum_ig(x_i)p_i$ である。ここでは $g(x_1),\dots,g(x_k)$ に同じ値があってもかまわない。値ごとにまとめる前の和で計算しているからである。$\square$
lem-evr-omega-sum の前半の式は、値ごとにまとめる前の「根元事象ごとの和」である。この形にすると、次の性質がすぐに出る。
同じ有限確率空間の上の確率変数 $U,W$ と実数 $a,b,c$ について
$$
E(aU+bW+c)=aE(U)+bE(W)+c
$$
が成り立つ。とくに $E(U+W)=E(U)+E(W)$ である。この等式に $U$ と $W$ の独立性は要らない。
$aU+bW+c$ は $\omega\mapsto aU(\omega)+bW(\omega)+c$ で定まる確率変数である。lem-evr-omega-sum の前半をこれに使い、和を 3 つに分ける。
$$
E(aU+bW+c)=a\sum_{\omega}U(\omega)P(\{\omega\})+b\sum_\omega W(\omega)P(\{\omega\})+c\sum_\omega P(\{\omega\}).
$$
第 1 項と第 2 項は、再び lem-evr-omega-sum の前半により $aE(U)$、$bE(W)$ である。第 3 項の和は $P(\Omega)=1$ である。よって右辺は $aE(U)+bE(W)+c$ である。この計算は $U$ と $W$ の関係を何も使っていない。$\square$
このように、個数を「$1$ か $0$ をとる確率変数の和」に分けて期待値を求める方法は、期待値の線形性と数え上げ で多くの数え上げの問題に使う。
確率変数 $X$ と実数 $a,b$ について、次が成り立つ。
方針:1 は prop-evr-linearity の特別な場合である。2 と 3 は、分散を「ずれの 2 乗の期待値」と書き直してから、線形性を使う。以下 $m:=E(X)$ とおく。
段 1(1 の証明)。prop-evr-linearity で $U=X$、$W=0$(いつも $0$ をとる確率変数)、係数を $a$、$0$、$b$ とすると $E(aX+b)=aE(X)+b$ である。
段 2(分散はずれの 2 乗の期待値)。lem-evr-omega-sum の後半を $g(x)=(x-m)^2$ として使うと
$$
E\bigl((X-m)^2\bigr)=\sum_{i=1}^k(x_i-m)^2p_i=V(X)
$$
である。最後の等号は分散の定義(def-evr-mean-variance)である。これで 3 の最初の等号が示せた。どんな確率変数 $Y$ についても、同じく $V(Y)=E\bigl((Y-E(Y))^2\bigr)$ である。
段 3(2 の証明)。$Y:=aX+b$ とおく。段 1 より $E(Y)=am+b$ なので、ずれは $Y-E(Y)=(aX+b)-(am+b)=a(X-m)$ である。段 2 を $Y$ に使うと
$$
V(aX+b)=E\bigl(a^2(X-m)^2\bigr)=a^2E\bigl((X-m)^2\bigr)=a^2V(X)
$$
である。2 つ目の等号は、段 1 の $E(aU)=aE(U)$ を $U=(X-m)^2$、係数 $a^2$ で使った。3 つ目は段 2 である。両辺の正の平方根をとると、$\sqrt{a^2}=|a|$ なので $\sigma(aX+b)=|a|\sigma(X)$ である。
段 4(3 の 2 つ目の等号)。$(X-m)^2=X^2-2mX+m^2$ である。prop-evr-linearity を $U=X^2$、$W=X$、係数 $1$、$-2m$、定数 $m^2$ として使うと
$$
E\bigl((X-m)^2\bigr)=E(X^2)-2mE(X)+m^2=E(X^2)-2m^2+m^2=E(X^2)-m^2
$$
である。段 2 と合わせて $V(X)=E(X^2)-E(X)^2$ が示せた。$\square$
賞金 $X$(円)が、$1000$ 円である確率 $\frac1{10}$、$100$ 円である確率 $\frac3{10}$、$0$ 円である確率 $\frac6{10}$ のくじを考える。
平均が $0$、標準偏差が $1$ になるように 1 次式で直すことを 標準化 という。
$\sigma(X)>0$ のとき、$Z:=\dfrac{X-E(X)}{\sigma(X)}$ は $E(Z)=0$、$V(Z)=1$ を満たす。
$m=E(X)$、$\sigma=\sigma(X)$ とおくと $Z=\frac1\sigma X-\frac m\sigma$ で、これは $a=\frac1\sigma$、$b=-\frac m\sigma$ の 1 次式である。thm-evr-one の 1 より $E(Z)=\frac1\sigma m-\frac m\sigma=0$、2 より $V(Z)=\frac1{\sigma^2}V(X)=\frac{\sigma^2}{\sigma^2}=1$ である。$\square$
さいころの目 $X$ では $m=\frac72$、$\sigma=\sqrt{35/12}=1.707\ldots$ である。$Z=\frac{X-3.5}{1.707\ldots}$ は $\pm0.292\ldots$、$\pm0.878\ldots$、$\pm1.463\ldots$ をそれぞれ確率 $\frac16$ でとる。値が $0$ を中心に対称なので $E(Z)=0$ である。$V(Z)=E(Z^2)=\frac{2(0.5^2+1.5^2+2.5^2)}{6}\cdot\frac{12}{35}=\frac{35}{12}\cdot\frac{12}{35}=1$ である。
標準化は、二項分布から正規分布へ で二項分布を正規分布と比べるときにも、区間推定(高校数学) で信頼区間を作るときにも使う。
分散について、もう 1 つ基本的な事実を確かめておく。
$V(X)\ge0$ である。したがって $E(X^2)\ge E(X)^2$ である。さらに、$V(X)=0$ となるのは $P(X=E(X))=1$、つまり $X$ が確率 $1$ で定数に等しいときに限る。
$V(X)=\sum_i(x_i-m)^2p_i$ の各項は、$0$ 以上の数 $(x_i-m)^2$ と $0$ 以上の数 $p_i$ の積なので $0$ 以上である。よって和も $0$ 以上であり、thm-evr-one の 3 から $E(X^2)-E(X)^2\ge0$ である。
$V(X)=0$ とすると、$0$ 以上の項の和が $0$ なので、すべての項が $0$ である。$p_i>0$ である $i$ については $(x_i-m)^2=0$、すなわち $x_i=m$ である。したがって $m$ 以外の値の確率はすべて $0$ で、$P(X=m)=1$ である。逆に $P(X=m)=1$ なら、$x_i\ne m$ である値の確率は $0$ なので、すべての項が $0$ になり $V(X)=0$ である。$\square$
ex-evr-sum-direct では、さいころ 2 個の和の分散が 1 個の分散の 2 倍になった。期待値の和の公式(prop-evr-linearity)は独立性なしに成り立つが、分散の和の公式には「独立」という条件が要る。まず 2 つの確率変数の関係を表す言葉を用意する。
同じ有限確率空間の上の確率変数 $X$、$Y$ のとる値を、それぞれ $x_1,\dots,x_k$、$y_1,\dots,y_l$ とする。
$$
r_{ij}:=P(X=x_i,\ Y=y_j)\qquad(i=1,\dots,k,\ j=1,\dots,l)
$$
の表を $X$ と $Y$ の 同時分布 という。ここで $P(X=x_i,\ Y=y_j)$ は、$X=x_i$ と $Y=y_j$ が両方起こる事象の確率である。すべての $i,j$ について
$$
P(X=x_i,\ Y=y_j)=P(X=x_i)\,P(Y=y_j)
$$
が成り立つとき、$X$ と $Y$ は 独立 であるという。
独立な試行(たとえば 2 個のさいころを別々に投げる)では、それぞれの試行の結果だけで決まる確率変数どうし(1 個目の目だけで決まるものと、2 個目の目だけで決まるもの)は独立になる。1 個目の目 $X$ と 2 つの目の和 $S$ のように、両方の試行の結果に関わる確率変数は独立とは限らない。実際 $P(X=1,\ S=12)=0$ だが、$P(X=1)P(S=12)=\frac16\cdot\frac1{36}$ である(ex-evr-joint の 3 も同じ種類の例)。事象の独立性と独立な試行は 確率の定義と条件付き確率 で扱う。
確率変数 $X$、$Y$ が独立ならば、次が成り立つ。
方針:1 は、根元事象を値の組 $(x_i,y_j)$ ごとにまとめ、独立性で確率を積に分ける。2 は、和のずれの 2 乗を展開し、現れる「ずれの積の期待値」が 1 によって $0$ になることを示す。$X$ の分布を $(x_i,p_i)$、$Y$ の分布を $(y_j,q_j)$ とする。
段 1(組ごとにまとめる)。$B_{ij}:=\{\omega\mid X(\omega)=x_i,\ Y(\omega)=y_j\}$ とおく。各根元事象 $\omega$ では $X(\omega)$ と $Y(\omega)$ の値がそれぞれちょうど 1 つに決まるので、$B_{ij}$($i=1,\dots,k$、$j=1,\dots,l$)は互いに交わらず、合わせると $\Omega$ である。$\omega\in B_{ij}$ なら $X(\omega)Y(\omega)=x_iy_j$ である。lem-evr-omega-sum の証明の段 1〜段 2 と同じように $B_{ij}$ ごとに和をまとめると
$$
E(XY)=\sum_{\omega\in\Omega}X(\omega)Y(\omega)P(\{\omega\})=\sum_{i=1}^k\sum_{j=1}^lx_iy_jP(B_{ij})
$$
である。
段 2(独立性で分ける)。独立性(def-evr-joint)より $P(B_{ij})=P(X=x_i,\ Y=y_j)=p_iq_j$ である。したがって
$$
E(XY)=\sum_{i=1}^k\sum_{j=1}^lx_ip_i\,y_jq_j=\Bigl(\sum_{i=1}^kx_ip_i\Bigr)\Bigl(\sum_{j=1}^ly_jq_j\Bigr)=E(X)E(Y)
$$
である。2 つ目の等号は、$(a_1+\dots+a_k)(b_1+\dots+b_l)$ を展開すると $a_ib_j$ がすべての組について 1 回ずつ現れること(分配法則)を、$a_i=x_ip_i$、$b_j=y_jq_j$ に使った。これで 1 が示せた。
段 3(和のずれを展開する)。$m:=E(X)$、$n:=E(Y)$ とおく。prop-evr-linearity より $E(X+Y)=m+n$ なので、$X+Y$ のずれは $(X-m)+(Y-n)$ である。thm-evr-one の証明の段 2 のとおり分散はずれの 2 乗の期待値だから、2 乗を展開して prop-evr-linearity を使うと
$$
V(X+Y)=E\bigl((X-m)^2\bigr)+E\bigl((Y-n)^2\bigr)+2E\bigl((X-m)(Y-n)\bigr)=V(X)+V(Y)+2E\bigl((X-m)(Y-n)\bigr)
$$
である。
段 4(ずれの積の期待値は 0)。$(X-m)(Y-n)=XY-nX-mY+mn$ なので、prop-evr-linearity より
$$
E\bigl((X-m)(Y-n)\bigr)=E(XY)-nE(X)-mE(Y)+mn=E(XY)-nm-mn+mn=E(XY)-mn
$$
である。段 2 より $E(XY)=mn$ なので、これは $0$ である。段 3 に戻すと $V(X+Y)=V(X)+V(Y)$ が得られる。$\square$
証明の段 4 に現れた $E\bigl((X-m)(Y-n)\bigr)$ を $X$ と $Y$ の 共分散 という。段 3 は、独立でなくても $V(X+Y)=V(X)+V(Y)+2\times(\text{共分散})$ が成り立つことを示している。共分散の性質と、$n$ 個の和への拡張は 標本平均の分散 で扱う。
2 の計算を $n$ 回くり返すと、$1$ か $0$ をとり $1$ の確率が $p$ の独立な確率変数 $n$ 個の和、つまり二項分布に従う確率変数の期待値は $np$、分散は $np(1-p)$ になる。この計算は 期待値の線形性と数え上げ と 二項分布から正規分布へ で扱う。
図2:期待値がどちらも 7 の 2 つの確率変数。左は 1 個の目を 2 倍した $2X$、右は独立な 2 個の目の和 $X+Y$。$2X$ の分散は $4V(X)$、$X+Y$ の分散は $2V(X)$ で、足し合わせるほうが中央に集まることを見る図。
図2 の 2 つは、どちらも「さいころの目を 2 つ足したもの」に見える。しかし $2X=X+X$ は同じ目を 2 回足し、$X+Y$ は独立な目を足す。前者は thm-evr-one の 2 により分散が $4\cdot\frac{35}{12}=\frac{35}3$、後者は thm-evr-indep の 2 により $\frac{35}6$ で、ちょうど半分である。独立なものを足すと、大きい目と小さい目が打ち消し合うことがあるので、ばらつきが相対的に小さくなる。この効果を $n$ 個の平均について調べたのが 標本平均の分散 であり、その極限が 大数の法則とさいころの平均 である。
thm-evr-indep の仮定「独立」を外したり、この記事の枠組み(値が有限個)を外したりすると、次のように結論が崩れる。最後から 2 行目は逆向きの注意で、独立は $V(X+Y)=V(X)+V(Y)$ の十分条件であって必要条件ではないことを示す。
| 外した仮定・注意 | 崩れる主張 | ボックス |
|---|---|---|
| 独立(同じ確率変数を 2 回足す) | $E(XY)=E(X)E(Y)$、$V(X+Y)=V(X)+V(Y)$ | ex-evr-counter-same |
| 独立(一方が増えると他方が減る) | $V(X+Y)=V(X)+V(Y)$ | ex-evr-counter-dependent |
| 独立(一方が他方の一部を含む) | $V(X+Y)=V(X)+V(Y)$ | ex-evr-counter-coins |
| 逆向き:分散の和の公式が成り立っても独立とは限らない | 「$V(X+Y)=V(X)+V(Y)$ ならば独立」 | ex-evr-uncorrelated |
| 値が有限個 | 期待値が存在すること | ex-evr-st-petersburg |
さいころの目 $X$ と、それ自身 $Y=X$ を考える。$P(X=1,\ Y=2)=0$ だが $P(X=1)P(Y=2)=\frac1{36}$ なので、独立でない。
さいころの目 $X$ と裏の面の目 $W=7-X$(ex-evr-two-dice の 3、ex-evr-joint の 2 で独立でないことを確かめた)を考える。$W$ も $X$ と同じ分布なので $V(W)=\frac{35}{12}$ である。
ex-evr-joint の 3 の $U$(1 枚目の表の枚数)と $T$(2 枚の表の枚数の合計)を考える。2 枚目の表の枚数を $U_2$ とすると $T=U+U_2$ で、$V(U)=\frac14$、$V(T)=\frac12$ である(ex-evr-indep-check の 2 と同じ計算)。
$U+T=2U+U_2$ は、4 通りの出方(裏裏、裏表、表裏、表表)に応じて $0,1,2,3$ をそれぞれ確率 $\frac14$ でとる。$E(U+T)=\frac{0+1+2+3}4=\frac32$、$E\bigl((U+T)^2\bigr)=\frac{0+1+4+9}4=\frac72$ なので、$V(U+T)=\frac72-\frac94=\frac54$ である。一方 $V(U)+V(T)=\frac34$ である。
満たさない性質:独立性。破る主張:thm-evr-indep の 2。共分散は $\frac12\bigl(\frac54-\frac34\bigr)=\frac14>0$ で、和の分散は分散の和より大きくなる。
$X$ が $-1,0,1$ をそれぞれ確率 $\frac13$ でとり、$Y=X^2$ とする。$P(X=0,\ Y=1)=0$ だが $P(X=0)P(Y=1)=\frac13\cdot\frac23=\frac29$ なので、$X$ と $Y$ は独立でない。
公正な硬貨を表が出るまで投げ続け、$j$ 回目に初めて表が出たら $2^j$ 円もらえるとする。賞金 $X$ は $2^j$ を確率 $\frac1{2^j}$ でとる($j=1,2,3,\dots$)。値が無限個あるので、def-evr-mean-variance の有限和は無限の和に置き換わる。最初の $N$ 項までの和は
$$
\sum_{j=1}^N2^j\cdot\frac1{2^j}=\underbrace{1+1+\dots+1}_{N\text{ 個}}=N
$$
で、$N$ を大きくするといくらでも大きくなる。したがって $\sum_jx_jp_j$ は有限の値に収束せず、$X$ の期待値は定まらない(St. Petersburg の逆説、GS06 Example 6.3)。
満たさない性質:値が有限個であること。破る主張:期待値が実数として存在すること。値が無限個の確率変数では、期待値の無限和が絶対収束する(各項の絶対値の和が有限の値に収束する)かどうかを調べなければならない。この例は項がすべて正なので、絶対収束しないことと収束しないことは同じである。
この記事では、根元事象が有限個の場合だけを扱った。大学では、同じことを一般の確率空間の上で行う。
lem-evr-omega-sum の式 $E(X)=\sum_{\omega}X(\omega)P(\{\omega\})$ は、「関数 $X$ の値に、その点の確率(重さ)を掛けて全体で足す」という形をしている。これは区分求積で作る積分 $\int f(x)\,dx$(区分求積と積分の定義)と同じ形で、大学では期待値を確率 $P$ による積分 $\int_\Omega X\,dP$ として定義する(確率空間、Lebesgue積分)。prop-evr-linearity は積分の線形性にあたる。値が連続的な確率変数では、和が確率密度関数による積分 $\int xf(x)\,dx$ に変わる(確率密度関数と連続型確率変数)。
有限確率空間の上の確率変数 $U$、$W$ に対し、$\langle U,W\rangle:=E(UW)$ とおく。prop-evr-linearity により、これは $U$ についても $W$ についても 1 次式であり、$\langle U,U\rangle=E(U^2)\ge0$ を満たす。つまりベクトルの内積と同じ性質をもつ(どの根元事象の確率も正なら、$\langle U,U\rangle=0$ となるのは $U=0$ のときだけである)。この内積で長さを $\|U\|:=\sqrt{E(U^2)}$ と測ると、次のように読める。
さいころ 1 個の $\Omega=\{1,\dots,6\}$(各確率 $\frac16$)の上で、確率変数を 6 個の値を並べたベクトルとみる。
値が無限個ある確率変数では、ex-evr-st-petersburg のように期待値が定まらないことがあり、和の絶対収束(各項の絶対値の和が有限であること)を仮定して同じ公式を使う(期待値、分散)。符号の変わる項の無限和は、足す順序を変えると値が変わることがあるので、ただの収束では足りない。値が連続的な確率変数は 確率密度関数と連続型確率変数 で扱う。独立な確率変数を $n$ 個足して平均すると分散が $\frac1n$ 倍になること(標本平均の分散)から、大数の法則とさいころの平均 と、和の分布が正規分布に近づくこと(二項分布から正規分布へ、中心極限定理)へ進む。これらは、標本から母集団の平均を推し量る 区間推定(高校数学) と 仮説検定(高校数学) の土台になる。一般の確率空間での定義は大学向けの用語解説 確率変数、独立性(確率論) にある。この記事の定義と 2 つの主定理は、GS06 第 6 章(Definition 6.1、6.3、Theorem 6.1、6.2、6.4、6.6〜6.8)にも、値が可算個の場合を含めて書かれている。
Mathpediaは寄付と、参考文献の書籍リンク(Amazonアソシエイト)の紹介料で運営されています。 支援について / 寄付する