期待値(expected value)とは、確率変数のとる値を、その確率で重みづけて平均したものである。有限または可算の標本空間 $\Omega$ と確率 $p$ の上の確率変数 $X$ では $E[X]=\sum_{\omega}X(\omega)p(\omega)=\sum_x x\,P(X=x)$ で、可算の場合は絶対値の和が有限であることを要する。最も重要な性質は線形性 $E[X+Y]=E[X]+E[Y]$ で、独立性を仮定せずに成り立つ。これにより、無作為な置換の不動点の個数の期待値が $1$ であることや、$n$ 種類が等確率・独立に出るおまけを全種類集めるまでの回数の期待値が $n(1+\frac12+\cdots+\frac1n)$ であることが求まる。積の等式 $E[XY]=E[X]E[Y]$ は独立なら成り立つが、独立性を仮定しないと一般には成り立たない。
さいころを 1 回振ったときの目は $1,2,\dots,6$ のどれかで、どれも確率 $1/6$ で出る。目の値を確率で重みづけて平均すると
$$
1\cdot\frac16+2\cdot\frac16+\cdots+6\cdot\frac16=\frac{21}6=3.5
$$
になる。これが目の期待値である。何度も振って出た目の平均をとると、回数を増やすにつれて $3.5$ に近づいていくことが知られている。$3.5$ という目は実際には出ないので、期待値は「いちばん出やすい値」でも「実際に出る値」でもなく、確率で重みづけた平均である。
期待値は足し算とよく両立する。さいころ 2 個の目の和の期待値は $3.5+3.5=7$ である。もう少し意外な例として、4 人が帽子を預け、帰りに無作為に 1 つずつ返されるとき、自分の帽子が戻ってくる人数の期待値はちょうど $1$ 人である(返し方は $4!=24$ 通りで、戻る人数の合計がちょうど $24$ になる。ex-expected-value-fixed-points)。人数が 100 人でも 1 万人でも、答えは $1$ 人のまま変わらない。こうした計算を支えるのが期待値の線形性(thm-expected-value-linearity)である。
本記事では、結果が有限個または可算個の場合(離散的な場合)に限って期待値を定義し、その性質を証明する。まず確率を割り当てる土台を定める。
空でない有限集合または可算集合 $\Omega$ と、関数 $p\colon\Omega\to[0,1]$ で $\sum_{\omega\in\Omega}p(\omega)=1$ を満たすものの組 $(\Omega,p)$ を離散確率空間という。$\Omega$ を標本空間、その元を根元事象(起こりうる結果)といい、$p(\omega)$ を $\omega$ の確率という。$\Omega$ の部分集合 $A$ を事象といい、その確率を
$$
P(A):=\sum_{\omega\in A}p(\omega)
$$
と定める。$\Omega$ が有限で $p(\omega)=1/|\Omega|$(すべての結果が同じ確率)のとき、一様な確率空間という。
$\Omega$ が可算無限のとき、和 $\sum_{\omega\in\Omega}p(\omega)$ は $\Omega$ の元を一列に並べた級数の和である。項が $0$ 以上の級数の和は、並べる順序や、項をいくつかずつまとめる方法によらない(Sho08 §8.10.1、付録 A6・A7、p. 270・564)。したがって $P(A)$ は並べ方によらずに定まり、$0\leq P(A)\leq1$、$P(\Omega)=1$、$P(\emptyset)=0$ を満たす。互いに交わらない事象 $A,B$ について $P(A\cup B)=P(A)+P(B)$ であり、特に $A$ の余事象 $\Omega\setminus A$ の確率は $1-P(A)$ である。$\Omega$ が有限の場合のこの定義は KT17 §10.1(p. 214–215)、可算の場合は Sho08 §8.10(p. 270–271)にある。一般の確率空間(測度論による定義)は非可算な標本空間も扱うが、本記事では用いない。
離散確率空間 $(\Omega,p)$ 上の関数 $X\colon\Omega\to\mathbb{R}$ を確率変数(random variable)という。事象 $\{\omega\in\Omega\mid X(\omega)=x\}$ を $\{X=x\}$ と書き、その確率を $P(X=x)$ と書く($\{X\geq a\}$ なども同様)。
$$
\sum_{\omega\in\Omega}|X(\omega)|\,p(\omega)<\infty
$$
のとき、$X$ は有限な期待値をもつといい、
$$
E[X]:=\sum_{\omega\in\Omega}X(\omega)\,p(\omega)
$$
を $X$ の期待値(expected value、expectation)という。$X$ が $0$ 以上の値だけをとるときは、和が発散する場合も含めて $E[X]\in[0,\infty]$ をこの式で定める。
$\Omega$ が有限なら、すべての確率変数は有限な期待値をもつ。可算無限の場合、絶対値の和が有限という条件は、$\sum X(\omega)p(\omega)$ が絶対収束して和が並べ方によらないことを保証するためのものである(Sho08 §8.10.4、p. 272–273)。この条件が外れると期待値が定まらないことがある(ex-expected-value-infinite)。
統計で集めたデータの「平均」は、各データを等しい確率 $1/(\text{個数})$ で選ぶ一様な確率空間での期待値にあたる。測度論に基づく一般の期待値(Lebesgue積分による定義)や、情報を与えたときの条件付き期待値は、本記事の定義を拡げたものである。
期待値は、確率を重みとする重みつき平均である。結果 $\omega$ の値 $X(\omega)$ を、その起こりやすさ $p(\omega)$ に応じて数え、足し合わせる。同じ試行を独立に何度も繰り返して値の平均をとると、回数を増やすにつれて期待値に近づく(大数の法則。KT17 p. 219 は言葉でこの意味を説明している)。賭けで言えば、1 回あたりの参加料が賞金の期待値に等しいとき、長く続けても損も得もしない公平な賭けになる。
期待値の最も強力な性質は線形性 $E[X+Y]=E[X]+E[Y]$ である。$X$ と $Y$ がどのように関係していても(独立でなくても)成り立つ。複雑な量を「起きたら $1$、起きなければ $0$」という単純な量の和に分ければ、それぞれの確率を足すだけで期待値が求まる。
$\Omega=\{1,2,\dots,6\}$ に一様な確率を入れ、$X(\omega)=\omega$ とすると $E[X]=\frac{1+2+\cdots+6}6=\frac72$ である。さいころ 2 個の場合は $\Omega=\{1,\dots,6\}^2$(36 通り、一様)で、目の和 $S(\omega_1,\omega_2)=\omega_1+\omega_2$ の期待値は、36 通りの和を直接足して $252/36=7$ と求まるが、thm-expected-value-linearity を使えば $S=X_1+X_2$($X_i$ は $i$ 個目の目)から $E[S]=\frac72+\frac72=7$ と計算なしで分かる。一方、2 個の目の大きい方 $\max(\omega_1,\omega_2)$ の期待値は $161/36=4.47\ldots$ で、1 個の目の期待値の和の形には書けない。
表の出る確率が $q$($0\leq q\leq1$)の硬貨を独立に $n$ 回投げる。$\Omega=\{0,1\}^n$($1$ が表)とし、表が $k$ 回の結果 $\omega$ に確率 $q^k(1-q)^{n-k}$ を割り当てる(二項定理により合計は $(q+(1-q))^n=1$)。表の回数 $X$ は、$i$ 回目が表なら $1$、裏なら $0$ となる確率変数 $X_i$ の和 $X=X_1+\cdots+X_n$ であり、$E[X_i]=P(X_i=1)=q$ なので、thm-expected-value-linearity により $E[X]=nq$ である。KT17 Example 10.18(p. 220)は同じ結果を $\sum_ii\binom ni q^i(1-q)^{n-i}$ を微分で計算して得ている。
$n$ 人が預けた帽子が無作為に返されるとする。$\Omega$ を $\{1,\dots,n\}$ の置換全体($n!$ 個、一様)とし、$\sigma\in\Omega$ の不動点($\sigma(i)=i$ となる $i$)の個数を $F(\sigma)$ とする。$\sigma(i)=i$ なら $F_i(\sigma)=1$、そうでなければ $F_i(\sigma)=0$ とおいて $F=\sum_{i=1}^nF_i$ と分けると、$\sigma(i)=i$ となる置換は残り $n-1$ 個の並べ方で $(n-1)!$ 個あるので $E[F_i]=\frac{(n-1)!}{n!}=\frac1n$ であり、$E[F]=n\cdot\frac1n=1$ である。$n=4$ で確かめると、24 通りの置換のうち不動点が $0,1,2,3,4$ 個のものはそれぞれ $9,8,6,0,1$ 通りで、不動点の個数の合計は $0\cdot9+1\cdot8+2\cdot6+3\cdot0+4\cdot1=24$、平均は $1$ である。不動点が 0 個の置換(完全順列)が 9 通りあることは Lev §3.8.3 Example 3.8.4(p. 295–296)で包除原理により数えられている。$F_i$ たちは互いに独立ではないが、線形性には独立性が要らない。
$n$ 人の誕生日が $N$ 日のどれかに等確率・独立に決まるとき、誕生日の一致する 2 人の組の個数の期待値は $\binom n2/N$ である。組 $\{i,j\}$ ごとに「$i$ と $j$ の誕生日が一致すれば $1$」という確率変数を作ると、それぞれの期待値は $1/N$ で、組は $\binom n2$ 個あるからである。$N=365$、$n=23$ では $253/365=0.693\ldots$ になる(誕生日のパラドックス の記事の命題「一致する組の個数の期待値」)。
$\Omega=\{1,2\}$、$p(1)=p(2)=\frac12$ とし、$X(1)=1$、$X(2)=-1$、$Y=X$ とする。$E[X]=E[Y]=0$ だが $XY=X^2=1$ なので $E[XY]=1\ne0=E[X]E[Y]$ である。$X$ と $Y$ は有限な期待値をもつという性質を満たすが、互いに独立であるという性質を満たさない($P(X=1,Y=1)=\frac12\ne\frac14=P(X=1)P(Y=1)$)。したがって「$E[XY]=E[X]E[Y]$」は、和についての線形性と違い、独立性の仮定を外すと成り立たない(prop-expected-value-product)。
$\Omega=\{1,2,3,\dots\}$、$p(k)=2^{-k}$ とする(公平な硬貨を表が出るまで投げ、投げた回数を $k$ とする設定。$\sum_k2^{-k}=1$)。$X(k)=2^k$ とすると、$X(k)p(k)=1$ がすべての $k$ について成り立つので $E[X]=\sum_k1=\infty$ である。$X$ のとる値はすべて有限だが、期待値は有限でない。次に $Y(k)=(-2)^k$ とすると、$\sum_k|Y(k)|p(k)=\infty$ で、$\sum_kY(k)p(k)=\sum_k(-1)^k$ は収束しない。この $Y$ は 0 以上の値だけをとるという性質も、絶対値の和が有限という性質も満たさないので、期待値は定義されない。可算無限の標本空間では、期待値が存在するかどうかを確かめる必要がある(Sho08 Example 8.47、p. 273 にも同種の例がある)。
thm-expected-value-linearity は有限個の和についての主張であり、無限個の和には一般には拡げられない。$\Omega=\{1,2,\dots\}$、$p(j)=2^{-j}$ とし、$i\geq1$ について $X_i(i)=2^i$、$X_i(i+1)=-2^{i+1}$、それ以外の $j$ で $X_i(j)=0$ と定める。$E[X_i]=2^i\cdot2^{-i}-2^{i+1}\cdot2^{-(i+1)}=0$ である。一方 $X:=\sum_{i\geq1}X_i$ は各 $j$ で有限個の項の和であり、$X(1)=X_1(1)=2$、$j\geq2$ では $X(j)=X_j(j)+X_{j-1}(j)=2^j-2^j=0$ なので、$E[X]=2\cdot\frac12=1\ne0=\sum_iE[X_i]$ である。各 $X_i$ は有限な期待値をもつが、$0$ 以上の値だけをとるという性質を満たさない。$0$ 以上の値だけをとる確率変数の無限和なら $E[\sum X_i]=\sum E[X_i]$ が成り立つ(Sho08 Theorem 8.40 と Example 8.49、p. 273–274)。
以下、$(\Omega,p)$ を離散確率空間とする。
確率変数 $X$ が有限な期待値をもつか、$0$ 以上の値だけをとるならば、$X$ のとる値の集合を $V:=X(\Omega)$ として
$$
E[X]=\sum_{x\in V}x\,P(X=x)
$$
である。特に $E[X]$ は $X$ の分布(各値 $x$ とその確率 $P(X=x)$ の組)だけで決まる。
$\Omega$ は互いに交わらない事象 $\{X=x\}$($x\in V$)の和集合であり、$V$ は有限集合か可算集合である。$\{X=x\}$ の上では $X(\omega)=x$ なので
$$
\sum_{\omega\in\{X=x\}}X(\omega)\,p(\omega)=x\sum_{\omega\in\{X=x\}}p(\omega)=x\,P(X=x)
$$
であり、これを $x\in V$ について足せば $\sum_{\omega\in\Omega}X(\omega)p(\omega)$ の項をまとめ直したものになる。項が $0$ 以上の場合、または絶対値の和が有限な場合、級数の和は項のまとめ方や順序によらない(Sho08 付録 A6・A7、p. 564)ので、両辺は等しい。$\Omega$ が有限なら単なる有限和の並べ替えである。
さいころの例では $V=\{1,\dots,6\}$、$P(X=x)=\frac16$ で、定義の式と同じ計算になる。KT17 §10.4(p. 218)と Sho08 §8.4 の式 (8.19)(p. 233)は、この式を期待値の言い換えとして挙げている。
確率変数 $X,Y$ が有限な期待値をもち、$a,b$ が実数ならば、$aX+bY$ も有限な期待値をもち
$$
E[aX+bY]=a\,E[X]+b\,E[Y]
$$
である。帰納法により、有限個の確率変数 $X_1,\dots,X_n$ が有限な期待値をもつならば $E[X_1+\cdots+X_n]=E[X_1]+\cdots+E[X_n]$ である。$X,Y$ の間に独立性などの関係は何も仮定しない。
各 $\omega$ で $|aX(\omega)+bY(\omega)|\leq|a|\,|X(\omega)|+|b|\,|Y(\omega)|$ なので
$$
\sum_\omega|aX(\omega)+bY(\omega)|\,p(\omega)\leq|a|\sum_\omega|X(\omega)|\,p(\omega)+|b|\sum_\omega|Y(\omega)|\,p(\omega)<\infty
$$
であり、$aX+bY$ は有限な期待値をもつ。収束する級数は項ごとに足したり定数倍したりできるので
$$
E[aX+bY]=\sum_\omega\bigl(aX(\omega)+bY(\omega)\bigr)p(\omega)=a\sum_\omega X(\omega)p(\omega)+b\sum_\omega Y(\omega)p(\omega)=a\,E[X]+b\,E[Y]
$$
である(三つの級数は $\Omega$ の同じ並べ方で書いておけばよい)。
証明は定義の和を分けるだけで、$X$ と $Y$ が互いにどう関係しているかを一度も使っていない。この性質は KT17 Proposition 10.17(p. 220、有限の場合)と Sho08 Theorem 8.14(p. 234)にあり、可算の場合への拡張は Sho08 p. 273 にある。$0$ 以上の値だけをとる確率変数については、期待値が $\infty$ になる場合も含めて $E[X+Y]=E[X]+E[Y]$ が成り立つ(項が $0$ 以上の級数は項ごとに足せる)。
事象 $A$ に対し、$\omega\in A$ なら $1$、そうでなければ $0$ をとる確率変数を $\mathbf{1}_A$ と書き、$A$ の指示確率変数という(集合の指示関数を確率変数とみたもの)。
事象 $A$ について $E[\mathbf{1}_A]=P(A)$ である。したがって事象 $A_1,\dots,A_n$ のうち実際に起こるものの個数 $N:=\mathbf{1}_{A_1}+\cdots+\mathbf{1}_{A_n}$ の期待値は
$$
E[N]=P(A_1)+\cdots+P(A_n)
$$
である。
$E[\mathbf{1}_A]=\sum_{\omega\in A}1\cdot p(\omega)+\sum_{\omega\notin A}0\cdot p(\omega)=P(A)$ である。後半は thm-expected-value-linearity による。
ex-expected-value-binomial、ex-expected-value-fixed-points、ex-expected-value-birthday は、どれも数えたい個数をこの形に分けて計算している。事象 $A_i$ が互いに独立でなくても、個々の確率 $P(A_i)$ さえ分かれば期待値が求まる。
確率変数 $X$ が $0$ 以上の値だけをとるとき、すべての $a>0$ について
$$
P(X\geq a)\leq\frac{E[X]}a
$$
である($E[X]=\infty$ の場合は右辺を $\infty$ とみて自明に成り立つ)。
各 $\omega$ で $X(\omega)\geq a\,\mathbf{1}_{\{X\geq a\}}(\omega)$ である($X(\omega)\geq a$ なら右辺は $a$、そうでなければ右辺は $0$ で、$X(\omega)\geq0$)。両辺に $p(\omega)\geq0$ を掛けて $\omega$ について足すと、$E[X]\geq a\,E[\mathbf{1}_{\{X\geq a\}}]=a\,P(X\geq a)$ を得る(prop-expected-value-indicator)。$a>0$ で割ればよい。
期待値だけから、値が大きくなる確率を押さえられる。たとえば公平な硬貨を $10000$ 回投げたとき、表の回数 $X$ の期待値は $5000$ なので、$P(X\geq7500)\leq\frac{5000}{7500}=\frac23$ である(KT17 Theorem 10.20 と直後の例、p. 221–222)。これは実際の確率よりはるかに大きい粗い評価である。分散 $V[X]:=E[(X-E[X])^2]$ も使う Chebyshev の不等式 $P(|X-E[X]|\geq a)\leq V[X]/a^2$ を使うと、この例では $V[X]=2500$ なので $P(X\geq7500)\leq P(|X-5000|\geq2500)\leq\frac{2500}{2500^2}=0.0004$ まで改良される(Sho08 Theorem 8.22・8.23、p. 241。$V[X]=2500$ は各回の表の指示確率変数の分散 $\frac14$ を $10000$ 回分足したもので、独立な確率変数の分散が足し合わされることは同書 Theorem 8.20 による)。
確率変数 $X,Y$ が独立であるとは、すべての実数 $x,y$ について
$$
P(X=x,\ Y=y)=P(X=x)\,P(Y=y)
$$
が成り立つことをいう。ここで左辺は事象 $\{X=x\}\cap\{Y=y\}$ の確率である。
確率変数 $X,Y$ がそれぞれ有限個の値だけをとり、互いに独立ならば、$E[XY]=E[X]\,E[Y]$ である。
$X,Y$ のとる値の集合を $V,W$(有限集合)とする。$\Omega$ は互いに交わらない有限個の事象 $\{X=x\}\cap\{Y=y\}$($x\in V$、$y\in W$)の和集合で、その上で $XY=xy$ である。$|XY|$ は有界なので $XY$ は有限な期待値をもち、prop-expected-value-by-values の証明と同じまとめ直しにより
$$
E[XY]=\sum_{x\in V}\sum_{y\in W}xy\,P(X=x,\ Y=y)=\sum_{x\in V}\sum_{y\in W}xy\,P(X=x)P(Y=y)=\Bigl(\sum_{x\in V}x\,P(X=x)\Bigr)\Bigl(\sum_{y\in W}y\,P(Y=y)\Bigr)
$$
である。最後の式は prop-expected-value-by-values により $E[X]E[Y]$ に等しい。
独立性の仮定は外せない(ex-expected-value-not-multiplicative)。有限個の値という仮定は、有限な期待値をもつという仮定に弱められる(Sho08 Theorem 8.15、p. 235、可算の場合は p. 274)。事象の独立性については 独立性(確率論) も参照。
確率変数 $X$ が $0$ 以上の整数値だけをとるならば、$\infty$ になる場合も含めて
$$
E[X]=\sum_{i=1}^{\infty}P(X\geq i)
$$
である。
prop-expected-value-by-values により $E[X]=\sum_{k\geq0}k\,P(X=k)$ であり、$k=\sum_{i=1}^k1$ と書くと
$$
E[X]=\sum_{k\geq1}\sum_{i=1}^{k}P(X=k)=\sum_{i\geq1}\sum_{k\geq i}P(X=k)=\sum_{i\geq1}P(X\geq i)
$$
である。2 番目の等号は、項が $0$ 以上の二重級数の和の順序を入れ替えたもので、和が $\infty$ の場合も含めて許される(Sho08 付録 A7、p. 564)。最後の等号は $P(X\geq i)=\sum_{k\geq i}P(X=k)$(互いに交わらない事象の和)による。
成功の確率が $q$($0< q\leq1$)の試行を、成功するまで独立に繰り返す。何回目に初めて成功するかを表す離散確率空間として、$\Omega=\{1,2,\dots\}$、$p(k)=(1-q)^{k-1}q$($k-1$ 回失敗してから成功する確率)をとる($\sum_kp(k)=q\sum_{k\geq0}(1-q)^k=1$)。$T(k)=k$ とおくと $P(T\geq i)=\sum_{k\geq i}(1-q)^{k-1}q=(1-q)^{i-1}$ なので、prop-expected-value-tail により
$$
E[T]=\sum_{i\geq1}(1-q)^{i-1}=\frac1q
$$
である(Sho08 Example 8.44・8.46・8.48、p. 271–274)。さいころで 1 の目が出るまでに振る回数の期待値は $6$ 回である。
お菓子を 1 個買うごとに $n$ 種類のおまけのどれかが等確率で、ほかの回とは独立に 1 つ付いてくるとする。全種類がそろうまでに買う個数 $T$ の期待値を求める。$i-1$ 種類がそろった時点から $i$ 種類目が初めて出るまでに買う個数を $T_i$ とすると、$T=T_1+T_2+\cdots+T_n$ である。$i-1$ 種類をもっているとき、次の 1 個で新しい種類が出る確率は $q_i=\frac{n-i+1}n$ で、各回は独立なので、$T_i$ は ex-expected-value-geometric の $T$ と同じ分布(成功確率 $q_i$)をもつ。thm-expected-value-linearity により
$$
E[T]=\sum_{i=1}^n\frac1{q_i}=\sum_{i=1}^n\frac n{n-i+1}=n\Bigl(1+\frac12+\cdots+\frac1n\Bigr)=nH_n
$$
である($H_n$ は調和級数の部分和)。$n=6$ なら $6\cdot\frac{49}{20}=14.7$ 個、$n=10$ なら $29.28\ldots$ 個、$n=50$ なら $224.96\ldots$ 個である。$H_n$ は $\log n$ とほぼ同じ速さで増える(調和級数 の記事の命題「積分による上下の評価」)ので、$E[T]$ はおよそ $n\log n$ である。
ここで、買い続ける過程全体を、無限に続きうる購入の列全体を標本空間にして表そうとすると、標本空間は可算でなくなる。全種類がそろった時点で止めた有限の購入列全体を標本空間にとれば、これは可算集合であり、離散確率空間の範囲で扱える(Sho08 Example 8.43 が硬貨投げの無限列を避けて可算の標本空間をとるのと同じ考え方、p. 270–271)。上の計算は、各 $T_i$ が成功確率 $q_i$ の回数の分布をもつことと、$T_1,\dots,T_n$ を同じ確率空間の上の確率変数として扱えることを前提として認めたものである。線形性を使うのに、$T_i$ たちの独立性は必要ない。
期待値のまわりの散らばりは分散 $V[X]=E[(X-E[X])^2]=E[X^2]-E[X]^2$ で測られる。有限個の確率変数が 2 つずつ独立ならば、和の分散は分散の和になり、これと Chebyshev の不等式から、独立に同じ分布に従う確率変数 $X_1,\dots,X_n$ の平均 $\frac{X_1+\cdots+X_n}n$ が $n\to\infty$ で期待値の近くに集中することが導かれる(弱い大数の法則。Sho08 Theorem 8.18–8.23 と式 (8.25)、p. 236–242)。冒頭の「何度も振った目の平均は $3.5$ に近づく」は、この法則の述べる内容である。
Mathpediaは寄付と、参考文献の書籍リンク(Amazonアソシエイト)の紹介料で運営されています。 支援について / 寄付する