母集団と標本

同義語:population and sample

概要

母集団と標本(population and sample)とは、調べたい集団全体(母集団)から一部(標本)を無作為に選び、標本から母集団を推し量る統計的な推測の枠組みである。無作為抽出とは、選んだ個体の列(取り出し方)がすべて同じ確率になる選び方で、毎回もとに戻す復元抽出と戻さない非復元抽出がある。母平均 $\mu$、母分散 $\sigma^2$、大きさ $N$ の母集団からの大きさ $n$ の標本平均 $\bar X$ は、どちらの抽出法でも $E(\bar X)=\mu$ を満たす。分散は復元抽出で $\frac{\sigma^2}n$、非復元抽出で $\frac{\sigma^2}n\cdot\frac{N-n}{N-1}$(有限母集団修正)で、非復元抽出では 2 回の取り出しの共分散が負になる。どの個体も同じ確率で選ばれても、取り出し方が同じ確率でない系統抽出では分散の式が崩れる。

$$\newcommand{C}[0]{\mathbb{C}} \newcommand{div}[0]{\mathbin{÷}} \newcommand{N}[0]{\mathbb{N}} \newcommand{Q}[0]{\mathbb{Q}} \newcommand{R}[0]{\mathbb{R}} \newcommand{Z}[0]{\mathbb{Z}} $$

前提知識: 確率変数の期待値と分散, 順列, 期待値の線形性と数え上げ

高校での出発点:札を 2 枚取り出す

ある集団の平均や割合を知りたいとき、全員を調べる 全数調査 は手間がかかる。そこで一部を選んで調べ、その結果から集団全体を推し量る。これが 標本調査 である。調べたい集団全体を 母集団、選び出した一部を 標本 という。
選び方には 2 通りある。1 つ選ぶたびにもとに戻して次を選ぶ 復元抽出 と、もとに戻さずに続けて選ぶ 非復元抽出 である。数学 B では主に復元抽出を考え、母集団が大きければ非復元抽出でもほとんど同じと説明する。「ほとんど同じ」がどのくらい同じなのかを、小さな例で確かめてみる。
$1,2,3,4,5$ の数が 1 つずつ書かれた 5 枚の札を母集団とする。札の数の平均は $3$、分散は $2$ である(ex-popn-with の冒頭で計算する)。ここから 2 枚を取り出し、2 枚の数の平均(標本平均)を考える。

復元抽出で 2 枚取る

まず札の数そのものの平均と分散を求めておく。平均は $\frac{1+2+3+4+5}5=3$、分散は $\frac{(1-3)^2+(2-3)^2+0^2+(4-3)^2+(5-3)^2}5=\frac{4+1+0+1+4}5=2$ である。
1 枚目を取って数を記録し、札を戻してよく混ぜてから 2 枚目を取る。1 枚目と 2 枚目の数の組 $(x_1,x_2)$ は $5\times5=25$ 通りで、どれも同じ確率 $\frac1{25}$ である。平均 $\frac{x_1+x_2}2$ の値と、その値になる組の数は次のとおりである。

平均$1$$1.5$$2$$2.5$$3$$3.5$$4$$4.5$$5$
組の数$1$$2$$3$$4$$5$$4$$3$$2$$1$

たとえば平均 $2$ になるのは $(1,3)$、$(2,2)$、$(3,1)$ の 3 通りである。平均の期待値は左右対称から $3$ である。分散は、$3$ からのずれの 2 乗に組の数を掛けて足すと
$$ 1\cdot4+2\cdot2.25+3\cdot1+4\cdot0.25+5\cdot0+4\cdot0.25+3\cdot1+2\cdot2.25+1\cdot4=25 $$
なので、$\frac{25}{25}=1$ である。これは母集団の分散 $2$ を $2$(標本の大きさ)で割った値に等しい。

非復元抽出で 2 枚取る

今度は 1 枚目を戻さずに 2 枚目を取る。同じ札を 2 回取ることはないので、組 $(x_1,x_2)$ は $5\times4=20$ 通りで、どれも確率 $\frac1{20}$ である。順序を無視した取り出し方は $\frac{20}2=10$ 通りで、平均は次のとおりである。

取り出した 2 枚$\{1,2\}$$\{1,3\}$$\{1,4\}$$\{1,5\}$$\{2,3\}$$\{2,4\}$$\{2,5\}$$\{3,4\}$$\{3,5\}$$\{4,5\}$
平均$1.5$$2$$2.5$$3$$2.5$$3$$3.5$$3.5$$4$$4.5$

10 通りはどれも確率 $\frac1{10}$ である(順序を考えた 20 通りのうち 2 通りずつにあたる)。平均の期待値は $\frac{1.5+2+2.5+3+2.5+3+3.5+3.5+4+4.5}{10}=\frac{30}{10}=3$ で、復元抽出と同じである。分散は、$3$ からのずれの 2 乗の平均
$$ \frac{2.25+1+0.25+0+0.25+0+0.25+0.25+1+2.25}{10}=\frac{7.5}{10}=0.75 $$
で、復元抽出の $1$ より小さい(図1)。

左は 1〜5 の札の母集団分布、中央と右は 2 枚取り出したときの標本平均の分布(復元抽出と非復元抽出)。どれも平均は 3 だが、非復元抽出のほうがばらつきが小さいことを見る図。 左は 1〜5 の札の母集団分布、中央と右は 2 枚取り出したときの標本平均の分布(復元抽出と非復元抽出)。どれも平均は 3 だが、非復元抽出のほうがばらつきが小さいことを見る図。
2 つの例から、次の問いが出てくる。

  1. 「無作為に選ぶ」とは、正確にはどういうことか。→ def-popn-sampling
  2. 標本平均の期待値が、選び方によらず母集団の平均に等しいのはなぜか。→ thm-popn-main
  3. 非復元抽出で分散が $1$ から $0.75$ に減ったのはなぜか。減り方を表す式はあるか。→ thm-popn-main、lem-popn-pair
  4. 母集団が大きいとき、2 つの抽出法の違いはどのくらいか。→ ex-popn-large
  5. 無作為でない選び方をすると、何が起こるか。→ ex-popn-counter-biased、ex-popn-counter-systematic
    高校の計算この記事での見方ボックス
    無作為抽出取り出し方の列がすべて同じ確率def-popn-sampling
    $k$ 番目に取るものの分布は母集団分布くじ引きの公平性lem-popn-marginal
    $E(\bar X)=\mu$どちらの抽出法でも成り立つthm-popn-main
    $V(\bar X)=\frac{\sigma^2}n$復元抽出のときthm-popn-main
    (教科書では「ほぼ同じ」)非復元抽出では $\frac{\sigma^2}n\cdot\frac{N-n}{N-1}$thm-popn-main
    母比率と標本比率超幾何分布ex-popn-proportion

母集団と無作為抽出

母集団分布・母平均・母分散

$N$ 個の個体からなる母集団で、各個体に数値(変量の値)が 1 つずつ決まっているとする。個体に $1,2,\dots,N$ と番号を付け、個体 $s$ の値を $a_s$ とする。

  1. 母集団から個体を 1 つ、どれも確率 $\frac1N$ で選んだときの値を $X$ とする。$X$ の確率分布を 母集団分布 という。値 $x$ の確率は、$a_s=x$ となる個体の数を $N$ で割ったものである。
  2. 母平均 $\mu$ と 母分散 $\sigma^2$ を
    $$ \mu:=\frac1N\sum_{s=1}^Na_s,\qquad\sigma^2:=\frac1N\sum_{s=1}^N(a_s-\mu)^2 $$
    で定める。$\sigma=\sqrt{\sigma^2}$ を 母標準偏差 という。これらは 1 の $X$ の期待値・分散・標準偏差に等しい。
母平均と母分散の計算
  1. 1〜5 の札の母集団では、$N=5$、$a_s=s$ で、$\mu=3$、$\sigma^2=2$ である(ex-popn-with の冒頭の計算)。
  2. $10$ 人のうち $4$ 人が賛成の母集団で、賛成を $1$、反対を $0$ とする。$\mu=\frac4{10}=0.4$ は賛成の割合(母比率)で、$\sigma^2=\frac{4(1-0.4)^2+6(0-0.4)^2}{10}=\frac{4\cdot0.36+6\cdot0.16}{10}=\frac{2.4}{10}=0.24$ である。一般に、割合 $p$ の $1$ と割合 $1-p$ の $0$ からなる母集団では $\sigma^2=p(1-p)$ となる。
無作為抽出と標本平均

母集団から $n$ 回続けて個体を選び、$k$ 回目に選んだ個体の値を $X_k$ とする。選んだ個体の番号を順に並べた列 $(s_1,s_2,\dots,s_n)$ を 取り出し方 という。

  1. 復元抽出:毎回もとに戻して選ぶ。取り出し方は $N^n$ 通りあり、それらがすべて同じ確率 $\frac1{N^n}$ で起こるように選ぶ。
  2. 非復元抽出:もとに戻さずに選ぶ($n\le N$)。取り出し方は、互いに異なる番号の列で、$N(N-1)\cdots(N-n+1)$ 通りある(順列 の数)。それらがすべて同じ確率で起こるように選ぶ。
    このように、どの取り出し方も同じ確率になる選び方を 無作為抽出 といい、$(X_1,\dots,X_n)$ を大きさ $n$ の 無作為標本 という。
    $$ \bar X:=\frac{X_1+X_2+\dots+X_n}n $$
    を 標本平均 という。

非復元抽出で、順序を考えない選び方($n$ 個の個体の組)も、どれも同じ確率 $\frac1{\binom Nn}$ になる。1 つの組に、順序の付け方がちょうど $n!$ 通りずつ対応するからである。ex-popn-without で順序を無視した 10 通りを同じ確率としたのは、このためである。
高校の教科書の「無作為に選ぶ」は、くじ・乱数などで、どの個体も同じ確率で選ばれるようにすることである。def-popn-sampling は、それを「どの取り出し方も同じ確率」と言い直したものである。1 個ずつの個体が同じ確率で選ばれるだけでは足りないことを、ex-popn-counter-systematic で見る。なお 区間推定(高校数学) では、復元抽出の場合の無作為標本を扱う。

1 回ごとの取り出しと 2 回の取り出しの組

標本平均の性質は、1 回ごとの $X_k$ の分布と、2 回分の組 $(X_j,X_k)$ の分布で決まる。まず 1 回ごとの分布を見る。

くじ引きの公平性

$10$ 本のうち $3$ 本が当たりのくじを、A、B の順に戻さずに引く。B が当たる確率は、A が当たったかどうかで場合を分けると
$$ \frac3{10}\cdot\frac29+\frac7{10}\cdot\frac39=\frac{6}{90}+\frac{21}{90}=\frac{27}{90}=\frac3{10} $$
で、A が当たる確率 $\frac3{10}$ と同じである。後から引いても不利にならない。

1 回ごとの取り出しの分布

復元抽出でも非復元抽出でも、各 $k$($1\le k\le n$)について、$k$ 回目に個体 $s$ を選ぶ確率は $\frac1N$ である。したがって $X_k$ は母集団分布に従い、$E(X_k)=\mu$、$V(X_k)=\sigma^2$ である。

$k$ 回目を固定して残りを数える

方針:def-popn-sampling により、確率は「条件を満たす取り出し方の数 ÷ 全体の数」である。$k$ 回目を $s$ に固定した取り出し方を数える。
段 1(復元抽出)。$k$ 回目を $s$ に固定すると、残りの $n-1$ 回はそれぞれ $N$ 通りなので $N^{n-1}$ 通りある。確率は $\frac{N^{n-1}}{N^n}=\frac1N$ である。
段 2(非復元抽出)。$k$ 回目を $s$ に固定すると、残りの $n-1$ 回には、$s$ 以外の $N-1$ 個から互いに異なる個体を順に並べるので、$(N-1)(N-2)\cdots(N-n+1)$ 通りある。全体は $N(N-1)\cdots(N-n+1)$ 通りなので、確率は
$$ \frac{(N-1)(N-2)\cdots(N-n+1)}{N(N-1)\cdots(N-n+1)}=\frac1N $$
である。
段 3(期待値と分散)。$X_k$ は、各個体 $s$ の値 $a_s$ を確率 $\frac1N$ ずつでとるので、def-popn-population の 1 の $X$ と同じ分布をもつ。よって $E(X_k)=\frac1N\sum_sa_s=\mu$、$V(X_k)=\frac1N\sum_s(a_s-\mu)^2=\sigma^2$ である。$\square$

ex-popn-lottery は、$N=10$ 本のくじ(当たりの値 $1$、はずれの値 $0$)で $k=2$ とした場合である。次に 2 回分の組を見る。ここで 2 つの抽出法に違いが出る。

2 回の取り出しの組の分布

$j\ne k$ とする。$s$、$t$ を個体の番号とする。

  1. 復元抽出では、$j$ 回目に $s$、$k$ 回目に $t$ を選ぶ確率は、$s=t$ の場合も含めて $\frac1{N^2}$ である。
  2. 非復元抽出($n\ge2$)では、その確率は、$s\ne t$ なら $\frac1{N(N-1)}$、$s=t$ なら $0$ である。
2 か所を固定して残りを数える

段 1(復元抽出)。$j$ 回目と $k$ 回目を固定すると、残りの $n-2$ 回はそれぞれ $N$ 通りで、$N^{n-2}$ 通りある。確率は $\frac{N^{n-2}}{N^n}=\frac1{N^2}$ である。
段 2(非復元抽出)。同じ個体を 2 回選ぶことはないので、$s=t$ なら確率は $0$ である。$s\ne t$ なら、残りの $n-2$ 回には $s$、$t$ 以外の $N-2$ 個から互いに異なるものを並べるので $(N-2)(N-3)\cdots(N-n+1)$ 通りある($n=2$ のときは 1 通り)。全体の $N(N-1)\cdots(N-n+1)$ で割ると $\frac1{N(N-1)}$ である。$\square$

2 つのずれ $X_j-\mu$ と $X_k-\mu$ の積の期待値
$$ C_{jk}:=E\bigl((X_j-\mu)(X_k-\mu)\bigr) $$
を、$X_j$ と $X_k$ の 共分散 という。共分散は、一方が平均より大きいとき他方も大きくなりやすいなら正、小さくなりやすいなら負になる(詳しくは 標本平均の分散)。

2 回の取り出しの共分散

$j\ne k$ のとき、復元抽出では $C_{jk}=0$、非復元抽出($N\ge2$)では $C_{jk}=-\dfrac{\sigma^2}{N-1}$ である。

ずれの和が 0 であることを使う

方針:lem-popn-pair で期待値を個体の組についての和に書き、ずれ $d_s:=a_s-\mu$ の性質 $\sum_sd_s=0$、$\sum_sd_s^2=N\sigma^2$ を使う。
段 1(ずれの性質)。$\mu$ の定義から $\sum_{s=1}^Nd_s=\sum_sa_s-N\mu=0$ であり、$\sigma^2$ の定義から $\sum_sd_s^2=N\sigma^2$ である。
段 2(復元抽出)。lem-popn-pair の 1 から、$j$ 回目が $s$、$k$ 回目が $t$ となる確率はすべての組 $(s,t)$ で $\frac1{N^2}$ なので
$$ C_{jk}=\frac1{N^2}\sum_{s=1}^N\sum_{t=1}^Nd_sd_t=\frac1{N^2}\Bigl(\sum_sd_s\Bigr)\Bigl(\sum_td_t\Bigr)=0 $$
である。
段 3(非復元抽出)。lem-popn-pair の 2 から、$s\ne t$ の組だけが確率 $\frac1{N(N-1)}$ で現れるので
$$ C_{jk}=\frac1{N(N-1)}\sum_{s\ne t}d_sd_t $$
である。すべての組 $(s,t)$ の和 $\bigl(\sum_sd_s\bigr)^2$ から、$s=t$ の組の和 $\sum_sd_s^2$ を引いたものが $\sum_{s\ne t}d_sd_t$ なので、段 1 から
$$ \sum_{s\ne t}d_sd_t=0^2-N\sigma^2=-N\sigma^2 $$
である。よって $C_{jk}=\frac{-N\sigma^2}{N(N-1)}=-\frac{\sigma^2}{N-1}$ である。$\square$

共分散を数え上げで確かめる

1〜5 の札($\mu=3$、$\sigma^2=2$)で、非復元抽出の 1 枚目と 2 枚目を考える。ずれ $d_s$ は $-2,-1,0,1,2$ である。異なる 2 枚の組 20 通りについて $d_sd_t$ を足すと、すべての組の和 $0^2=0$ から同じ札どうしの和 $4+1+0+1+4=10$ を引いて $-10$ になる。$\frac{-10}{20}=-0.5$ で、$-\frac{\sigma^2}{N-1}=-\frac24=-0.5$ と一致する。
1 枚目に大きい数を取ると、残りの札の平均は $3$ より小さくなるので、2 枚目は小さくなりやすい。共分散が負になるのはこのためである。

主定理:標本平均の期待値と分散

標本平均の期待値と分散

母平均 $\mu$、母分散 $\sigma^2$、大きさ $N$ の母集団から、大きさ $n$ の無作為標本をとる。

  1. 復元抽出でも非復元抽出でも、$E(\bar X)=\mu$ である。
  2. 復元抽出では $V(\bar X)=\dfrac{\sigma^2}n$ である。
  3. 非復元抽出($1\le n\le N$、$N\ge2$)では
    $$ V(\bar X)=\frac{\sigma^2}n\cdot\frac{N-n}{N-1} $$
    である。
和の分散を分散と共分散に分ける

方針:期待値は線形性で求める。分散は、和のずれの 2 乗を展開して、各 $X_k$ の分散と、組の共分散に分ける。
段 1(期待値)。lem-popn-marginal から $E(X_k)=\mu$ である。期待値の線形性(和の期待値は期待値の和、定数倍は外に出る)により
$$ E(\bar X)=\frac1n\bigl(E(X_1)+\dots+E(X_n)\bigr)=\frac1n\cdot n\mu=\mu $$
である。
段 2(和のずれの展開)。$T:=X_1+\dots+X_n$ とおくと $E(T)=n\mu$ で、$T-n\mu=\sum_{k=1}^n(X_k-\mu)$ である。$n$ 個の数の和の 2 乗は、各数の 2 乗の和と、異なる番号の順序付きの組 $(j,k)$($j\ne k$)すべてについての積の和を足したものなので
$$ (T-n\mu)^2=\sum_{k=1}^n(X_k-\mu)^2+\sum_{j\ne k}(X_j-\mu)(X_k-\mu) $$
である。$j\ne k$ となる順序付きの組 $(j,k)$ は $n(n-1)$ 個ある。
段 3(期待値をとる)。線形性により
$$ V(T)=E\bigl((T-n\mu)^2\bigr)=\sum_{k=1}^nV(X_k)+\sum_{j\ne k}C_{jk} $$
である。lem-popn-marginal から第 1 項は $n\sigma^2$ である。
段 4(2 の場合)。復元抽出では prop-popn-cov から $C_{jk}=0$ なので $V(T)=n\sigma^2$ である。$\bar X=\frac1nT$ なので、定数倍の公式 $V(aT)=a^2V(T)$ から $V(\bar X)=\frac1{n^2}\cdot n\sigma^2=\frac{\sigma^2}n$ である。
段 5(3 の場合)。非復元抽出では $C_{jk}=-\frac{\sigma^2}{N-1}$ が $n(n-1)$ 個あるので
$$ V(T)=n\sigma^2-n(n-1)\frac{\sigma^2}{N-1}=n\sigma^2\Bigl(1-\frac{n-1}{N-1}\Bigr)=n\sigma^2\cdot\frac{N-n}{N-1} $$
である($n=1$ なら共分散の項はなく、式は $V(T)=\sigma^2$ でやはり成り立つ)。$\frac1{n^2}$ 倍して $V(\bar X)=\frac{\sigma^2}n\cdot\frac{N-n}{N-1}$ を得る。$\square$

非復元抽出の式の $\dfrac{N-n}{N-1}$ を 有限母集団修正 という。$n\ge2$ なら $1$ より小さく、非復元抽出の標本平均は復元抽出よりばらつきが小さい(図2)。同じ個体を 2 回調べる無駄がないからである。

札の例で主定理を確かめる

1〜5 の札($N=5$、$\sigma^2=2$)で、標本の大きさ $n$ を変える。

$n$復元抽出 $\frac{\sigma^2}n$非復元抽出 $\frac{\sigma^2}n\cdot\frac{5-n}4$
$1$$2$$2\cdot\frac44=2$
$2$$1$$1\cdot\frac34=0.75$
$3$$\frac23$$\frac23\cdot\frac24=\frac13$
$4$$\frac12$$\frac12\cdot\frac14=\frac18$
$5$$\frac25$$\frac25\cdot0=0$

$n=2$ の行は ex-popn-with、ex-popn-without の計算と一致する。$n=3$ の非復元抽出では、3 枚の組 10 通りの平均は $2$、$\frac73$、$\frac83$、$\frac83$、$3$、$3$、$\frac{10}3$、$\frac{10}3$、$\frac{11}3$、$4$ で、$3$ からのずれの 2 乗の和は $1+\frac49+\frac19+\frac19+0+0+\frac19+\frac19+\frac49+1=\frac{30}9=\frac{10}3$、その平均は $\frac13$ である。表の値と一致する。

全数調査ではばらつきがない

非復元抽出で $n=N$(全数調査)とすると $V(\bar X)=0$ であり、$\bar X$ はいつも $\mu$ に等しい。

式に $n=N$ を入れる

thm-popn-main の 3 で $n=N$ とすると $N-n=0$ なので $V(\bar X)=0$ である。分散が $0$ なら、$\bar X$ の値はすべての取り出し方で期待値 $\mu$ に等しい(分散はずれの 2 乗の重み付きの和で、各項が $0$ 以上だから、和が $0$ ならどの項も $0$)。実際、全員を選べば、順序が違うだけで値の和はいつも $a_1+\dots+a_N=N\mu$ である。$\square$

全数調査から共分散を逆算する

cor-popn-census は逆向きにも使える。lem-popn-pair から、非復元抽出ではどの $j\ne k$ でも $C_{jk}$ は同じ値 $c$ である(2 か所の組の分布が $j$、$k$ によらない)。$n=N$ とすると $T=N\mu$ は一定なので $V(T)=0$ であり、prf-popn-main の段 3 から $0=N\sigma^2+N(N-1)c$、すなわち $c=-\frac{\sigma^2}{N-1}$ が出る。prop-popn-cov の結果は、「全員を選べば和は変わらない」という事実から計算なしで分かる。

母分散 1、大きさ 20 の母集団で、標本平均の分散を標本の大きさ !FORMULA[338][38042][0] の関数として描いたもの。非復元抽出(橙)は復元抽出(青)より小さく、!FORMULA[339][1134103571][0] で 0 になることを見る図。 母分散 1、大きさ 20 の母集団で、標本平均の分散を標本の大きさ $n$ の関数として描いたもの。非復元抽出(橙)は復元抽出(青)より小さく、$n=20$ で 0 になることを見る図。

母集団が大きいときの違い

標準偏差で比べると、非復元抽出は復元抽出の $\sqrt{\frac{N-n}{N-1}}$ 倍である。

  1. $N=10000$、$n=400$:$\frac{9600}{9999}=0.9601\ldots$、平方根は $0.9798\ldots$ で、標準偏差は約 $2\%$ 小さいだけである。
  2. $N=100000$、$n=1000$:$\frac{99000}{99999}=0.9900\ldots$、平方根は $0.9949\ldots$ で、差は約 $0.5\%$ である。
  3. $N=1000$、$n=400$:$\frac{600}{999}=0.6006\ldots$、平方根は $0.7749\ldots$ で、約 $23\%$ 小さい。母集団の $4$ 割を調べるなら、違いは無視できない。
    $\frac{N-n}{N-1}$ は、$N$ に比べて $n$ が小さいとき、およそ $1-\frac nN$ である。違いを決めるのは母集団の大きさそのものではなく、母集団のうち調べる割合 $\frac nN$ である。数学 B で「母集団が十分大きければ復元抽出と同じとみてよい」とするのは、この割合が小さい場合である。

母比率と超幾何分布

標本の中の賛成の人数

ex-popn-population の 2($10$ 人中 $4$ 人が賛成、$\mu=0.4$、$\sigma^2=0.24$)から、非復元抽出で $3$ 人を選ぶ。標本の中の賛成の人数を $K$ とすると、$K=3\bar X$ である。$3$ 人の組は $\binom{10}3=120$ 通りあり、賛成 $k$ 人・反対 $3-k$ 人の組は $\binom4k\binom6{3-k}$ 通りなので
$$ P(K=0)=\frac{20}{120},\quad P(K=1)=\frac{60}{120},\quad P(K=2)=\frac{36}{120},\quad P(K=3)=\frac4{120} $$
である。このような分布を 超幾何分布 という。

  • 期待値:$E(K)=\frac{0\cdot20+1\cdot60+2\cdot36+3\cdot4}{120}=\frac{144}{120}=1.2$ で、$3\mu=1.2$ と一致する。
  • 分散:$E(K^2)=\frac{60+4\cdot36+9\cdot4}{120}=\frac{240}{120}=2$ なので $V(K)=2-1.2^2=0.56$ である。thm-popn-main の 3 から $V(K)=3^2V(\bar X)=3^2\cdot\frac{0.24}3\cdot\frac{10-3}{10-1}=0.72\cdot\frac79=0.56$ で、一致する。
    復元抽出なら、$K$ は 二項分布 $B(3,0.4)$ に従い、分散は $3\cdot0.4\cdot0.6=0.72$ である。非復元抽出の分散はその $\frac79$ 倍になる。

標本平均の分散の式は、独立の代わりに「どの 2 つも無相関」という仮定のもとで 標本平均の分散 でも示している。この記事の非復元抽出は、共分散が負になるので、その仮定を満たさない場合にあたる。

例と反例

thm-popn-main は「どの取り出し方も同じ確率」という無作為抽出の仮定の上に立っている。この仮定を外すと、何が崩れるかを確かめる。

外した仮定崩れる主張ボックス
どの個体も同じ確率で選ばれる$E(\bar X)=\mu$(標本を大きくしても直らない)ex-popn-counter-biased
どの取り出し方も同じ確率(個体ごとの確率は同じ)$V(\bar X)$ の式ex-popn-counter-systematic
復元抽出(非復元抽出にする)$V(\bar X)=\frac{\sigma^2}n$thm-popn-main の 3、ex-popn-check
反例:大きい札ほど選ばれやすい抽出

1〜5 の札から 1 枚を、書かれた数に比例する確率 $\frac s{15}$($s=1,\dots,5$)で選び、戻してくり返す。たとえば、大きい数の札ほど大きくて手に触れやすい場合である。1 回の値の期待値は
$$ \sum_{s=1}^5s\cdot\frac s{15}=\frac{1+4+9+16+25}{15}=\frac{55}{15}=\frac{11}3=3.666\ldots $$
で、母平均 $3$ と違う。標本平均 $\bar X$ の期待値も線形性から $\frac{11}3$ であり、標本を大きくしても $\bar X$ は $\frac{11}3$ の近くに集まるだけで、$3$ には近づかない(大数の法則とさいころの平均)。
同じことは身近な調査でも起こる。子どもの一人一人に「きょうだいは何人か(自分を含む)」と聞いて平均をとると、家庭ごとの子どもの数にばらつきがあれば、家庭ごとの子どもの数の平均より大きくなる。子どもの多い家庭ほど、選ばれる子どもが多いからである。
満たす性質:選び方は毎回同じで、1 回ごとは独立。満たさない性質:どの個体も同じ確率 $\frac1N$ で選ばれること。崩れる主張:$E(\bar X)=\mu$。

反例:1 つおきに選ぶ系統抽出

値が $1,2,1,2,\dots,1,2$ と交互に並ぶ $N=10$ 個の個体の母集団を考える(番号が奇数の個体は $1$、偶数の個体は $2$)。$\mu=1.5$、$\sigma^2=0.25$ である。
出発点を番号 $1$ か $2$ から確率 $\frac12$ ずつで選び、そこから 1 つおきに $5$ 個選ぶ(系統抽出)。出発点が $1$ なら値はすべて $1$、出発点が $2$ ならすべて $2$ なので、$\bar X$ は $1$ か $2$ を確率 $\frac12$ ずつとる(図3)。

  1. どの個体も選ばれる確率は $\frac12$ で等しく、$E(\bar X)=\frac{1+2}2=1.5=\mu$ である。期待値は崩れない。
  2. しかし $V(\bar X)=\frac{(1-1.5)^2+(2-1.5)^2}2=0.25$ である。無作為な非復元抽出なら thm-popn-main の 3 から $\frac{0.25}5\cdot\frac{10-5}{10-1}=\frac1{36}=0.0277\ldots$ で、系統抽出の分散はその $9$ 倍である。
    系統抽出では、$\binom{10}5=252$ 通りの組のうち 2 通りしか起こらない。個体ごとの確率が等しくても、組の確率が等しくないので、lem-popn-pair が成り立たない。
    満たす性質:どの個体も同じ確率で選ばれる。満たさない性質:どの取り出し方も同じ確率(def-popn-sampling)。崩れる主張:thm-popn-main の分散の式。母集団の並び方に周期があると、系統抽出は特に危うい。

1 と 2 が交互に並ぶ母集団から、1 つおきに選ぶ系統抽出。起こりうる標本は 2 通りだけで、標本平均は 1 か 2 になることを見る図。 1 と 2 が交互に並ぶ母集団から、1 つおきに選ぶ系統抽出。起こりうる標本は 2 通りだけで、標本平均は 1 か 2 になることを見る図。

大学数学で見る

標本分布と統計量

標本 $(X_1,\dots,X_n)$ は確率変数の組であり、標本から計算する量(標本平均・標本の分散・最大値など)を 統計量 という。統計量は確率変数なので分布をもち、その分布を 標本分布 という。図1 の中央と右は、標本平均の標本分布そのものである。推定や検定は、標本分布が母集団の $\mu$ や $\sigma^2$ とどう結びついているかを使う。thm-popn-main の $E(\bar X)=\mu$ は、標本平均が母平均の 不偏推定量 であることを表す。標本の分散を $n$ でなく $n-1$ で割る不偏分散の話は 推定量のよさ で扱う。

超幾何分布から二項分布へ

ex-popn-proportion の超幾何分布は、母集団の大きさ $N$ と賛成の人数を、割合 $p$ を一定に保って大きくすると、二項分布 $B(n,p)$ に近づく(GS06 §5.1、p. 193。本記事では証明しない)。分散の比 $\frac{N-n}{N-1}$ が $1$ に近づくことは、その一部である。大学の統計学では、有限母集団からの非復元抽出の理論を 標本調査法 として扱い、母集団をいくつかの層に分けてから層ごとに無作為抽出する層化抽出なども学ぶ。

同じ確率で並ぶことの効き目

非復元抽出の $X_1,\dots,X_n$ は独立ではないが、$(X_1,\dots,X_n)$ を並べ替えても、組全体の分布(同時分布)は変わらない。取り出し方の列を並べ替えたものも、互いに異なる番号の列で、def-popn-sampling により同じ確率をもつからである。この性質を大学では 交換可能性 という。特に lem-popn-marginal・lem-popn-pair のように、1 つの $X_k$ の分布も、2 つの組 $(X_j,X_k)$ の分布も番号によらない。rem-popn-census で共分散を計算なしで求められたのは、交換可能性と「全員を選べば和は一定」という 2 つの事実だけを使ったからである。

さらに先へ

thm-popn-main の 2 で求めた分散 $\frac{\sigma^2}n$ から出る標準偏差 $\frac{\sigma}{\sqrt n}$ は、母平均の範囲を推し量る 区間推定(高校数学) と、仮説を確かめる 仮説検定(高校数学) で使う。母集団の $1$ 割を超えるような大きな割合を調べるときは、非復元抽出の分散 $\frac{\sigma^2}n\cdot\frac{N-n}{N-1}$ を使うと、区間を狭くできる。母集団が非常に大きく、身長のように値が連続的に分布するときは、母集団分布を密度関数で表す(確率密度関数と連続型確率変数)。標本平均がどのような分布に近づくかは、正規分布(高校数学) と 中心極限定理(二項分布から正規分布へ)の話題になる。

関連項目

参考文献

Mathpediaは寄付と、参考文献の書籍リンク(Amazonアソシエイト)の紹介料で運営されています。 支援について / 寄付する