ChatGPTと一緒に統計学に関わる事象について直感的な理解を目指すシリーズ。
一言で言うと、
独立なランダムな値をたくさん足し合わせると、その「合計」や「平均」の分布が正規分布に近づく
という定理。
元々のデータの分布そのものが正規分布である必要はない。
正規分布とは
厳密にはいくつか条件があるが、まずはこのイメージでよい。
まずコイン投げで考える
コインを1回投げて、
$$ X= \begin{cases} 1 & \text{表} \\ 0 & \text{裏} \end{cases} $$となる確率変数を考える。
確率変数 $X$:確率的な結果に応じて、ある数値を取る変数のこと。
一般的な公平なコインなら、表を向く確率は50%、裏を向く確率も50%。
| |
これは全然正規分布ではない。
値は
$$ 0 \text{ か } 1 $$しかない。
これを100回投げて、
$$ S=X_1+X_2+\cdots+X_{100} $$とすると、$S$ は「表が何枚出たか」を表す。
公平なコインなら、その期待値は
$$ E(S)=50 $$なので、平均的には表が50枚くらい出る。
100回のコイン投げを何度も繰り返すと、
- 表50枚前後 → 非常に多い
- 40枚や60枚 → 少し少ない
- 20枚や80枚 → 非常に珍しい
- 0枚や100枚 → ほぼ起きない
となる。
分布はこんな感じになる。
| |
厳密にはこれは二項分布だが、コインを投げる回数が多くなると、その形は正規分布にかなり近くなる。
なぜこんな形になるのか
このコイン投げの例について直感的に考えると、真ん中付近を作る方法が圧倒的に多いから。
100回中50回表になる方法は、
$$ \binom{100}{50} $$通りある。
一方、100回全部表になる方法は、
$$ \binom{100}{100}=1 $$通りしかない。
つまり、
$$ 50\text{枚になる組み合わせ} \gg 100\text{枚になる組み合わせ} $$である。
だから真ん中が盛り上がって両端が細くなる。
この例では、このようにして正規分布に近い形が現れる。
そして中心極限定理は、コイン投げに限らず、一定の条件のもとで多数の独立な確率変数を足し合わせたり平均したりすると、その和や平均の分布が正規分布に近づくことを示している。
中心極限定理を数式で言うと
もっとも基本的な形では、同じ分布に従う独立な確率変数
$$ X_1,X_2,\dots,X_n $$があり、それぞれ
$$ E(X_i)=\mu $$$$ Var(X_i)=\sigma^2 $$$E(X_i)$:確率変数 $X_i$ の期待値
$Var(X_i)$:確率変数 $X_i$ の分散
とする。
ここでは、平均と分散が有限であるものとする。
その平均
$$ \bar{X}=\frac{X_1+\cdots+X_n}{n} $$について、
$$ E(\bar{X})=\mu $$そして
$$ Var(\bar{X})=\frac{\sigma^2}{n} $$になる。
したがって、$\bar{X}$ の標準偏差は
$$ \frac{\sigma}{\sqrt{n}} $$となる。
そこで、
$$ Z= \frac{\bar{X}-\mu}{\sigma/\sqrt{n}} $$と標準化すると、
$$ \boxed{ Z\xrightarrow[n\to\infty]{d}N(0,1) } $$標準化:ある値からその分布の平均を引き、それを標準偏差で割る操作。
「平均との差が標準偏差何個分あるのか」に置き換える、と考えるとわかりやすい。
となる。
この記号は、
$n$ が大きくなるにつれて、$Z$ の分布が平均0、分散1の標準正規分布に近づいていく
という意味。
「平均」じゃなくて「合計」でも同じ
もちろん、
$$ S_n=X_1+\cdots+X_n $$についても、
$$ E(S_n)=n\mu $$$$ Var(S_n)=n\sigma^2 $$なので、
$$ \boxed{ \frac{S_n-n\mu}{\sigma\sqrt{n}} \xrightarrow[n\to\infty]{d} N(0,1) } $$となる。
つまり本質的には、
$$ \boxed{ \text{たくさんの独立なランダムな寄与の和} \rightarrow \text{正規分布に近い形} } $$ということである。
ここで大事な誤解
中心極限定理は、
「標本数が多くなれば元データが正規分布になる」
という意味ではない。
たとえば「0か1しか取らないデータ」を100万個集めても、1個1個のデータはずっと
$$ 0\text{か}1 $$である。
正規分布に近づくのは、元データそのものではなく、
$$ \boxed{\text{それらの和や平均の分布}} $$である。
これはかなり重要。
「分布の分布」ってどういうこと?
ここが最初は少し難しいところ。
たとえばある母集団から100人取って平均身長を計算したら、
$$ \bar{X}=168.4 $$だったとする。
もう一度、別の100人をランダムに取れば、
$$ \bar{X}=169.1 $$かもしれない。
さらに何度も同じことをやれば、
$$ 168.7,\quad 170.0,\quad 167.9,\quad 169.4,\dots $$となるかもしれない。
つまり、標本平均そのものもランダムに変動する。
この「標本平均を何度も計算したときに、どのような値がどのくらいの確率で現れるか」という分布を、標本平均の標本分布という。
そして中心極限定理によれば、1回の標本に含まれる人数 $n$ を十分大きくすると、この標本平均の分布が正規分布に近づいていく。
| |
これが中心極限定理の話である。
なぜ統計検定でこんなに重要なのか
中心極限定理が重要なのは、ある条件のもとでは、和や平均のような統計量の標本分布を正規分布で近似できるようになるからである。
たとえば標本平均 $\bar{X}$ について考える。
母集団の平均が $\mu$、標準偏差が $\sigma$ なら、標本数 $n$ が十分に大きいと、
$$ \bar{X} $$の分布はおおよそ
$$ N\left( \mu,\frac{\sigma^2}{n} \right) $$という正規分布になる。
そこで、
$$ Z= \frac{\bar{X}-\mu}{\sigma/\sqrt{n}} $$と標準化すると、$Z$ はおおよそ標準正規分布
$$ N(0,1) $$に従う。
標準正規分布では、どの範囲にどれくらいの確率が含まれるのかがわかっている。
たとえば、標準正規分布に従う $Z$ について、
$$ -1\le Z\le1 $$となる確率は約68.3%、
$$ -2\le Z\le2 $$となる確率は約95.4%である。
正規分布一般について言えば、
$$ \mu-\sigma\le X\le\mu+\sigma $$に約68.3%、
$$ \mu-2\sigma\le X\le\mu+2\sigma $$に約95.4%が入る。
ここで重要なのは、確率密度曲線の下の面積が、その範囲の値が現れる確率に対応しているということである。
なお、標準正規分布とは「曲線下面積を1にした正規分布」という意味ではない。確率分布の確率密度関数は、もともと全体の面積が1になる。
標準正規分布とは、
$$ \boxed{\text{平均 }0,\quad \text{標準偏差 }1} $$となるように標準化した正規分布のことである。
これを統計検定に利用する。
たとえば、
「本当はA群とB群には差がない」
という仮説を立てたとする。
これを帰無仮説という。
帰無仮説が正しいと仮定したとき、検定で使う統計量がどのような分布をするかを考える。
そして実際に得られた統計量を標準化して、
$$ Z=0.2 $$なら、標準正規分布の真ん中付近なので、特に珍しい値ではない。
一方、
$$ Z=4 $$のような値が出たとすると、標準正規分布のかなり端に位置するので、
「帰無仮説が正しい世界では、こんな極端な値はめったに出ない」
と考えられる。
そこで、
$$ \boxed{ \text{帰無仮説のもとで、観測された値以上に極端な値が出る確率} } $$を計算する。
これがp値である。
つまり、
$$ \boxed{ \text{中心極限定理} \rightarrow \text{統計量の分布を正規分布で近似できる} \rightarrow \text{どれくらい珍しい値なのか計算できる} \rightarrow p\text{値を求められる} } $$という流れで、中心極限定理は統計学のさまざまな場面で重要になる。
ただし、すべての統計検定が中心極限定理によって成り立っているわけではない。
検定によっては $t$ 分布、カイ二乗分布、$F$ 分布など別の分布を利用する。また、Wilcoxon順位和検定のように、標本数が大きい場合に統計量を正規分布で近似する検定もある。
中心極限定理は、
「ランダムなデータから計算した和や平均が、なぜ正規分布と深く結びつくのか」
を説明してくれる、統計学の根幹にある定理の一つなのである。