§E14.2標本分布

最終更新

母標準偏差が2020である正規母集団では、一個の観測値が母平均から33未満の範囲に入る確率は約12%12\%である。一方、大きさ100100の独立同分布標本の平均では、同じ範囲に入る確率は約87%87\%になる。個体のばらつきは変わらないにもかかわらず、標本平均の標準誤差が2020から22へ減少するためである。この差から、統計量のばらつきが標本サイズとともにどのように変化するかという問いが生じる。

標本分布は、無作為標本から構成した統計量の確率分布である。独立同分布標本の各変数が二乗可積分である場合、標本平均の分散は標本サイズに反比例し、有限標本におけるばらつきを定量化する。大標本では、大数の法則が標本平均の集中を記述し、中心極限定理が標準化後の揺らぎに正規近似を与える。したがって、有限標本での標準誤差と大標本での極限定理は、標本平均の変動を相補的に記述する。

標本分布の考察は、観測された統計量の値を母集団の性質と結び付けるための最も基本的な方法の一つである。

本記事では、標本分布の有限標本での性質と大標本での近似を扱う。

1 標本平均と標本分散

無作為標本と統計量は§E14.1 定義 2.1で定めた。本節では実数値の無作為標本を扱い、標本平均Xˉ=n−1∑i=1nXi\bar X=n^{-1}\sum_{i=1}^nX_iと、n≥2n\geq2の場合の不偏標本分散S2=(n−1)−1∑i=1n(Xi−Xˉ)2S^2=(n-1)^{-1}\sum_{i=1}^n(X_i-\bar X)^2の性質を調べる。

定義 1.1.X∈L2(P)X\in L^2(P)に対して、分散の非負平方根σX=Var⁡(X)\sigma_X=\sqrt{\operatorname{Var}(X)}をXXの標準偏差 (standard deviation) という。

定義 1.2. 統計量T=T(X1,…,Xn)T=T(X_1,\dots,X_n)の像測度P∘T−1P\circ T^{-1}を、TTの標本分布 (sampling distribution) という。さらにTTが実数値でT∈L2(P)T\in L^2(P)であるとき、その標準偏差Var⁡(T)\sqrt{\operatorname{Var}(T)}を、推定量TTの標準誤差 (standard error)(standard error, SE)という。

定義 1.3.X,Y∈L2(P)X,Y\in L^2(P)の標準偏差がともに正であるとき、

ρ(X,Y)=Cov⁡(X,Y)σXσY\rho(X,Y)=\frac{\operatorname{Cov}(X,Y)}{\sigma_X\sigma_Y}

をXXとYYの相関係数 (correlation coefficient) という。Cov⁡(X,Y)=0\operatorname{Cov}(X,Y)=0であるとき、XXとYYは無相関 (uncorrelated) であるという。分散が零の変数を含む場合、相関係数は定義しない。

§E11.4 命題 2.3により、相関係数は∣ρ(X,Y)∣≤1|\rho(X,Y)|\leq1を満たす。中心化した確率変数X−E[X]X-E[X]とY−E[Y]Y-E[Y]をL2(P)L^2(P)のベクトルとみなすと、共分散は両者の内積であり、相関係数は両者がなす角の余弦である。独立な二つのL2(P)L^2(P)確率変数は§E11.7 定理 3.1により無相関であるが、無相関な二変数が独立であるとは限らない。

定理 1.4.X1,…,Xn∈L2(P)X_1,\ldots,X_n\in L^2(P)とする。このとき

Var⁡ ⁣(∑i=1nXi)=∑i=1nVar⁡(Xi)+2∑1≤i<j≤nCov⁡(Xi,Xj)\operatorname{Var}\!\left(\sum_{i=1}^nX_i\right)=\sum_{i=1}^n\operatorname{Var}(X_i)+2\sum_{1\leq i<j\leq n}\operatorname{Cov}(X_i,X_j)

が成り立つ。特に、X1,…,XnX_1,\ldots,X_nが対ごとに無相関ならば

Var⁡ ⁣(∑i=1nXi)=∑i=1nVar⁡(Xi)\operatorname{Var}\!\left(\sum_{i=1}^nX_i\right)=\sum_{i=1}^n\operatorname{Var}(X_i)

である。

証明.μi=E[Xi]\mu_i=E[X_i]とおく。有限個のL2(P)L^2(P)確率変数の和はL2(P)L^2(P)に属し、期待値の線形性から

∑i=1nXi−E ⁣[∑i=1nXi]=∑i=1n(Xi−μi)\sum_{i=1}^nX_i-E\!\left[\sum_{i=1}^nX_i\right]=\sum_{i=1}^n(X_i-\mu_i)

である。右辺の平方を展開して期待値の線形性を用いると

Var⁡ ⁣(∑i=1nXi)=∑i=1n∑j=1nE[(Xi−μi)(Xj−μj)]=∑i=1nVar⁡(Xi)+2∑1≤i<j≤nCov⁡(Xi,Xj)\begin{aligned} \operatorname{Var}\!\left(\sum_{i=1}^nX_i\right) &=\sum_{i=1}^n\sum_{j=1}^nE[(X_i-\mu_i)(X_j-\mu_j)]\\ &=\sum_{i=1}^n\operatorname{Var}(X_i)+2\sum_{1\leq i<j\leq n}\operatorname{Cov}(X_i,X_j) \end{aligned}

を得る。各積の可積分性は§E11.4 定理 2.2による。対ごとに無相関ならば非対角項はすべて零である。▨

同分布性だけでは、標本平均の分散が標本サイズとともに減少するとは限らない。実確率変数ZZが0<Var⁡(Z)<∞0<\operatorname{Var}(Z)<\inftyを満たすとし、各iiに対してXi=ZX_i=Zとおく。このとき各XiX_iは同じ分布に従うが、相互に独立ではない。Xˉ=Z\bar X=Zであるから、すべてのnnに対してVar⁡(Xˉ)=Var⁡(Z)\operatorname{Var}(\bar X)=\operatorname{Var}(Z)となり、平均をとっても分散は減少しない。

命題 1.5.X1,…,XnX_1,\dots,X_nを独立同分布な実確率変数とする。X1∈L1(P)X_1\in L^1(P)でμ=E[X1]\mu=E[X_1]ならば

E[Xˉ]=μ.E[\bar X]=\mu.

さらにX1∈L2(P)X_1\in L^2(P)でσ2=Var⁡(X1)\sigma^2=\operatorname{Var}(X_1)ならば

Var⁡(Xˉ)=σ2n.\operatorname{Var}(\bar X)=\frac{\sigma^2}{n}.

σ2=0\sigma^2=0の場合も含む。したがって、Xˉ\bar Xはμ\muの不偏推定量であり、その分散は標本サイズに対して1/n1/nの比率で減少する。

証明.XiX_iはすべて可積分であり、期待値の線形性から

E[Xˉ]=1n∑i=1nE[Xi]=μE[\bar X]=\frac1n\sum_{i=1}^nE[X_i]=\mu

を得る。さらにXi∈L2(P)X_i\in L^2(P)ならば、独立性によって異なる二変数の共分散は00である。定理 1.4を適用すると、

Var⁡(Xˉ)=1n2∑i=1nVar⁡(Xi)=σ2n\operatorname{Var}(\bar X)=\frac1{n^2}\sum_{i=1}^n\operatorname{Var}(X_i)=\frac{\sigma^2}{n}

である。▨

分散の式には独立性より弱い仮定である二変数ずつの無相関性で足りる。期待値の式には独立性も無相関性も必要ない。

命題 1.6.n≥2n\geq2とし、X1,…,XnX_1,\dots,X_nを独立同分布なL2(P)L^2(P)確率変数とする。μ=E[X1]\mu=E[X_1]、σ2=Var⁡(X1)\sigma^2=\operatorname{Var}(X_1)とおき、

S2=1n−1∑i=1n(Xi−Xˉ)2S^2=\frac1{n-1}\sum_{i=1}^n(X_i-\bar X)^2

と定める。このとき

S2=1n−1(∑i=1nXi2−nXˉ2),E[S2]=σ2.S^2=\frac1{n-1}\left(\sum_{i=1}^nX_i^2-n\bar X^2\right), \qquad E[S^2]=\sigma^2.

σ2=0\sigma^2=0の場合も含む。

証明.∑i=1n(Xi−Xˉ)=0\sum_{i=1}^n(X_i-\bar X)=0を用いて平方を展開すると、

∑i=1n(Xi−Xˉ)2=∑i=1nXi2−2Xˉ∑i=1nXi+nXˉ2=∑i=1nXi2−nXˉ2\sum_{i=1}^n(X_i-\bar X)^2 =\sum_{i=1}^nX_i^2-2\bar X\sum_{i=1}^nX_i+n\bar X^2 =\sum_{i=1}^nX_i^2-n\bar X^2

である。命題 1.5と分散の恒等式から

E[Xˉ2]=σ2n+μ2,E[Xi2]=σ2+μ2E[\bar X^2]=\frac{\sigma^2}{n}+\mu^2, \qquad E[X_i^2]=\sigma^2+\mu^2

である。したがって、

E[S2]=1n−1(n(σ2+μ2)−n(σ2n+μ2))=σ2E[S^2] =\frac1{n-1}\left(n(\sigma^2+\mu^2)-n\left(\frac{\sigma^2}{n}+\mu^2\right)\right) =\sigma^2

を得る。▨

標本平均については命題 1.5より

SE⁡(Xˉ)=σn\operatorname{SE}(\bar X)=\frac{\sigma}{\sqrt n}

である。n≥2n\geq2かつσ\sigmaが未知のときは、標本標準偏差S=S2S=\sqrt{S^2}で置き換えたS/nS/\sqrt nを推定標準誤差として用いる。

注意 1.7 (標準偏差と標準誤差). 母標準偏差σ\sigmaは母集団の 1 個体のばらつきであり、標本サイズnnに依存しない量である。一方、標本平均の標準誤差σ/n\sigma/\sqrt nは推定量のばらつきであり、nnを増やすほど00に近づく。両者はn\sqrt n倍だけ異なる。

例 1.8 (サイコロの標本平均). 公平なサイコロの目XXは各k∈{1,…,6}k \in \{1,\dots,6\}に確率16\tfrac16を置く。期待値の定義(§E11.4 定義 1.1)よりE[X]=∑k=16k⋅16=1+2+3+4+5+66=216=3.5.E[X] = \sum_{k=1}^{6} k\cdot\tfrac16 = \tfrac{1+2+3+4+5+6}{6} = \tfrac{21}{6} = 3.5.像分布に関する積分公式(§E11.4 定理 1.3)でg(x)=x2g(x)=x^2をとるとE[X2]=∑k=16k2⋅16=1+4+9+16+25+366=916≈15.1667.E[X^2] = \sum_{k=1}^{6} k^2\cdot\tfrac16 = \tfrac{1+4+9+16+25+36}{6} = \tfrac{91}{6} \approx 15.1667.よって分散の恒等式(§E11.4 命題 2.3)からVar⁡(X)=916−(3.5)2=916−494=182−14712=3512≈2.9167.\operatorname{Var}(X) = \tfrac{91}{6} - (3.5)^2 = \tfrac{91}{6} - \tfrac{49}{4} = \tfrac{182 - 147}{12} = \tfrac{35}{12} \approx 2.9167.標準偏差はσX=35/12≈1.7078\sigma_X = \sqrt{35/12} \approx 1.7078である。

独立な公平なサイコロ二個の目をX1,X2X_1,X_2とし、S=X1+X2S=X_1+X_2とおく。期待値の線形性と独立性による分散の加法性から

E[S]=7,Var⁡(S)=356≈5.8333E[S]=7, \qquad \operatorname{Var}(S)=\frac{35}{6}\approx5.8333

である。さらに、独立な公平なサイコロnn個の標本平均Xˉ\bar Xについて命題 1.5を適用すると、

E[Xˉ]=72,Var⁡(Xˉ)=3512nE[\bar X]=\frac72, \qquad \operatorname{Var}(\bar X)=\frac{35}{12n}

を得る。

2 順序統計量

補題 2.1.n≥1n\geq1とする。Y∼Bin⁡(n,p)Y\sim\operatorname{Bin}(n,p)に対して

Tx(p)=Pp(Y≥x)(1≤x≤n),Hx(p)=Pp(Y≤x)(0≤x≤n−1)T_x(p)=P_p(Y\geq x)\quad(1\leq x\leq n),\qquad H_x(p)=P_p(Y\leq x)\quad(0\leq x\leq n-1)

とおく。TxT_xは[0,1][0,1]上で連続かつ狭義単調増加であり、Tx(0)=0T_x(0)=0、Tx(1)=1T_x(1)=1を満たす。0<p<10<p<1では

Tx′(p)=n(n−1x−1)px−1(1−p)n−x>0T_x'(p)=n\binom{n-1}{x-1}p^{x-1}(1-p)^{n-x}>0

である。HxH_xは[0,1][0,1]上で連続かつ狭義単調減少であり、Hx(0)=1H_x(0)=1、Hx(1)=0H_x(1)=0を満たし、0<p<10<p<1では

Hx′(p)=−n(n−1x)px(1−p)n−x−1<0H_x'(p)=-n\binom{n-1}{x}p^x(1-p)^{n-x-1}<0

である。さらに、xxが増加するとTx(p)T_x(p)は非増加になり、Hx(p)H_x(p)は非減少になる。

証明.§E11.5 定義 1.2の確率質量関数から、0<p<10<p<1において有限和を微分する。恒等式k(nk)=n(n−1k−1)k\binom nk=n\binom{n-1}{k-1}と(n−k)(nk)=n(n−1k)(n-k)\binom nk=n\binom{n-1}{k}を用いると、中間項が相殺されて

Tx′(p)=n∑k=xn{(n−1k−1)pk−1(1−p)n−k−(n−1k)pk(1−p)n−k−1}=n(n−1x−1)px−1(1−p)n−x>0\begin{aligned} T_x'(p) &=n\sum_{k=x}^n\left\{\binom{n-1}{k-1}p^{k-1}(1-p)^{n-k} -\binom{n-1}{k}p^k(1-p)^{n-k-1}\right\}\\ &=n\binom{n-1}{x-1}p^{x-1}(1-p)^{n-x}>0 \end{aligned}

を得る。和の各項は多項式であるためTxT_xは[0,1][0,1]上で連続であり、端点の値は確率質量関数へp=0,1p=0,1を代入して得られる。またHx(p)=1−Tx+1(p)H_x(p)=1-T_{x+1}(p)であるから、HxH_xに関する導関数、連続性、狭義単調性および端点の主張も従う。事象{Y≥x+1}⊆{Y≥x}\{Y\geq x+1\}\subseteq\{Y\geq x\}と{Y≤x}⊆{Y≤x+1}\{Y\leq x\}\subseteq\{Y\leq x+1\}から、xxに関する二つの単調性を得る。▨

命題 2.2 (順序統計量の分布).X1,…,XnX_1,\dots,X_nを分布関数FFに従う独立同分布な実確率変数とし、小さい順に並べた値をX(1)≤⋯≤X(n)X_{(1)}\leq\cdots\leq X_{(n)}と書く。1≤k≤n1\leq k\leq nとx∈Rx\in\Rに対して

P(X(k)≤x)=∑j=kn(nj)F(x)j(1−F(x))n−j.P(X_{(k)}\leq x)=\sum_{j=k}^n\binom njF(x)^j(1-F(x))^{n-j}.

この式はFFが原子をもつ場合にも成り立つ。さらにFFが Lebesgue 密度ffをもつならば、X(k)X_{(k)}は密度

n!(k−1)!(n−k)!F(x)k−1(1−F(x))n−kf(x)\frac{n!}{(k-1)!(n-k)!}F(x)^{k-1}(1-F(x))^{n-k}f(x)

をもつ。

証明. 固定したxxに対してNx=∑i=1n1{Xi≤x}N_x=\sum_{i=1}^n\mathbf1_{\{X_i\leq x\}}とおく。事象{X(k)≤x}\{X_{(k)}\leq x\}は{Nx≥k}\{N_x\geq k\}に等しい。各指示関数は成功確率F(x)F(x)の独立な Bernoulli 確率変数であるから、

P(Nx=j)=(nj)F(x)j(1−F(x))n−jP(N_x=j)=\binom njF(x)^j(1-F(x))^{n-j}

であり、j=k,…,nj=k,\dots,nについて和を取れば分布関数の式を得る。この議論ではFFの連続性を用いていない。

FFが密度ffをもつとする。分布関数の式は補題 2.1のTkT_kを用いてTk(F(x))T_k(F(x))と書くことができる。同補題の導関数の式から

Tk′(u)=n!(k−1)!(n−k)!uk−1(1−u)n−kT_k'(u)=\frac{n!}{(k-1)!(n-k)!}u^{k-1}(1-u)^{n-k}

である。TkT_kは[0,1][0,1]上で連続微分可能であり、FFは絶対連続でF′=fF'=fがほとんど至る所で成り立つため、合成Tk∘FT_k\circ Fも絶対連続である。連鎖律から表示した密度を得る。▨

例 2.3 (一様標本の順序統計量).X1,…,XnX_1,\dots,X_nを区間(0,1)(0,1)上の一様分布からの無作為標本とする。0<x<10<x<1におけるX(k)X_{(k)}の密度は

n!(k−1)!(n−k)!xk−1(1−x)n−k\frac{n!}{(k-1)!(n-k)!}x^{k-1}(1-x)^{n-k}

である。特に最大値X(n)X_{(n)}について

P(X(n)≤x)=xn,fX(n)(x)=nxn−1P(X_{(n)}\leq x)=x^n, \qquad f_{X_{(n)}}(x)=nx^{n-1}

となる。x≤0x\leq0では分布関数は00、x≥1x\geq1では11である。

3 積率条件と標本平均

有限標本の積率公式と大標本での集中は、母集団に課す積率条件に依存する。次の標準 Cauchy 分布は、その条件を外したときに標本平均の挙動が変わる例である。

命題 3.1. 関数

f(x)=1π(1+x2)(x∈R)f(x)=\frac1{\pi(1+x^2)}\qquad(x\in\R)

は確率密度である。この密度をもつ標準 Cauchy 分布に従う確率変数XXについて

E[X+]=E[X−]=∞E[X^+]=E[X^-]=\infty

であり、平均は定義されない。独立同分布なX1,X2,…X_1,X_2,\ldotsがこの分布に従うならば、任意のn≥1n\geq1に対して標本平均Xˉn\bar X_nも標準 Cauchy 分布に従う。したがって、Xˉn\bar X_nはどの定数にも確率収束しない。さらに、任意のt≠0t\ne0に対して

E[etX]=∞E[e^{tX}]=\infty

である。

証明. 逆正接関数の原始関数を用いると

∫Rdxπ(1+x2)=1π[arctan⁡x]−∞∞=1\int_{\R}\frac{dx}{\pi(1+x^2)} =\frac1\pi\left[\arctan x\right]_{-\infty}^{\infty}=1

であるから、ffは確率密度である。非負確率変数の期待値を密度で積分すると

E[X+]=1π∫0∞x1+x2 dx=∞,E[X−]=1π∫−∞0−x1+x2 dx=∞E[X^+]=\frac1\pi\int_0^\infty\frac{x}{1+x^2}\,dx=\infty, \qquad E[X^-]=\frac1\pi\int_{-\infty}^0\frac{-x}{1+x^2}\,dx=\infty

を得る。したがってE[X]E[X]は正部分と負部分の期待値の差として定義されず、E[∣X∣]=∞E[|X|]=\inftyでもある。

a>0a>0に対して

fa(x)=aπ(a2+x2)f_a(x)=\frac{a}{\pi(a^2+x^2)}

とおく。逆正接関数による同じ積分から、faf_aは確率密度である。a,b>0a,b>0とz≠0z\ne0に対して

1(x2+a2)((z−x)2+b2)=Ax+Bx2+a2+−A(x−z)+D(x−z)2+b2,A=2zΔ,B=z2+b2−a2Δ,D=z2+a2−b2Δ,Δ=(z2+(a+b)2)(z2+(a−b)2)\begin{aligned} \frac1{(x^2+a^2)((z-x)^2+b^2)} &=\frac{Ax+B}{x^2+a^2} +\frac{-A(x-z)+D}{(x-z)^2+b^2},\\ A&=\frac{2z}{\Delta},\qquad B=\frac{z^2+b^2-a^2}{\Delta},\qquad D=\frac{z^2+a^2-b^2}{\Delta},\\ \Delta&=(z^2+(a+b)^2)(z^2+(a-b)^2) \end{aligned}

が成り立つ。両辺を[−R,R][-R,R]上で積分してR→∞R\to\inftyとする。一次の分子から生じる二つの対数項は極限で相殺され、逆正接項から

∫Rdx(x2+a2)((z−x)2+b2)=π(Ba+Db)=π(a+b)ab(z2+(a+b)2)\int_{\R}\frac{dx}{(x^2+a^2)((z-x)^2+b^2)} =\pi\left(\frac Ba+\frac Db\right) =\frac{\pi(a+b)}{ab(z^2+(a+b)^2)}

を得る。固定したa,b>0a,b>0に対し、任意のz,x∈Rz,x\in\Rについて

fa(x)fb(z−x)≤fa(x)πbf_a(x)f_b(z-x)\leq\frac{f_a(x)}{\pi b}

であり、右辺はxxについて可積分である。fbf_bの連続性と優収束定理§E9.7 定理 3.2により、fa∗fbf_a*f_bはzzの連続関数である。上でz≠0z\ne0に対して得た積分公式の右辺もzzについて連続であるから、z→0z\to0として同じ公式がz=0z=0でも成り立つ。したがって

(fa∗fb)(z)=abπ2∫Rdx(x2+a2)((z−x)2+b2)=fa+b(z)(f_a*f_b)(z) =\frac{ab}{\pi^2}\int_{\R}\frac{dx}{(x^2+a^2)((z-x)^2+b^2)} =f_{a+b}(z)

である。

Sn=X1+⋯+XnS_n=X_1+\cdots+X_nとおく。独立な連続確率変数の和の密度を与える畳み込み定理§E11.9 定理 2.2とfa∗fb=fa+bf_a*f_b=f_{a+b}を帰納的に適用すると、SnS_nは密度fnf_nをもつ。密度の尺度変換からSn/n=XˉnS_n/n=\bar X_nの密度は

nfn(nx)=1π(1+x2)=f(x)n f_n(nx)=\frac1{\pi(1+x^2)}=f(x)

である。任意のc∈Rc\in\Rに対して

P(∣Xˉn−c∣>1)=P(∣X−c∣>1)>0P(|\bar X_n-c|>1)=P(|X-c|>1)>0

はnnに依存しないため、Xˉn\bar X_nはccへ確率収束しない。

t>0t>0とする。十分大きなxxでは1+x2≤etx/21+x^2\leq e^{tx/2}であるから、正の裾で

etxπ(1+x2)≥1πetx/2\frac{e^{tx}}{\pi(1+x^2)}\geq\frac1\pi e^{tx/2}

となり、その積分は発散する。ゆえにE[etX]=∞E[e^{tX}]=\inftyである。t<0t<0の場合はy=−xy=-xと変数変換すると、負の裾の積分が−t>0-t>0に対する同じ積分へ移るため、やはりE[etX]=∞E[e^{tX}]=\inftyである。▨

4 大数の法則と中心極限定理の統計的読み

定理 4.1.X1,X2,…X_1,X_2,\dotsを独立同分布な実確率変数列とし、X1∈L1(P)X_1\in L^1(P)、μ=E[X1]\mu=E[X_1]とする。このとき、任意のε>0\varepsilon>0に対して

P(∣Xˉ−μ∣>ε)→n→∞0,すなわちXˉ→Pμ.P(|\bar X-\mu|>\varepsilon)\xrightarrow[n\to\infty]{}0, \qquad\text{すなわち}\quad\bar X\xrightarrow{P}\mu.

したがって、標本平均は母平均の一致推定量である。

証明.§E11.15 定理 2.1をX1,X2,…X_1,X_2,\dotsに適用すると、表示した確率収束を得る。▨

二次可積分性も仮定するならば、大数の強法則§E11.15 定理 4.1によりXˉ→μ\bar X\to\muが確率11で成り立つ。

定理 4.2.X1,X2,…X_1,X_2,\dotsを独立同分布な実確率変数列とし、X1∈L2(P)X_1\in L^2(P)、μ=E[X1]\mu=E[X_1]、0<σ2=Var⁡(X1)<∞0<\sigma^2=\operatorname{Var}(X_1)<\inftyとする。このとき、

Xˉ−μσ/n=n(Xˉ−μ)σ→n→∞dN(0,1).\frac{\bar X-\mu}{\sigma/\sqrt n}=\frac{\sqrt n(\bar X-\mu)}{\sigma} \xrightarrow[n\to\infty]{d}N(0,1).

したがって、nnが大きいとき、Xˉ\bar Xの分布をN(μ,σ2/n)N(\mu,\sigma^2/n)によって近似することができる。

証明.§E11.16 定理 2.1を中心化した確率変数Xi−μX_i-\muに適用すると、

1σn∑i=1n(Xi−μ)→dN(0,1)\frac1{\sigma\sqrt n}\sum_{i=1}^n(X_i-\mu)\xrightarrow{d}N(0,1)

を得る。左辺はn(Xˉ−μ)/σ\sqrt n(\bar X-\mu)/\sigmaに等しい。▨

正規標本の平均. 母平均μ\muは未知で母標準偏差がσ=20\sigma=20である正規母集団から、大きさn=100n=100の無作為標本を取る。標本平均の標準誤差は

SE⁡(Xˉ)=σn=20100=2010=2.\operatorname{SE}(\bar X)=\frac{\sigma}{\sqrt n}=\frac{20}{\sqrt{100}}=\frac{20}{10}=2.

独立性から(X1,…,X100)(X_1,\ldots,X_{100})の法則は、Z∼N100(0,I100)Z\sim N_{100}(0,I_{100})に対するμ1+20Z\mu\mathbf1+20Zの法則に等しい。したがって、多変量正規分布のアフィン像による特徴づけ§E11.10 定理 4.2を係数ベクトル1/100\mathbf1/100に適用すると、Xˉ∼N(μ,22)\bar X\sim N(\mu,2^2)である。ゆえに、標本平均が母平均の±3\pm3に入る確率は正確に

P(∣Xˉ−μ∣<3)=2Φ ⁣(32)−1=2Φ(1.5)−1≈0.86639,P(|\bar X-\mu|<3)=2\Phi\!\left(\frac32\right)-1=2\Phi(1.5)-1\approx0.86639,

すなわち約87%87\%である。ただし、Φ\Phiは標準正規分布関数であり、Φ(1.5)≈0.93319\Phi(1.5)\approx0.93319である。一方、1 個体の観測値X1X_1が母平均の±3\pm3に入る確率は2Φ(3/20)−1=2Φ(0.15)−1≈2×0.55962−1≈0.1192\Phi(3/20)-1=2\Phi(0.15)-1\approx2\times0.55962-1\approx0.119、約12%12\%にすぎない。100100個の平均では標準誤差が2020から22へ減少するため、この確率が約12%12\%から約87%87\%へ増加する。

5 Slutsky の定理とデルタ法

連続写像定理と Slutsky の定理は、確率変数の変換および一致推定量による定数の置換を扱う。

補題 5.1.Xn→dXX_n\xrightarrow{d}Xとし、C⊂RC\subset\Rを閉集合とする。このとき

lim sup⁡n→∞P(Xn∈C)≤P(X∈C).\limsup_{n\to\infty}P(X_n\in C)\leq P(X\in C).

証明.C=∅C=\varnothingの場合は明らかである。C≠∅C\ne\varnothingとし、m≥1m\geq1に対して

fm(x)=max⁡{1−mdist⁡(x,C),0}f_m(x)=\max\{1-m\operatorname{dist}(x,C),0\}

とおく。§E11.17 命題 1.2により一次元の分布収束は有界連続関数による弱収束と一致するため、

lim sup⁡n→∞P(Xn∈C)≤lim⁡n→∞E[fm(Xn)]=E[fm(X)]\limsup_{n\to\infty}P(X_n\in C)\leq\lim_{n\to\infty}E[f_m(X_n)]=E[f_m(X)]

である。fm↓1Cf_m\downarrow\mathbf1_Cであり0≤fm≤10\leq f_m\leq1なので、優収束定理§E9.7 定理 3.2を適用し、m→∞m\to\inftyとすれば結論を得る。▨

定理 5.2 (連続写像定理・Slutsky の定理).Xn,YnX_n,Y_nを一つの確率空間上の実確率変数とし、Xn→dXX_n\xrightarrow{d}X、Yn→PcY_n\xrightarrow{P}cとする。ただし、ccは定数である。このとき次が成り立つ。

  1. h:R→Rh:\R\to\Rが Borel 可測であり、不連続点全体をDhD_hとするとき、P(X∈Dh)=0P(X\in D_h)=0ならばh(Xn)→dh(X)h(X_n)\xrightarrow{d}h(X)である。
  2. Xn+Yn→dX+cX_n+Y_n\xrightarrow{d}X+c、XnYn→dcXX_nY_n\xrightarrow{d}cXである。また、c≠0c\ne0ならばXn/Yn→dX/cX_n/Y_n\xrightarrow{d}X/cである。

商はYn=0Y_n=0の事象上で任意の固定値に定める。

証明.(1)を示す。hhが全域で連続な場合は§E11.17 定理 1.3の一次元特殊化である。一般の場合に、閉集合B⊂RB\subset\Rを取る。hhがxxで連続でh(x)∉Bh(x)\notin Bならば、BBが閉であることからxxの近傍UUでh(U)∩B=∅h(U)\cap B=\varnothingとなる。したがって、

h−1(B)‾⊂h−1(B)∪Dh.\overline{h^{-1}(B)}\subset h^{-1}(B)\cup D_h.

補題 5.1より

lim sup⁡n→∞P(h(Xn)∈B)≤P(X∈h−1(B)‾)≤P(h(X)∈B)\limsup_{n\to\infty}P(h(X_n)\in B) \leq P(X\in\overline{h^{-1}(B)}) \leq P(h(X)\in B)

である。補集合を取れば、開集合GGに対してlim inf⁡nP(h(Xn)∈G)≥P(h(X)∈G)\liminf_nP(h(X_n)\in G)\geq P(h(X)\in G)も得る。h(X)h(X)の分布関数の連続点ttにおいて、閉集合(−∞,t](-\infty,t]と開集合(−∞,t)(-\infty,t)を用いると、P(h(X)=t)=0P(h(X)=t)=0であるから分布関数が収束する。よってh(Xn)→dh(X)h(X_n)\xrightarrow{d}h(X)である。

(2)の和と積は§E11.17 定理 5.3と§E11.17 系 5.4の一次元特殊化である。c≠0c\ne0とし、Yn≠0Y_n\ne0ではRn=1/YnR_n=1/Y_n、Yn=0Y_n=0ではRn=0R_n=0と定める。事象{∣Yn−c∣<∣c∣/2}\{|Y_n-c|<|c|/2\}上では∣Yn∣>∣c∣/2|Y_n|>|c|/2であり、

∣Rn−1c∣=∣Yn−c∣∣cYn∣≤2∣c∣2∣Yn−c∣.\left|R_n-\frac1c\right| =\frac{|Y_n-c|}{|cY_n|} \leq\frac{2}{|c|^2}|Y_n-c|.

したがって、任意のε>0\varepsilon>0に対して

P(∣Rn−1c∣>ε)≤P(∣Yn−c∣≥∣c∣2)+P(∣Yn−c∣>ε∣c∣22)⟶0.P\left(\left|R_n-\frac1c\right|>\varepsilon\right) \leq P\left(|Y_n-c|\geq\frac{|c|}{2}\right) +P\left(|Y_n-c|>\frac{\varepsilon|c|^2}{2}\right) \longrightarrow0.

この評価はc<0c<0の場合も含む。積の結論をXnX_nとRnR_nに適用するとXnRn→dX/cX_nR_n\xrightarrow{d}X/cを得る。Yn=0Y_n=0上で任意の固定値を与えた商をQnQ_nとすると、

P(Qn≠XnRn)≤P(Yn=0)≤P(∣Yn−c∣≥∣c∣/2)⟶0.P(Q_n\ne X_nR_n)\leq P(Y_n=0)\leq P(|Y_n-c|\geq|c|/2)\longrightarrow0.

従って和に関する Slutsky の結論からQn→dX/cQ_n\xrightarrow{d}X/cである。▨

命題 5.3.X1,X2,…X_1,X_2,\dotsを独立同分布なL2(P)L^2(P)確率変数列とし、μ=E[X1]\mu=E[X_1]、σ2=Var⁡(X1)\sigma^2=\operatorname{Var}(X_1)とする。n≥2n\geq2に対してSn2S_n^2を命題 1.6の式で定めると、

Sn2→Pσ2.S_n^2\xrightarrow{P}\sigma^2.

さらにσ2>0\sigma^2>0ならば、Sn=Sn2S_n=\sqrt{S_n^2}はSn→PσS_n\xrightarrow{P}\sigmaを満たし、

n(Xˉ−μ)Sn→dN(0,1).\frac{\sqrt n(\bar X-\mu)}{S_n}\xrightarrow{d}N(0,1).

商はSn=0S_n=0の事象上で00と定める。

証明.§E11.15 定理 2.1をXiX_iとXi2X_i^2に適用すると、

Xˉ→Pμ,1n∑i=1nXi2→PE[X12]\bar X\xrightarrow{P}\mu, \qquad \frac1n\sum_{i=1}^nX_i^2\xrightarrow{P}E[X_1^2]

である。X12∈L1(P)X_1^2\in L^1(P)であるため、二つ目の適用に四次積率は不要である。§E11.17 命題 5.2により

(nn−1,1n∑i=1nXi2,Xˉ)→P(1,E[X12],μ)\left(\frac{n}{n-1},\frac1n\sum_{i=1}^nX_i^2,\bar X\right) \xrightarrow{P}(1,E[X_1^2],\mu)

である。写像(a,b,x)↦a(b−x2)(a,b,x)\mapsto a(b-x^2)は極限点で連続であるため、連続性のε\varepsilon–δ\delta条件と確率収束の定義から、命題 1.6の恒等式より

Sn2=nn−1(1n∑i=1nXi2−Xˉ2)→PE[X12]−μ2=σ2S_n^2=\frac{n}{n-1}\left(\frac1n\sum_{i=1}^nX_i^2-\bar X^2\right) \xrightarrow{P}E[X_1^2]-\mu^2=\sigma^2

を得る。平方根関数は[0,∞)[0,\infty)上で連続なので、σ2>0\sigma^2>0ならばSn→PσS_n\xrightarrow{P}\sigmaである。定理 4.2と定理 5.2 (2)の商に関する結論を、n(Xˉ−μ)/σ\sqrt n(\bar X-\mu)/\sigmaとSn/σS_n/\sigmaに適用すると、最後の分布収束を得る。分母が00の事象上で商を00とする補完も同結論に含まれる。▨

この結論では、未知の母標準偏差を一致推定量SnS_nで置き換えている。

定理 5.4 (デルタ法).X1,X2,…X_1,X_2,\dotsが中心極限定理定理 4.2の仮定を満たすとする。I⊂RI\subset\Rをμ\muを含む開区間とし、g:I→Rg:I\to\Rは連続微分可能でg′(μ)≠0g'(\mu)\ne0とする。g~:R→R\widetilde g:\R\to\Rが Borel 可測であり、μ\muのある近傍上でggと一致するならば、

n(g~(Xˉ)−g(μ))→dN ⁣(0,g′(μ)2σ2).\sqrt n\bigl(\widetilde g(\bar X)-g(\mu)\bigr)\xrightarrow{d}N\!\bigl(0,g'(\mu)^2\sigma^2\bigr).

延長の選択は極限分布に影響しない。

証明.[μ−δ,μ+δ]⊂I[\mu-\delta,\mu+\delta]\subset Iとなるδ>0\delta>0を取る。∣x−μ∣<δ|x-\mu|<\deltaではg(x)g(x)、その外ではg(μ)g(\mu)と定めれば Borel 可測延長が得られるため、主張に現れる延長は存在する。任意のg~\widetilde gを固定し、

r(x)={g~(x)−g(μ)x−μ−g′(μ),x≠μ,0,x=μr(x)=\begin{cases} \dfrac{\widetilde g(x)-g(\mu)}{x-\mu}-g'(\mu),&x\ne\mu,\\ 0,&x=\mu \end{cases}

とおく。ggのμ\muにおける微分可能性から、x→μx\to\muのときr(x)→0r(x)\to0であり、rrは Borel 可測である。定理 4.1によりXˉ→Pμ\bar X\xrightarrow{P}\muなので、r(Xˉ)→P0r(\bar X)\xrightarrow{P}0である。差商の定義から

n(g~(Xˉ)−g(μ))=(g′(μ)+r(Xˉ))n(Xˉ−μ)\sqrt n\bigl(\widetilde g(\bar X)-g(\mu)\bigr) =\bigl(g'(\mu)+r(\bar X)\bigr)\sqrt n(\bar X-\mu)

である。定理 4.2と Slutsky の積の結論§E11.17 系 5.4を適用すると、右辺はg′(μ)Zg'(\mu)Zに分布収束する。ただしZ∼N(0,σ2)Z\sim N(0,\sigma^2)である。よって極限分布はN(0,g′(μ)2σ2)N(0,g'(\mu)^2\sigma^2)である。

二つの可測延長はμ\muのある共通近傍で一致する。定理 4.1によりXˉ\bar Xがその近傍に入る確率は11へ収束するため、二つの延長から得る確率変数が異なる確率は00へ収束する。従って延長の選択は極限分布に影響しない。▨

例 5.5 (正の母平均の対数変換).X1,X2,…X_1,X_2,\dotsを独立同分布なL2(P)L^2(P)確率変数列とし、μ=E[X1]>0\mu=E[X_1]>0、0<σ2=Var⁡(X1)<∞0<\sigma^2=\operatorname{Var}(X_1)<\inftyとする。x>0x>0ではg~(x)=log⁡x\widetilde g(x)=\log x、x≤0x\leq0ではg~(x)=0\widetilde g(x)=0と定める。g(x)=log⁡xg(x)=\log xはμ\muの近傍で連続微分可能であり、g′(μ)=1/μg'(\mu)=1/\muであるから、定理 5.4により

n(g~(Xˉ)−log⁡μ)→dN ⁣(0,σ2μ2).\sqrt n\bigl(\widetilde g(\bar X)-\log\mu\bigr) \xrightarrow{d}N\!\left(0,\frac{\sigma^2}{\mu^2}\right).

したがって、n(g~(Xˉ)−log⁡μ)\sqrt n(\widetilde g(\bar X)-\log\mu)の極限正規分布の分散はσ2/μ2\sigma^2/\mu^2である。

例 5.6 (導関数が零になる二乗変換).X1,X2,…X_1,X_2,\dotsを独立同分布なL2(P)L^2(P)確率変数列とし、E[X1]=0E[X_1]=0、0<σ2=Var⁡(X1)<∞0<\sigma^2=\operatorname{Var}(X_1)<\inftyとする。g(x)=x2g(x)=x^2ではg′(0)=0g'(0)=0である。定理 4.2と定理 5.2 (1)により、G∼N(0,1)G\sim N(0,1)に対して

nXˉ2=(nXˉ)2→dσ2G2.n\bar X^2=\bigl(\sqrt n\bar X\bigr)^2\xrightarrow{d}\sigma^2G^2.

さらに1/n→01/\sqrt n\to0であるから、Slutsky の積の結論により

nXˉ2=1n nXˉ2→d0.\sqrt n\bar X^2=\frac1{\sqrt n}\,n\bar X^2\xrightarrow{d}0.

すなわち、n\sqrt n尺度では極限が退化する一方、nn尺度では標準正規変数の平方のσ2\sigma^2倍として表される非退化な極限をもつ。

6 有限標本法則と漸近法

定理 4.2はXˉ\bar X自身ではなくn(Xˉ−μ)/σ\sqrt n(\bar X-\mu)/\sigmaの分布収束を述べ、定理 4.1はXˉ\bar X自身が定数μ\muへ確率収束することを述べる。

一般の独立同分布な母集団では、Xˉ\bar XとSn2S_n^2の独立性や(n−1)Sn2/σ2∼χn−12(n-1)S_n^2/\sigma^2\sim\chi^2_{n-1}は有限標本では成立するとは限らない。正規性を仮定しない場合には、定理 4.2と命題 5.3が与える漸近的な正規法則を用いる。

前提記事

11 本の記事・単元を表示