§E11.15大数の法則

最終更新

独立同分布な実確率変数列X1,X2,…X_1,X_2,\ldotsの部分和を

Sn=∑k=1nXkS_n=\sum_{k=1}^n X_k

とする。大数の法則は、標本平均Sn/nS_n/nが共通の期待値へ収束するための条件を与える。弱大数の法則は確率収束を結論し、強大数の法則はほとんど確実な収束を結論する。本記事は、弱法則をL1L^1の仮定から、強法則をL2L^2の仮定から証明する。

1 可積分確率変数の切断

弱大数の法則では分散を仮定しないため、XkX_kへ Chebyshev の不等式を直接適用することはできない。そこで、標本数nnに応じてXkX_kを高さnnで切断し、切断による誤差と切断後の分散を別々に評価する。

切断法で用いる二つの極限を先に示す。

補題 1.1.X∈L1(P)X\in L^1(P)ならば、

nP(∣X∣>n)⟶0nP(|X|>n)\longrightarrow0

が成り立つ。

証明. 事象{∣X∣>n}\{|X|>n\}上ではn≤∣X∣n\leq |X|であるから、

nP(∣X∣>n)≤E ⁣[∣X∣1{∣X∣>n}]nP(|X|>n) \leq E\!\left[|X|\mathbf 1_{\{|X|>n\}}\right]

である。右辺の被積分関数は各点で00へ収束し、可積分関数∣X∣|X|によって抑えられる。優収束定理§E9.7 定理 3.2により右辺は00へ収束する。▨

補題 1.2.X∈L1(P)X\in L^1(P)とし、

Yn=X1{∣X∣≤n}Y_n=X\mathbf 1_{\{|X|\leq n\}}

と定める。このとき

E[Yn]⟶E[X],E[Yn2]n⟶0E[Y_n]\longrightarrow E[X], \qquad \frac{E[Y_n^2]}{n}\longrightarrow0

が成り立つ。

証明.Yn→XY_n\to Xが各点で成り立ち、∣Yn∣≤∣X∣|Y_n|\leq|X|である。したがって、優収束定理§E9.7 定理 3.2によりE[Yn]→E[X]E[Y_n]\to E[X]となる。

また、

0≤Yn2n=X2n1{∣X∣≤n}≤∣X∣0\leq \frac{Y_n^2}{n} =\frac{X^2}{n}\mathbf 1_{\{|X|\leq n\}} \leq |X|

である。固定した実数xxに対してx21{∣x∣≤n}/n→0x^2\mathbf 1_{\{|x|\leq n\}}/n\to0であるから、再び優収束定理を適用するとE[Yn2]/n→0E[Y_n^2]/n\to0を得る。▨

2 弱大数の法則

2.1 証明方針

nn個の確率変数を同じ高さnnで切断する。少なくとも一つの切断が起こる確率は和事象の評価と可積分性によって00へ収束する。切断後の和には有限な分散があるため、Chebyshev の不等式を適用する。切断後の平均が元の期待値へ収束することを組み合わせて、標本平均の確率収束を得る。

定理 2.1 (弱大数の法則).X1,X2,…X_1,X_2,\ldotsを独立同分布な実確率変数列とし、E[∣X1∣]<∞E[|X_1|]<\inftyと仮定する。μ=E[X1]\mu=E[X_1]およびSn=∑k=1nXkS_n=\sum_{k=1}^nX_kと置く。このとき、任意のε>0\varepsilon>0に対して

P ⁣(∣Snn−μ∣>ε)⟶0P\!\left(\left|\frac{S_n}{n}-\mu\right|>\varepsilon\right)\longrightarrow0

が成り立つ。

証明.1≤k≤n1\leq k\leq nに対して

Yn,k=Xk1{∣Xk∣≤n},Tn=∑k=1nYn,k,mn=E[Yn,1]Y_{n,k}=X_k\mathbf 1_{\{|X_k|\leq n\}}, \qquad T_n=\sum_{k=1}^nY_{n,k}, \qquad m_n=E[Y_{n,1}]

と置く。各Yn,kY_{n,k}はXkX_kの Borel 可測関数であるから、固定したnnに対してYn,1,…,Yn,nY_{n,1},\ldots,Y_{n,n}は独立同分布である。

Sn≠TnS_n\neq T_nならば、少なくとも一つのk≤nk\leq nが∣Xk∣>n|X_k|>nを満たす。したがって、和事象の評価と同分布性から

P(Sn≠Tn)≤∑k=1nP(∣Xk∣>n)=nP(∣X1∣>n)⟶0P(S_n\neq T_n) \leq \sum_{k=1}^nP(|X_k|>n) =nP(|X_1|>n) \longrightarrow0

である。最後の極限には補題 1.1を用いた。

切断された各確率変数は二次可積分である。独立性による積の期待値の分解§E11.7 定理 3.1と期待値の線形性から、異なる添字の共分散は00であり、

Var⁡(Tn)=nVar⁡(Yn,1)≤nE[Yn,12]\operatorname{Var}(T_n)=n\operatorname{Var}(Y_{n,1}) \leq nE[Y_{n,1}^2]

となる。Chebyshev の不等式§E11.4 系 3.2をTnT_nへ適用すると、

P ⁣(∣Tnn−mn∣>ε2)≤4Var⁡(Tn)n2ε2≤4E[Yn,12]nε2⟶0P\!\left(\left|\frac{T_n}{n}-m_n\right|>\frac{\varepsilon}{2}\right) \leq \frac{4\operatorname{Var}(T_n)}{n^2\varepsilon^2} \leq \frac{4E[Y_{n,1}^2]}{n\varepsilon^2} \longrightarrow0

を得る。最後の極限には補題 1.2を用いた。

同じ補題によりmn→μm_n\to\muであるから、十分大きなnnでは∣mn−μ∣≤ε/2|m_n-\mu|\leq\varepsilon/2となる。そのようなnnについて、

P ⁣(∣Snn−μ∣>ε)≤P(Sn≠Tn)+P ⁣(∣Tnn−mn∣>ε2)P\!\left(\left|\frac{S_n}{n}-\mu\right|>\varepsilon\right) \leq P(S_n\neq T_n) +P\!\left(\left|\frac{T_n}{n}-m_n\right|>\frac{\varepsilon}{2}\right)

である。右辺の二項はいずれも00へ収束するため、主張を得る。▨

3 Kolmogorov の最大不等式

強大数の法則では、二進部分列の間にあるすべての部分和も制御する必要がある。Kolmogorov の最大不等式は、一つの終端部分和の分散によって、それ以前の部分和の最大偏差を評価する。

3.1 証明方針

部分和が初めて閾値を越える時刻ごとに互いに素な事象を作る。初回通過までの部分和は、その後の増分と独立であり、後続増分の期待値は00である。この独立性によって交差項が消え、終端部分和の二乗積率が初回通過確率を支配する。

定理 3.1 (Kolmogorov の最大不等式).Z1,…,ZnZ_1,\ldots,Z_nを独立な実確率変数とし、各ZkZ_kがE[Zk]=0E[Z_k]=0およびE[Zk2]<∞E[Z_k^2]<\inftyを満たすと仮定する。Rk=∑j=1kZjR_k=\sum_{j=1}^kZ_jと置く。このとき、任意のλ>0\lambda>0に対して

P ⁣(max⁡1≤k≤n∣Rk∣≥λ)≤1λ2∑k=1nVar⁡(Zk)P\!\left(\max_{1\leq k\leq n}|R_k|\geq\lambda\right) \leq\frac{1}{\lambda^2}\sum_{k=1}^n\operatorname{Var}(Z_k)

が成り立つ。

証明.1≤k≤n1\leq k\leq nに対して

Ak={max⁡1≤j<k∣Rj∣<λ, ∣Rk∣≥λ}A_k=\left\{\max_{1\leq j<k}|R_j|<\lambda,\ |R_k|\geq\lambda\right\}

と置く。k=1k=1のとき、最初の条件は空条件とする。事象A1,…,AnA_1,\ldots,A_nは互いに素であり、その和は{max⁡1≤k≤n∣Rk∣≥λ}\{\max_{1\leq k\leq n}|R_k|\geq\lambda\}に等しい。

AkA_kとRkR_kはZ1,…,ZkZ_1,\ldots,Z_kから定まり、Rn−RkR_n-R_kはZk+1,…,ZnZ_{k+1},\ldots,Z_nから定まる。したがって、Rk1AkR_k\mathbf1_{A_k}とRn−RkR_n-R_kは独立であり、E[Rn−Rk]=0E[R_n-R_k]=0である。積の期待値の分解§E11.7 定理 3.1により、

E ⁣[Rk1Ak(Rn−Rk)]=0E\!\left[R_k\mathbf1_{A_k}(R_n-R_k)\right]=0

となる。また、E[(Rn−Rk)21Ak]≥0E[(R_n-R_k)^2\mathbf1_{A_k}]\geq0であるから、

E[Rn21Ak]=E[Rk21Ak]+2E ⁣[Rk1Ak(Rn−Rk)]+E[(Rn−Rk)21Ak]≥E[Rk21Ak]≥λ2P(Ak).\begin{aligned} E[R_n^2\mathbf1_{A_k}] &=E[R_k^2\mathbf1_{A_k}] +2E\!\left[R_k\mathbf1_{A_k}(R_n-R_k)\right] +E[(R_n-R_k)^2\mathbf1_{A_k}]\\ &\geq E[R_k^2\mathbf1_{A_k}] \geq\lambda^2P(A_k). \end{aligned}

事象AkA_kが互いに素であることから、

E[Rn2]≥∑k=1nE[Rn21Ak]≥λ2∑k=1nP(Ak).E[R_n^2] \geq\sum_{k=1}^nE[R_n^2\mathbf1_{A_k}] \geq\lambda^2\sum_{k=1}^nP(A_k).

独立性とE[Zk]=0E[Z_k]=0により異なる添字の積の期待値は00であるため、

E[Rn2]=∑k=1nE[Zk2]=∑k=1nVar⁡(Zk).E[R_n^2]=\sum_{k=1}^nE[Z_k^2] =\sum_{k=1}^n\operatorname{Var}(Z_k).

以上の二式を組み合わせ、λ2\lambda^2で割ると主張を得る。▨

4 強大数の法則

4.1 証明方針

確率変数を平均で中心化する。まず、添字2m2^mの部分和を Chebyshev の不等式と第一 Borel–Cantelli の補題によって制御する。次に、2m2^mから2m+12^{m+1}までの各ブロック内の最大増分へ Kolmogorov の最大不等式を適用する。二つの評価を組み合わせると、二進部分列の間のすべての添字を補間することができる。

定理 4.1 (強大数の法則(L2L^2版)).X1,X2,…X_1,X_2,\ldotsを独立同分布な実確率変数列とし、E[X12]<∞E[X_1^2]<\inftyと仮定する。μ=E[X1]\mu=E[X_1]およびSn=∑k=1nXkS_n=\sum_{k=1}^nX_kと置く。このとき

P ⁣(lim⁡n→∞Snn=μ)=1P\!\left(\lim_{n\to\infty}\frac{S_n}{n}=\mu\right)=1

が成り立つ。

証明.Zk=Xk−μZ_k=X_k-\mu、Rn=∑k=1nZk=Sn−nμR_n=\sum_{k=1}^nZ_k=S_n-n\muと置き、σ2=Var⁡(X1)<∞\sigma^2=\operatorname{Var}(X_1)<\inftyとする。各ZkZ_kは独立同分布で、平均00、分散σ2\sigma^2をもつ。

独立性による積の期待値の分解§E11.7 定理 3.1から、i≠ji\neq jならばE[ZiZj]=E[Zi]E[Zj]=0E[Z_iZ_j]=E[Z_i]E[Z_j]=0である。したがって、任意の正の整数nnに対して

Var⁡(Rn)=nσ2\operatorname{Var}(R_n)=n\sigma^2

が成り立つ。

正の整数rrを固定する。Chebyshev の不等式§E11.4 系 3.2により、

P ⁣(∣R2m∣>2mr)≤r2Var⁡(R2m)22m=r2σ22m.P\!\left(|R_{2^m}|>\frac{2^m}{r}\right) \leq\frac{r^2\operatorname{Var}(R_{2^m})}{2^{2m}} =\frac{r^2\sigma^2}{2^m}.

右辺はmmについて総和可能である。第一 Borel–Cantelli の補題§E11.13 定理 2.1により、確率11で、この不等式の左辺に現れる事象は有限回しか起こらない。すべての正の整数rrについて確率11の事象を交わすと、

R2m2m⟶0ほとんど確実に\frac{R_{2^m}}{2^m}\longrightarrow0 \qquad\text{ほとんど確実に}

となる。

次に、

Mm=max⁡2m<k≤2m+1∣Rk−R2m∣M_m=\max_{2^m<k\leq2^{m+1}}|R_k-R_{2^m}|

と置く。MmM_mは、独立な中心化確率変数Z2m+1,…,Z2m+1Z_{2^m+1},\ldots,Z_{2^{m+1}}の部分和の最大値である。定理 3.1をλ=2m/r\lambda=2^m/rとして適用すると、

P ⁣(Mm>2mr)≤r222m∑k=2m+12m+1Var⁡(Zk)=r2σ22m.P\!\left(M_m>\frac{2^m}{r}\right) \leq\frac{r^2}{2^{2m}}\sum_{k=2^m+1}^{2^{m+1}}\operatorname{Var}(Z_k) =\frac{r^2\sigma^2}{2^m}.

この右辺もmmについて総和可能である。第一 Borel–Cantelli の補題を各正の整数rrについて適用し、可算個の確率11の事象を交わすと、

Mm2m⟶0ほとんど確実に\frac{M_m}{2^m}\longrightarrow0 \qquad\text{ほとんど確実に}

を得る。

上の二つの極限が同時に成り立つ標本点を固定する。2m<n≤2m+12^m<n\leq2^{m+1}ならばn≥2mn\geq2^mであるため、

∣Rn∣n≤∣R2m∣+∣Rn−R2m∣2m≤∣R2m∣2m+Mm2m⟶0.\frac{|R_n|}{n} \leq\frac{|R_{2^m}|+|R_n-R_{2^m}|}{2^m} \leq\frac{|R_{2^m}|}{2^m}+\frac{M_m}{2^m} \longrightarrow0.

したがってRn/n→0R_n/n\to0がほとんど確実に成り立つ。Rn/n=Sn/n−μR_n/n=S_n/n-\muであるから、主張を得る。▨

5 具体例

例 5.1 (Bernoulli 標本平均).X1,X2,…X_1,X_2,\ldotsを独立同分布とし、各XkX_kが母数p∈[0,1]p\in[0,1]の Bernoulli 分布に従うとする。E[Xk]=pE[X_k]=p、E[Xk2]=p<∞E[X_k^2]=p<\inftyであるから、弱大数と強大数の両方を適用することができる。したがって、

1n∑k=1nXk⟶p\frac1n\sum_{k=1}^nX_k\longrightarrow p

がほとんど確実に成り立ち、したがって確率収束も成り立つ。左辺は最初のnn回の試行における値11の相対度数である。

6 演習

問題 6.1.

  1. X∈L1(P)X\in L^1(P)に対してnP(∣X∣>n)→0nP(|X|>n)\to0を示す証明で、可積分性を外すと結論が成り立たない例を一つ構成せよ。
  2. 定理 3.1の証明で、初回通過事象AkA_kを互いに素にする必要がある理由を、期待値の和に関して説明せよ。
  3. 強大数の法則の証明で2m2^mを3m3^mに置き換える場合について、部分列とブロック最大値の二つの確率評価を書き下し、同じ結論が得られることを証明せよ。
  4. X1,X2,…X_1,X_2,\ldotsが独立同分布でE[X12]<∞E[X_1^2]<\inftyを満たすとする。強大数の法則から弱大数の法則が従うことを、ほとんど確実な収束が確率収束を導くことを用いて示せ。

7 扱った範囲と次の記事

弱大数の法則は独立同分布かつL1L^1の実確率変数に対して証明した。強大数の法則は独立同分布かつL2L^2の場合に限定した。期待値の有限性だけを仮定する強大数の法則、Kolmogorov の三列定理、および非同分布な確率変数列に対する一般化は扱っていない。次の記事では、独立同分布で有限かつ正の分散をもつ確率変数の正規化された和について、特性関数を用いて中心極限定理を証明する。

参考文献

  1. Patrick Billingsley, Probability and Measure, Anniversary Edition, Wiley, 2012, originally published 1995.切断による弱大数の法則と強大数の法則の証明を参考にした。
  2. Olav Kallenberg, Foundations of Modern Probability, 3rd ed., Probability Theory and Stochastic Modelling, Springer, Cham, 2021.Kolmogorov の最大不等式と大数の法則の定式化を参考にした。

前提記事