1 最尤法
定義 1.1. d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とし、Θ ⊆ R d \Theta\subseteq\R^d Θ ⊆ R d を Borel 集合、( X , A ) (\mathcal X,\mathcal A) ( X , A ) を標本空間とする。各観測値x ∈ X x\in\mathcal X x ∈ X に対する尤度関数L x : Θ → [ 0 , ∞ ) L_x:\Theta\to[0,\infty) L x : Θ → [ 0 , ∞ ) を考える。独立同分布標本について選択した積密度から定まる尤度と対数尤度は§E14.4 注意 1.4 が与える。
M ( x ) = arg max θ ∈ Θ L x ( θ ) = { θ ∈ Θ | L x ( θ ) = sup ϑ ∈ Θ L x ( ϑ ) } M(x)=\operatorname*{arg\,max}_{\theta\in\Theta}L_x(\theta)
=\left\{\theta\in\Theta\mathrel{\middle|}L_x(\theta)=\sup_{\vartheta\in\Theta}L_x(\vartheta)\right\} M ( x ) = θ ∈ Θ arg max L x ( θ ) = { θ ∈ Θ L x ( θ ) = ϑ ∈ Θ sup L x ( ϑ ) } とおく。可測集合X 0 ∈ A \mathcal X_0\in\mathcal A X 0 ∈ A と可測写像θ ^ M L : X → Θ \widehat\theta_{\mathrm{ML}}:\mathcal X\to\Theta θ ML : X → Θ が存在し、すべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ についてP θ ( X ∈ X 0 ) = 1 P_\theta(X\in\mathcal X_0)=1 P θ ( X ∈ X 0 ) = 1 であり、
θ ^ M L ( x ) ∈ M ( x ) \widehat\theta_{\mathrm{ML}}(x)\in M(x) θ ML ( x ) ∈ M ( x ) をすべてのx ∈ X 0 x\in\mathcal X_0 x ∈ X 0 について満たすとき、θ ^ M L ( X ) \widehat\theta_{\mathrm{ML}}(X) θ ML ( X ) を 最尤推定量 (maximum likelihood estimator ) (MLE)という。X 0 \mathcal X_0 X 0 の外側ではθ ^ M L \widehat\theta_{\mathrm{ML}} θ ML の値を任意に定めてよい。最大点が複数ある場合には、最尤推定量は最大化集合から選んだ可測な選択である。
命題 1.3. Θ ⊆ R \Theta\subseteq\R Θ ⊆ R を区間とし、観測値x x x を固定する。L x ( θ ^ ) > 0 L_x(\widehat\theta)>0 L x ( θ ) > 0 であり、対数尤度ℓ x = log L x \ell_x=\log L_x ℓ x = log L x が内点θ ^ ∈ Θ \widehat\theta\in\Theta θ ∈ Θ の近傍で微分可能であるとする。θ ^ \widehat\theta θ がL x L_x L x の最大点ならば、
ℓ x ′ ( θ ^ ) = 0 \ell_x'(\widehat\theta)=0 ℓ x ′ ( θ ) = 0 である。
証明. θ ^ \widehat\theta θ はℓ x \ell_x ℓ x の内点最大点でもある。十分小さいh > 0 h>0 h > 0 に対して
ℓ x ( θ ^ + h ) − ℓ x ( θ ^ ) h ≤ 0 , ℓ x ( θ ^ − h ) − ℓ x ( θ ^ ) − h ≥ 0 \frac{\ell_x(\widehat\theta+h)-\ell_x(\widehat\theta)}{h}\leq0,
\qquad
\frac{\ell_x(\widehat\theta-h)-\ell_x(\widehat\theta)}{-h}\geq0 h ℓ x ( θ + h ) − ℓ x ( θ ) ≤ 0 , − h ℓ x ( θ − h ) − ℓ x ( θ ) ≥ 0 である。h ↓ 0 h\downarrow0 h ↓ 0 とすると、微分可能性によりℓ x ′ ( θ ^ ) ≤ 0 \ell_x'(\widehat\theta)\leq0 ℓ x ′ ( θ ) ≤ 0 かつℓ x ′ ( θ ^ ) ≥ 0 \ell_x'(\widehat\theta)\geq0 ℓ x ′ ( θ ) ≥ 0 を得る。▨
命題 1.5. H ⊆ R k H\subseteq\R^k H ⊆ R k を Borel 集合とし、g : Θ → H g:\Theta\to H g : Θ → H を全単射とする。g g g とg − 1 g^{-1} g − 1 はともに Borel 可測であると仮定する。η = g ( θ ) \eta=g(\theta) η = g ( θ ) による再パラメータ化の尤度を
L x ( g ) ( η ) = L x ( g − 1 ( η ) ) L_x^{(g)}(\eta)=L_x(g^{-1}(\eta)) L x ( g ) ( η ) = L x ( g − 1 ( η )) と定める。このとき、すべてのx ∈ X x\in\mathcal X x ∈ X について
arg max η ∈ H L x ( g ) ( η ) = g ( arg max θ ∈ Θ L x ( θ ) ) \operatorname*{arg\,max}_{\eta\in H}L_x^{(g)}(\eta)
=g\!\left(\operatorname*{arg\,max}_{\theta\in\Theta}L_x(\theta)\right) η ∈ H arg max L x ( g ) ( η ) = g ( θ ∈ Θ arg max L x ( θ ) ) が成り立つ。特に、θ ^ M L \widehat\theta_{\mathrm{ML}} θ ML が最尤推定量ならば、g ∘ θ ^ M L g\circ\widehat\theta_{\mathrm{ML}} g ∘ θ ML はη \eta η の最尤推定量である。
証明. η ∈ H \eta\in H η ∈ H に対してη = g ( θ ) \eta=g(\theta) η = g ( θ ) を満たすθ ∈ Θ \theta\in\Theta θ ∈ Θ はただ一つ存在し、L x ( g ) ( η ) = L x ( θ ) L_x^{(g)}(\eta)=L_x(\theta) L x ( g ) ( η ) = L x ( θ ) である。したがって、η \eta η が左辺の最大化集合に属することと、g − 1 ( η ) g^{-1}(\eta) g − 1 ( η ) がL x L_x L x の最大化集合に属することは同値である。これにより最大化集合の等式を得る。g g g とθ ^ M L \widehat\theta_{\mathrm{ML}} θ ML は可測であるから、その合成も可測である。▨
例 1.6. n ∈ N ≥ 1 n\in\NN n ∈ N ≥ 1 とし、X 1 , … , X n X_1,\ldots,X_n X 1 , … , X n をN ( 0 , v ) N(0,v) N ( 0 , v ) (§E11.5 定義 2.4 )からの独立同分布な標本とし、v ∈ ( 0 , ∞ ) v\in(0,\infty) v ∈ ( 0 , ∞ ) とする。観測値x = ( x 1 , … , x n ) x=(x_1,\ldots,x_n) x = ( x 1 , … , x n ) に対してQ = ∑ i = 1 n x i 2 > 0 Q=\sum_{i=1}^n x_i^2>0 Q = ∑ i = 1 n x i 2 > 0 ならば、v v v に依存しない正の因子を除いた尤度は
L x ( v ) = v − n / 2 exp ( − Q 2 v ) L_x(v)=v^{-n/2}\exp\!\left(-\frac{Q}{2v}\right) L x ( v ) = v − n /2 exp ( − 2 v Q ) である。その対数の微分は
ℓ x ′ ( v ) = − n 2 v + Q 2 v 2 = Q − n v 2 v 2 \ell_x'(v)=-\frac{n}{2v}+\frac{Q}{2v^2}=\frac{Q-nv}{2v^2} ℓ x ′ ( v ) = − 2 v n + 2 v 2 Q = 2 v 2 Q − n v であるから、尤度は0 < v < Q / n 0<v<Q/n 0 < v < Q / n で増加し、v > Q / n v>Q/n v > Q / n で減少する。したがって
v ^ M L = 1 n ∑ i = 1 n X i 2 \widehat v_{\mathrm{ML}}=\frac1n\sum_{i=1}^nX_i^2 v ML = n 1 i = 1 ∑ n X i 2 がQ > 0 Q>0 Q > 0 における一意な最大点である。各v > 0 v>0 v > 0 についてP v ( Q = 0 ) = 0 P_v(Q=0)=0 P v ( Q = 0 ) = 0 であるから、Q = 0 Q=0 Q = 0 で( 0 , ∞ ) (0,\infty) ( 0 , ∞ ) 内の値を任意に補えば最尤推定量を得る。標準偏差σ = v \sigma=\sqrt v σ = v はv ∈ ( 0 , ∞ ) v\in(0,\infty) v ∈ ( 0 , ∞ ) 上の全単射な再パラメータ化であるため、命題 1.5 により、Q > 0 Q>0 Q > 0 では
σ ^ M L = v ^ M L = ( 1 n ∑ i = 1 n X i 2 ) 1 / 2 \widehat\sigma_{\mathrm{ML}}=\sqrt{\widehat v_{\mathrm{ML}}}
=\left(\frac1n\sum_{i=1}^nX_i^2\right)^{1/2} σ ML = v ML = ( n 1 i = 1 ∑ n X i 2 ) 1/2 となる。Q = 0 Q=0 Q = 0 ではv ↓ 0 v\downarrow0 v ↓ 0 のときL x ( v ) L_x(v) L x ( v ) が上に有界でなく、v ∈ ( 0 , ∞ ) v\in(0,\infty) v ∈ ( 0 , ∞ ) に最大点は存在しない。
命題 1.7. n ≥ 2 n\geq2 n ≥ 2 とし、X 1 , … , X n X_1,\ldots,X_n X 1 , … , X n をN ( μ , v ) N(\mu,v) N ( μ , v ) からの独立同分布標本とする。ただし、母数空間をR × ( 0 , ∞ ) \R\times(0,\infty) R × ( 0 , ∞ ) とする。さらに
X ‾ = 1 n ∑ i = 1 n X i , Q = ∑ i = 1 n ( X i − X ‾ ) 2 \overline X=\frac1n\sum_{i=1}^nX_i,
\qquad
Q=\sum_{i=1}^n(X_i-\overline X)^2 X = n 1 i = 1 ∑ n X i , Q = i = 1 ∑ n ( X i − X ) 2 と置く。Q > 0 Q>0 Q > 0 では尤度の一意な最大点は
( μ ^ M L , v ^ M L ) = ( X ‾ , Q n ) (\widehat\mu_{\mathrm{ML}},\widehat v_{\mathrm{ML}})
=\left(\overline X,\frac Qn\right) ( μ ML , v ML ) = ( X , n Q ) である。Q = 0 Q=0 Q = 0 では尤度は上に有界でなく、最大点は存在しない。したがって、Q = 0 Q=0 Q = 0 における値を( X ‾ , 1 ) (\overline X,1) ( X , 1 ) と定めれば、得られる可測写像はすべての( μ , v ) ∈ R × ( 0 , ∞ ) (\mu,v)\in\R\times(0,\infty) ( μ , v ) ∈ R × ( 0 , ∞ ) の下でほとんど確実に尤度を最大化する最尤推定量である。
証明. 観測値x = ( x 1 , … , x n ) x=(x_1,\ldots,x_n) x = ( x 1 , … , x n ) に対して、x ‾ = n − 1 ∑ i x i \overline x=n^{-1}\sum_i x_i x = n − 1 ∑ i x i およびQ x = ∑ i ( x i − x ‾ ) 2 Q_x=\sum_i(x_i-\overline x)^2 Q x = ∑ i ( x i − x ) 2 と置く。任意のa ∈ R a\in\R a ∈ R について
∑ i = 1 n ( x i − a ) 2 = Q x + n ( a − x ‾ ) 2 \sum_{i=1}^n(x_i-a)^2
=Q_x+n(a-\overline x)^2 i = 1 ∑ n ( x i − a ) 2 = Q x + n ( a − x ) 2 である。したがって、固定したw > 0 w>0 w > 0 に対する尤度
L x ( a , w ) = ( 2 π w ) − n / 2 exp [ − Q x + n ( a − x ‾ ) 2 2 w ] L_x(a,w)=(2\pi w)^{-n/2}
\exp\!\left[-\frac{Q_x+n(a-\overline x)^2}{2w}\right] L x ( a , w ) = ( 2 π w ) − n /2 exp [ − 2 w Q x + n ( a − x ) 2 ] はa = x ‾ a=\overline x a = x で一意に最大となる。
a = x ‾ a=\overline x a = x に固定すると、w w w に依存する部分は
w − n / 2 exp ( − Q x 2 w ) w^{-n/2}\exp\!\left(-\frac{Q_x}{2w}\right) w − n /2 exp ( − 2 w Q x ) である。これは例 1.6 の分散方向の尤度と同じ形である。ゆえにQ x > 0 Q_x>0 Q x > 0 ではw = Q x / n w=Q_x/n w = Q x / n が一意な最大点であり、Q x = 0 Q_x=0 Q x = 0 ではw ↓ 0 w\downarrow0 w ↓ 0 のとき尤度が正の無限大へ発散する。
Q = 0 Q=0 Q = 0 はX 1 = ⋯ = X n X_1=\cdots=X_n X 1 = ⋯ = X n と同値である。( X 1 , X 2 ) (X_1,X_2) ( X 1 , X 2 ) は二次元 Lebesgue 測度に関する密度をもち、対角集合{ ( x , x ) ∣ x ∈ R } \{(x,x)\mid x\in\R\} {( x , x ) ∣ x ∈ R } の二次元 Lebesgue 測度は零である。したがって{ Q = 0 } ⊆ { X 1 = X 2 } \{Q=0\}\subseteq\{X_1=X_2\} { Q = 0 } ⊆ { X 1 = X 2 } はすべての( μ , v ) (\mu,v) ( μ , v ) の下で確率零である。X ‾ \overline X X とQ Q Q は可測であり、場合分けで定めた写像も可測であるから、定義 1.1 の条件を満たす。▨
命題 1.8. g : Θ → H = g ( Θ ) g:\Theta\to H=g(\Theta) g : Θ → H = g ( Θ ) を写像とし、観測値x x x に対するプロファイル尤度を
L x ∗ ( η ) = sup { L x ( θ ) ∣ θ ∈ Θ , g ( θ ) = η } ( η ∈ H ) L_x^*(\eta)=\sup\{L_x(\theta)\mid \theta\in\Theta,\ g(\theta)=\eta\}
\qquad(\eta\in H) L x ∗ ( η ) = sup { L x ( θ ) ∣ θ ∈ Θ , g ( θ ) = η } ( η ∈ H ) と定める。θ ^ ∈ Θ \widehat\theta\in\Theta θ ∈ Θ がL x L_x L x の最大点ならば、g ( θ ^ ) g(\widehat\theta) g ( θ ) はL x ∗ L_x^* L x ∗ の最大点である。さらに、θ ^ M L \widehat\theta_{\mathrm{ML}} θ ML が可測な最尤推定量であり、g g g が可測ならば、g ∘ θ ^ M L g\circ\widehat\theta_{\mathrm{ML}} g ∘ θ ML はプロファイル尤度を最大にする可測な推定量である。
証明. m = L x ( θ ^ ) m=L_x(\widehat\theta) m = L x ( θ ) とおく。θ ^ \widehat\theta θ は大域最大点であるから、すべてのη ∈ H \eta\in H η ∈ H とg ( θ ) = η g(\theta)=\eta g ( θ ) = η を満たす各θ \theta θ に対してL x ( θ ) ≤ m L_x(\theta)\leq m L x ( θ ) ≤ m である。したがってL x ∗ ( η ) ≤ m L_x^*(\eta)\leq m L x ∗ ( η ) ≤ m である。一方、θ ^ \widehat\theta θ はg ( θ ^ ) g(\widehat\theta) g ( θ ) の繊維に属するため、
L x ∗ ( g ( θ ^ ) ) ≥ L x ( θ ^ ) = m L_x^*(g(\widehat\theta))\geq L_x(\widehat\theta)=m L x ∗ ( g ( θ )) ≥ L x ( θ ) = m である。ゆえにL x ∗ ( g ( θ ^ ) ) = m L_x^*(g(\widehat\theta))=m L x ∗ ( g ( θ )) = m であり、g ( θ ^ ) g(\widehat\theta) g ( θ ) は最大点である。最後の主張はg ∘ θ ^ M L g\circ\widehat\theta_{\mathrm{ML}} g ∘ θ ML の可測性から従う。▨
例 1.10. 一つの観測値x ∈ R x\in\R x ∈ R に対し、Θ = R \Theta=\R Θ = R 上の尤度が、正の定数因子を除いて
L x ( θ ) = exp ( − ( x − θ ) 2 ) L_x(\theta)=\exp(-(x-\theta)^2) L x ( θ ) = exp ( − ( x − θ ) 2 ) である正規位置模型を考える。写像g ( θ ) = θ 2 g(\theta)=\theta^2 g ( θ ) = θ 2 はR \R R から[ 0 , ∞ ) [0,\infty) [ 0 , ∞ ) への全射であるが単射ではない。η ≥ 0 \eta\geq0 η ≥ 0 に対して
L x ∗ ( η ) = max { e − ( x − η ) 2 , e − ( x + η ) 2 } = exp ( − ( ∣ x ∣ − η ) 2 ) L_x^*(\eta)
=\max\{e^{-(x-\sqrt\eta)^2},e^{-(x+\sqrt\eta)^2}\}
=\exp\!\left(-(|x|-\sqrt\eta)^2\right) L x ∗ ( η ) = max { e − ( x − η ) 2 , e − ( x + η ) 2 } = exp ( − ( ∣ x ∣ − η ) 2 ) である。元の尤度の一意な最大点はθ ^ = x \widehat\theta=x θ = x であり、プロファイル尤度の一意な最大点はη ^ = x 2 = g ( θ ^ ) \widehat\eta=x^2=g(\widehat\theta) η = x 2 = g ( θ ) である。
2 存在、一意性、識別可能性
例 2.1. 母数空間をΘ = { − 1 , 1 } \Theta=\{-1,1\} Θ = { − 1 , 1 } 、標本空間を{ 0 , 1 , 2 } \{0,1,2\} { 0 , 1 , 2 } とし、
P − 1 ( 0 ) = P 1 ( 0 ) = 1 2 , P − 1 ( 2 ) = P 1 ( 1 ) = 1 2 P_{-1}(0)=P_{1}(0)=\frac12,
\qquad
P_{-1}(2)=P_{1}(1)=\frac12 P − 1 ( 0 ) = P 1 ( 0 ) = 2 1 , P − 1 ( 2 ) = P 1 ( 1 ) = 2 1 と定め、残りの確率を0 0 0 とする。P − 1 ≠ P 1 P_{-1}\neq P_1 P − 1 = P 1 であるから、この統計モデルは識別可能である。しかしX = 0 X=0 X = 0 を観測するとL 0 ( − 1 ) = L 0 ( 1 ) = 1 / 2 L_0(-1)=L_0(1)=1/2 L 0 ( − 1 ) = L 0 ( 1 ) = 1/2 となり、最大点は二つある。したがって、識別可能性は個々の有限標本について尤度の最大点が一意であることを保証しない。
また、n ∈ N ≥ 1 n\in\NN n ∈ N ≥ 1 とし、X 1 , … , X n X_1,\ldots,X_n X 1 , … , X n をPois ( λ ) \operatorname{Pois}(\lambda) Pois ( λ ) (§E11.5 定義 1.4 )からの独立同分布な標本とし、λ ∈ ( 0 , ∞ ) \lambda\in(0,\infty) λ ∈ ( 0 , ∞ ) とする。この模型は識別可能である。すべての観測値が0 0 0 ならば、尤度はL ( λ ) = e − n λ L(\lambda)=e^{-n\lambda} L ( λ ) = e − nλ であり、上限1 1 1 はλ ∈ ( 0 , ∞ ) \lambda\in(0,\infty) λ ∈ ( 0 , ∞ ) で達成されない。したがって、識別可能性は最尤推定量の存在も保証しない。
3 モーメント法
定義 3.1. d , n ∈ N ≥ 1 d,n\in\NN d , n ∈ N ≥ 1 とし、Θ ⊆ R d \Theta\subseteq\R^d Θ ⊆ R d とS ⊆ R \mathcal S\subseteq\R S ⊆ R を Borel 集合とする。X 1 , … , X n X_1,\ldots,X_n X 1 , … , X n を同一の分布に従うS \mathcal S S 値確率変数とする。各θ ∈ Θ \theta\in\Theta θ ∈ Θ についてE θ [ ∣ X 1 ∣ j ] < ∞ E_\theta[|X_1|^j]<\infty E θ [ ∣ X 1 ∣ j ] < ∞ (j = 1 , … , d j=1,\ldots,d j = 1 , … , d )と仮定し、
μ ( θ ) = ( E θ [ X 1 ] , … , E θ [ X 1 d ] ) , M n = ( 1 n ∑ i = 1 n X i , … , 1 n ∑ i = 1 n X i d ) \mu(\theta)=\bigl(E_\theta[X_1],\ldots,E_\theta[X_1^d]\bigr),
\qquad
M_n=\left(\frac1n\sum_{i=1}^nX_i,\ldots,\frac1n\sum_{i=1}^nX_i^d\right) μ ( θ ) = ( E θ [ X 1 ] , … , E θ [ X 1 d ] ) , M n = ( n 1 i = 1 ∑ n X i , … , n 1 i = 1 ∑ n X i d ) とおく。可測写像θ ^ n : S n → Θ \widehat\theta_n:\mathcal S^n\to\Theta θ n : S n → Θ がモーメント方程式
μ ( θ ^ n ( x 1 , … , x n ) ) = M n ( x 1 , … , x n ) \mu(\widehat\theta_n(x_1,\ldots,x_n))=M_n(x_1,\ldots,x_n) μ ( θ n ( x 1 , … , x n )) = M n ( x 1 , … , x n ) をすべての標本点について満たすとき、θ ^ n \widehat\theta_n θ n を モーメント法推定量 (method of moments estimator ) という。方程式に解が存在しない標本点がある場合には、この定義によるモーメント法推定量は存在しない。解が複数ある場合には、解の集合から可測な選択を別に定める必要がある。
命題 3.2. d ∈ N ≥ 1 d\in\NN d ∈ N ≥ 1 とし、S ⊆ R \mathcal S\subseteq\R S ⊆ R を Borel 集合とする。X 1 , X 2 , … X_1,X_2,\ldots X 1 , X 2 , … を母数θ 0 ∈ Θ ⊆ R d \theta_0\in\Theta\subseteq\R^d θ 0 ∈ Θ ⊆ R d の下で独立同分布なS \mathcal S S 値確率変数列とする。E θ 0 [ ∣ X 1 ∣ j ] < ∞ E_{\theta_0}[|X_1|^j]<\infty E θ 0 [ ∣ X 1 ∣ j ] < ∞ (j = 1 , … , d j=1,\ldots,d j = 1 , … , d )と仮定する。D ⊆ R d D\subseteq\R^d D ⊆ R d と Borel 可測写像ψ : D → Θ \psi:D\to\Theta ψ : D → Θ が存在し、すべてのn n n についてM n ( S n ) ⊆ D M_n(\mathcal S^n)\subseteq D M n ( S n ) ⊆ D であり、
μ ( ψ ( M n ) ) = M n \mu(\psi(M_n))=M_n μ ( ψ ( M n )) = M n を満たすと仮定する。さらにμ ( θ 0 ) ∈ D \mu(\theta_0)\in D μ ( θ 0 ) ∈ D 、ψ ( μ ( θ 0 ) ) = θ 0 \psi(\mu(\theta_0))=\theta_0 ψ ( μ ( θ 0 )) = θ 0 とし、ψ \psi ψ がμ ( θ 0 ) \mu(\theta_0) μ ( θ 0 ) においてD D D 上連続であるとする。このとき、モーメント法推定量θ ^ n = ψ ( M n ) \widehat\theta_n=\psi(M_n) θ n = ψ ( M n ) はθ 0 \theta_0 θ 0 に確率収束する。
証明. 各j = 1 , … , d j=1,\ldots,d j = 1 , … , d に対してY i ( j ) = X i j Y_i^{(j)}=X_i^j Y i ( j ) = X i j とおく。仮定からE θ 0 [ ∣ Y 1 ( j ) ∣ ] < ∞ E_{\theta_0}[|Y_1^{(j)}|]<\infty E θ 0 [ ∣ Y 1 ( j ) ∣ ] < ∞ であるため、§E11.15 定理 2.1 により
1 n ∑ i = 1 n X i j → P E θ 0 [ X 1 j ] \frac1n\sum_{i=1}^nX_i^j\xrightarrow{P}E_{\theta_0}[X_1^j] n 1 i = 1 ∑ n X i j P E θ 0 [ X 1 j ] である。各座標の確率収束と§E11.17 命題 5.2 から、M n → P μ ( θ 0 ) M_n\xrightarrow{P}\mu(\theta_0) M n P μ ( θ 0 ) を得る。
任意のε > 0 \varepsilon>0 ε > 0 をとる。ψ \psi ψ はμ ( θ 0 ) \mu(\theta_0) μ ( θ 0 ) においてD D D 上連続であるから、あるδ > 0 \delta>0 δ > 0 が存在し、m ∈ D m\in D m ∈ D と∥ m − μ ( θ 0 ) ∥ < δ \|m-\mu(\theta_0)\|<\delta ∥ m − μ ( θ 0 ) ∥ < δ から∥ ψ ( m ) − θ 0 ∥ < ε \|\psi(m)-\theta_0\|<\varepsilon ∥ ψ ( m ) − θ 0 ∥ < ε が従う。したがって
P θ 0 ( ∥ θ ^ n − θ 0 ∥ ≥ ε ) ≤ P θ 0 ( ∥ M n − μ ( θ 0 ) ∥ ≥ δ ) ⟶ 0 P_{\theta_0}(\|\widehat\theta_n-\theta_0\|\geq\varepsilon)
\leq P_{\theta_0}(\|M_n-\mu(\theta_0)\|\geq\delta)
\longrightarrow0 P θ 0 ( ∥ θ n − θ 0 ∥ ≥ ε ) ≤ P θ 0 ( ∥ M n − μ ( θ 0 ) ∥ ≥ δ ) ⟶ 0 である。▨
例 3.4. n ∈ N ≥ 1 n\in\NN n ∈ N ≥ 1 とし、X 1 , … , X n X_1,\ldots,X_n X 1 , … , X n をBern ( p ) \operatorname{Bern}(p) Bern ( p ) (§E11.5 定義 1.2 )からの独立同分布標本とし、p ∈ [ 0 , 1 ] p\in[0,1] p ∈ [ 0 , 1 ] とする。S = ∑ i = 1 n X i S=\sum_{i=1}^nX_i S = ∑ i = 1 n X i と置くと、観測値に対する尤度は
L ( p ) = p S ( 1 − p ) n − S L(p)=p^S(1-p)^{n-S} L ( p ) = p S ( 1 − p ) n − S である。0 < S < n 0<S<n 0 < S < n のとき、
ℓ ′ ( p ) = S p − n − S 1 − p = S − n p p ( 1 − p ) \ell'(p)=\frac{S}{p}-\frac{n-S}{1-p}
=\frac{S-np}{p(1-p)} ℓ ′ ( p ) = p S − 1 − p n − S = p ( 1 − p ) S − n p であるから、L L L はp < S / n p<S/n p < S / n で増加し、p > S / n p>S/n p > S / n で減少する。S = 0 S=0 S = 0 のときはL ( p ) = ( 1 − p ) n L(p)=(1-p)^n L ( p ) = ( 1 − p ) n 、S = n S=n S = n のときはL ( p ) = p n L(p)=p^n L ( p ) = p n である。したがって、すべての標本点で最大値は存在して一意であり、
p ^ M L = S n = X ‾ n \widehat p_{\mathrm{ML}}=\frac Sn=\overline X_n p ML = n S = X n である。この写像は可測である。
E p [ X 1 ] = p E_p[X_1]=p E p [ X 1 ] = p であるから、一階のモーメント方程式もp = X ‾ n p=\overline X_n p = X n となる。したがってX ‾ n \overline X_n X n はモーメント法推定量でもある。ここでS = { 0 , 1 } \mathcal S=\{0,1\} S = { 0 , 1 } 、D = [ 0 , 1 ] D=[0,1] D = [ 0 , 1 ] 、ψ ( m ) = m \psi(m)=m ψ ( m ) = m とすれば、標本モーメントの像はD D D に含まれ、命題 3.2 の条件を満たす。ゆえに各p ∈ [ 0 , 1 ] p\in[0,1] p ∈ [ 0 , 1 ] についてX ‾ n \overline X_n X n はp p p の一致推定量である。