§E14.13最尤推定量の漸近理論

最終更新

平均ベクトルが未知で共分散行列が単位行列である正規分布から独立同分布標本を得た場合、標本平均は唯一の大域最尤推定量であり、その誤差を標本サイズの平方根倍すると正規分布に従う。さらに、平均ベクトルの二乗ノルムを推定すると、零でない平均では通常の正規極限が得られる一方、平均が零ならば一次の変化が消え、同じ倍率で拡大した誤差の極限分布は原点に集中する。一般のモデルで、尤度の局所的な変化から最尤推定量とその関数の大標本分布をどのように定めるかが問題となる。

一致する尤度方程式解は、局所的な正則性の下で、逆 Fisher 情報行列を共分散とする正規極限をもつ。デルタ法はこの極限を滑らかな母数関数へ移し、観測情報または期待情報は漸近標準誤差を推定する基準を与える。大域最尤推定量について同じ結論を得るには、大域最大点の存在と一致性が別に必要である。

漸近正規性は、有限標本の分布を直接求めることが難しいモデルで、最尤推定量の精度を評価するための最も基本的な近似の一つである。

本記事では、最尤推定量の漸近分布と、母数関数および標準誤差への応用を扱う。

1 局所正則性と観測情報

定義 1.1 (局所 Cramér 条件).p∈N≥1p\in\NN、Θ⊆Rp\Theta\subseteq\R^pを空でない開集合とし、可測空間(X,A)(\mathcal X,\mathcal A)上のシグマ有限測度μ\muに関する密度族(pθ)θ∈Θ(p_\theta)_{\theta\in\Theta}を考える。共通の可測集合SS上で0<pθ(x)<∞0<p_\theta(x)<\infty、SSの外でpθ(x)=0p_\theta(x)=0とする。θ0∈Θ\theta_0\in\Thetaにおいて次を満たすことを、θ0\theta_0における局所 Cramér 条件 (local Cramér conditions) という。

  1. あるρ0>0\rho_0>0についてB‾(θ0,ρ0)⊆Θ\overline B(\theta_0,\rho_0)\subseteq\Thetaであり、各x∈Sx\in Sに対してℓ(x,θ)=log⁡pθ(x)\ell(x,\theta)=\log p_\theta(x)はこの閉球の開近傍でC3C^3級である。密度と各母数微分は観測xxに関して可測な版を用いる。
  2. s(x)=∇θℓ(x,θ0)s(x)=\nabla_\theta\ell(x,\theta_0)はEθ0∥s(X)∥2<∞E_{\theta_0}\|s(X)\|^2<\inftyを満たし、I0=Eθ0[s(X)s(X)⊤]I_0=E_{\theta_0}[s(X)s(X)^\top]は正定値である。各j,kj,kに対して∂jkℓ(X,θ0)\partial_{jk}\ell(X,\theta_0)はPθ0P_{\theta_0}可積分である。また、∂jpθ0\partial_jp_{\theta_0}と∂jkpθ0\partial_{jk}p_{\theta_0}はμ\mu可積分であり、真値において微分と積分を交換することができる。すなわち、 ∫S∂jpθ0 dμ=∂j∫Spθ dμ∣θ=θ0=0,∫S∂jkpθ0 dμ=∂jk∫Spθ dμ∣θ=θ0=0\int_S\partial_jp_{\theta_0}\,d\mu =\left.\partial_j\int_Sp_\theta\,d\mu\right|_{\theta=\theta_0}=0, \qquad \int_S\partial_{jk}p_{\theta_0}\,d\mu =\left.\partial_{jk}\int_Sp_\theta\,d\mu\right|_{\theta=\theta_0}=0 が成り立つ。
  3. ある非負可測関数MMがEθ0M(X)<∞E_{\theta_0}M(X)<\inftyを満たし、すべてのx∈Sx\in S、θ∈B‾(θ0,ρ0)\theta\in\overline B(\theta_0,\rho_0)とj,k,l∈{1,…,p}j,k,l\in\{1,\ldots,p\}に対して ∣∂jklℓ(x,θ)∣≤M(x)|\partial_{jkl}\ell(x,\theta)|\leq M(x) が成り立つ。

定義 1.2 (観測情報行列).Θ⊆Rp\Theta\subseteq\R^pを開集合とし、共通正台をもつ密度族pθp_\thetaと標本X1,…,XnX_1,\ldots,X_nを考える。対数密度が母数について二回微分可能な領域では、対数尤度、標本の score ベクトル、および1観測当たりの観測情報行列 (observed information matrix) をそれぞれ

ℓn(θ)=∑i=1nlog⁡pθ(Xi),Un(θ)=∇ℓn(θ),Jn(θ)=−1n∇2ℓn(θ)\ell_n(\theta)=\sum_{i=1}^n\log p_\theta(X_i),\qquad U_n(\theta)=\nabla\ell_n(\theta),\qquad J_n(\theta)=-\frac1n\nabla^2\ell_n(\theta)

と定める。方程式Un(θ)=0U_n(\theta)=0を尤度方程式 (likelihood equation) という。

補題 1.3. 密度族(pθ)θ∈Θ(p_\theta)_{\theta\in\Theta}がθ0\theta_0における局所 Cramér 条件を満たし、X1,X2,…X_1,X_2,\ldotsがPθ0P_{\theta_0}に従う独立同分布列であるとする。条件に現れる半径と優関数をρ0,M\rho_0,Mとし、

M‾n=1n∑i=1nM(Xi),Δn=Un(θ0)n\overline M_n=\frac1n\sum_{i=1}^nM(X_i),\qquad \Delta_n=\frac{U_n(\theta_0)}{\sqrt n}

とおく。行列のノルムには Euclid ノルムに関する作用素ノルムを用いる。このとき次が成り立つ。

  1. Jn(θ0)→PI0J_n(\theta_0)\xrightarrow{P}I_0、M‾n→PEθ0M(X)\overline M_n\xrightarrow{P}E_{\theta_0}M(X)およびΔn⇒Np(0,I0)\Delta_n\Rightarrow N_p(0,I_0)である。
  2. ∥h∥≤ρ0\|h\|\leq\rho_0に対して ∥Jn(θ0+h)−I0∥op≤∥Jn(θ0)−I0∥op+p3/2∥h∥M‾n.\|J_n(\theta_0+h)-I_0\|_{\mathrm{op}} \leq\|J_n(\theta_0)-I_0\|_{\mathrm{op}} +p^{3/2}\|h\|\overline M_n. 特に、あるρ∈(0,ρ0]\rho\in(0,\rho_0]と定数0<c≤C<∞0<c\leq C<\inftyが存在して、 Pθ0(cIp⪯Jn(t)⪯CIp がすべての t∈B‾(θ0,ρ) で成立する)⟶1.P_{\theta_0}\bigl(cI_p\preceq J_n(t)\preceq CI_p \text{ がすべての }t\in\overline B(\theta_0,\rho)\text{ で成立する}\bigr) \longrightarrow1. ここでIpI_pは単位行列であり、A⪯BA\preceq BはB−AB-Aが半正定値であることを表す。
  3. Θ\Theta値の可測な推定量TnT_nがTn→Pθ0θ0T_n\xrightarrow{P_{\theta_0}}\theta_0を満たすとする。このとき sup⁡0≤t≤1∥Jn(θ0+t(Tn−θ0))−I0∥op→Pθ00.\sup_{0\leq t\leq1} \|J_n(\theta_0+t(T_n-\theta_0))-I_0\|_{\mathrm{op}} \xrightarrow{P_{\theta_0}}0. TnT_nがB‾(θ0,ρ0)\overline B(\theta_0,\rho_0)の外にある標本では、表示式の確率変数を00と定める。特にJn(Tn)→Pθ0I0J_n(T_n)\xrightarrow{P_{\theta_0}}I_0であり、局所領域の外ではJn(Tn)J_n(T_n)を任意の固定行列に補完してよい。

証明. 各 Hessian 成分に線分上の微積分の基本定理を適用する。∥h∥≤ρ0\|h\|\leq\rho_0のとき、

∣∂jkℓ(x,θ0+h)−∂jkℓ(x,θ0)∣≤∑l=1p∣hl∣M(x)≤p∥h∥M(x).|\partial_{jk}\ell(x,\theta_0+h)-\partial_{jk}\ell(x,\theta_0)| \leq\sum_{l=1}^p|h_l|M(x) \leq\sqrt p\|h\|M(x).

標本平均を取り、行列の作用素ノルムが各成分の絶対値の最大値のpp倍以下であることを用いると、(2)の不等式を得る。

score の平均と情報等式§E14.12 命題 1.2、§E14.12 命題 1.4の積分計算は、真値における交換条件から

Eθ0sj(X)=∫S∂jpθ0 dμ=0,Eθ0∂jkℓ(X,θ0)=∫S∂jkpθ0 dμ−(I0)jk=−(I0)jkE_{\theta_0}s_j(X)=\int_S\partial_jp_{\theta_0}\,d\mu=0, \qquad E_{\theta_0}\partial_{jk}\ell(X,\theta_0) =\int_S\partial_{jk}p_{\theta_0}\,d\mu-(I_0)_{jk} =-(I_0)_{jk}

を与える。Hessian の各成分とM(Xi)M(X_i)に弱大数の法則§E14.2 定理 4.1を、s(Xi)s(X_i)に多変量中心極限定理§E11.17 定理 4.3を適用すると、(1)が従う。

単位球面のコンパクト性§E2.9 定理 4.3と極値定理§E4.1 定理 5.1により、

λ=min⁡∥v∥=1v⊤I0v>0\lambda=\min_{\|v\|=1}v^\top I_0v>0

である。b=Eθ0M(X)+1b=E_{\theta_0}M(X)+1とおき、p3/2ρb≤λ/4p^{3/2}\rho b\leq\lambda/4となるρ∈(0,ρ0]\rho\in(0,\rho_0]を取る。事象

∥Jn(θ0)−I0∥op<λ/4,M‾n≤b\|J_n(\theta_0)-I_0\|_{\mathrm{op}}<\lambda/4,\qquad \overline M_n\leq b

の確率は1へ収束する。この事象上で、半径ρ\rhoの閉球のすべての点において

λ2Ip⪯Jn(t)⪯(∥I0∥op+λ2)Ip\frac\lambda2I_p\preceq J_n(t) \preceq\left(\|I_0\|_{\mathrm{op}}+\frac\lambda2\right)I_p

である。これで(2)の後半も得られた。

TnT_nが半径ρ0\rho_0の閉球に入る事象上では、(2)の不等式によって、(3)の上限は

∥Jn(θ0)−I0∥op+p3/2∥Tn−θ0∥M‾n\|J_n(\theta_0)-I_0\|_{\mathrm{op}} +p^{3/2}\|T_n-\theta_0\|\overline M_n

以下である。任意のε>0\varepsilon>0とK>0K>0に対して

Pθ0(∥Tn−θ0∥M‾n>ε)≤Pθ0(M‾n>K)+Pθ0(∥Tn−θ0∥>ε/K).P_{\theta_0}(\|T_n-\theta_0\|\overline M_n>\varepsilon) \leq P_{\theta_0}(\overline M_n>K) +P_{\theta_0}(\|T_n-\theta_0\|>\varepsilon/K).

先にK>Eθ0M(X)K>E_{\theta_0}M(X)を固定してn→∞n\to\inftyとすると右辺は00へ収束する。閉球の外に出る確率も00へ収束するから、結論を得る。▨

2 尤度方程式の一致解

命題 2.1. 密度族がθ0\theta_0における局所 Cramér 条件を満たし、標本がPθ0P_{\theta_0}に従う独立同分布列であるとする。このとき、あるρ>0\rho>0が存在し、任意の固定したε∈(0,ρ]\varepsilon\in(0,\rho]に対して

Pθ0(sup⁡∥h∥=εℓn(θ0+h)<ℓn(θ0))⟶1.P_{\theta_0}\left( \sup_{\|h\|=\varepsilon}\ell_n(\theta_0+h)<\ell_n(\theta_0) \right)\longrightarrow1.

さらに、確率が1へ収束する事象上で、B‾(θ0,ε)\overline B(\theta_0,\varepsilon)上の対数尤度は唯一の最大点をもち、その点は開球内にあって尤度方程式を満たす。この閉球内にほかの尤度方程式解は存在しない。

証明.補題 1.3 (2)のρ,c\rho,cを取り、ε∈(0,ρ]\varepsilon\in(0,\rho]を固定する。閉球でJn⪰cIpJ_n\succeq cI_pとなる事象上で、Taylor の積分剰余公式§E4.5 定理 1.1により

ℓn(θ0+h)−ℓn(θ0)n=Un(θ0)⊤hn−∫01(1−t)h⊤Jn(θ0+th)h dt≤∥Un(θ0)n∥ε−c2ε2\frac{\ell_n(\theta_0+h)-\ell_n(\theta_0)}n =\frac{U_n(\theta_0)^\top h}n -\int_0^1(1-t)h^\top J_n(\theta_0+th)h\,dt \leq\left\|\frac{U_n(\theta_0)}n\right\|\varepsilon -\frac c2\varepsilon^2

が球面上で成り立つ。補題 1.3 (1)からUn(θ0)/n→P0U_n(\theta_0)/n\xrightarrow{P}0であるため、最後の式は確率が1へ収束する事象上で負になる。

連続な対数尤度はコンパクトな閉球上で最大値を取る。球面の不等式によって最大点は内点にあるため、各座標方向の微分は00である。また、Jn⪰cIpJ_n\succeq cI_pならば対数尤度は閉球上で強凹であり、最大点は一意である。実際、相異なる2点を結ぶ線分上では二階微分が負である。二つの score 根z,wz,wが閉球にあれば、

0=(z−w)⊤{Un(z)−Un(w)}=−n∫01(z−w)⊤Jn(w+t(z−w))(z−w) dt≤−nc∥z−w∥20=(z-w)^\top\{U_n(z)-U_n(w)\} =-n\int_0^1(z-w)^\top J_n(w+t(z-w))(z-w)\,dt \leq-nc\|z-w\|^2

となり、z=wz=wである。▨

補題 2.2.Θ⊆Rp\Theta\subseteq\R^pを空でない開集合とし、(Pθ)θ∈Θ(P_\theta)_{\theta\in\Theta}を可測空間(X,A)(\mathcal X,\mathcal A)上の同じシグマ有限測度μ\muに支配された確率測度族とする。モデルが識別可能、すなわちPθ=PηP_\theta=P_\etaならばθ=η\theta=\etaであり、密度への写像θ↦pθ\theta\mapsto p_\thetaがL1(μ)L^1(\mu)で連続であると仮定する。このとき、モデルだけから定まる可測写像列Tn:Xn→ΘT_n:\mathcal X^n\to\Thetaが存在し、各固定θ∈Θ\theta\in\ThetaとPθP_\thetaに従う独立同分布標本に対して

Tn(X1,…,Xn)→PθθT_n(X_1,\ldots,X_n)\xrightarrow{P_\theta}\theta

が成り立つ。

証明. 証明は演習とする(問題 5.1)。▨

定理 2.3.Θ⊆Rp\Theta\subseteq\R^pを空でない開集合とし、(Pθ)θ∈Θ(P_\theta)_{\theta\in\Theta}を同じシグマ有限測度に関する共通正台SSをもつ識別可能な密度族とする。各x∈Sx\in Sに対してθ↦log⁡pθ(x)\theta\mapsto\log p_\theta(x)がΘ\Theta全体でC3C^3級であり、各θ∈Θ\theta\in\Thetaにおいて局所 Cramér 条件が成り立つと仮定する。このとき、未知の母数によらない単一の可測写像列θ^n:Xn→Θ\widehat\theta_n:\mathcal X^n\to\Thetaが存在し、各固定θ∈Θ\theta\in\ThetaとPθP_\thetaに従う独立同分布標本に対して

θ^n→Pθθ,Pθ(Un(θ^n)=0)⟶1\widehat\theta_n\xrightarrow{P_\theta}\theta,\qquad P_\theta\bigl(U_n(\widehat\theta_n)=0\bigr)\longrightarrow1

を満たす。

証明.θj→θ\theta_j\to\thetaに対して密度はSS上で点ごとに収束し、SSの外では00である。優収束定理§E9.7 定理 3.2をmin⁡(pθj,pθ)≤pθ\min(p_{\theta_j},p_\theta)\leq p_\thetaに適用すると、

∥pθj−pθ∥1=2−2∫min⁡(pθj,pθ) dμ⟶0.\|p_{\theta_j}-p_\theta\|_1 =2-2\int\min(p_{\theta_j},p_\theta)\,d\mu\longrightarrow0.

したがって補題 2.2による一致推定量列TnT_nを一つ固定する。

有理中心a∈Qpa\in\Q^pと正の有理半径rrでK=B‾(a,r)⊆ΘK=\overline B(a,r)\subseteq\Thetaとなる閉球、およびm∈N≥1m\in\NNの組を一列に並べる。標本がSnS^nに属するとき、組(K,m)(K,m)が次の三条件を満たすことを考える。

Tn∈B(a,r/2),Jn(t)⪰m−1Ip(t∈K),sup⁡t∈∂Kℓn(t)<ℓn(a).T_n\in B(a,r/2),\qquad J_n(t)\succeq m^{-1}I_p\quad(t\in K),\qquad \sup_{t\in\partial K}\ell_n(t)<\ell_n(a).

これらを満たす事象は可測である。Hessian 条件は、KKの固定した可算稠密集合とv∈Qpv\in\Q^pに対する不等式v⊤Jn(t)v≥m−1∥v∥2v^\top J_n(t)v\geq m^{-1}\|v\|^2の可算個の共通部分で表される。境界の上限は境界の固定した可算稠密集合上で取ってよい。両者には母数についての連続性を用いた。

この三条件の下では、極値定理と強凹性からℓn∣K\ell_n|_Kは唯一の最大点znz_nをもつ。境界の不等式によりznz_nは内点であり、Un(zn)=0U_n(z_n)=0である。この点は標本の可測関数である。実際、KKの固定した可算稠密列(qj)(q_j)を取り、bn=sup⁡jℓn(qj)b_n=\sup_j\ell_n(q_j)とおく。各k∈N≥1k\in\NNについてℓn(qj)>bn−1/k\ell_n(q_j)>b_n-1/kを満たす最初のqjq_jをzn,kz_{n,k}とする。各zn,kz_{n,k}は可測であり、Taylor の公式とUn(zn)=0U_n(z_n)=0から

n2m∥zn,k−zn∥2≤ℓn(zn)−ℓn(zn,k)<1/k.\frac{n}{2m}\|z_{n,k}-z_n\|^2 \leq\ell_n(z_n)-\ell_n(z_{n,k})<1/k.

よってzn,k→znz_{n,k}\to z_nであり、znz_nは可測である。三条件を満たさない標本では各選択を固定点θ∗∈Θ\theta_*\in\Thetaに補完すれば、全標本上の可測写像になる。

三条件を満たす最初の組の最大点をθ^n\widehat\theta_nと定め、該当する組がない場合と標本がSnS^nの外にある場合にはθ^n=θ∗\widehat\theta_n=\theta_*とする。この選択も可算個の可測な場合分けで定まり、定義に未知母数は含まれない。

θ0∈Θ\theta_0\in\Thetaを固定する。補題 1.3 (2)の閉球B‾(θ0,ρ)\overline B(\theta_0,\rho)と定数c,Cc,Cを取る。有理数r∈(0,ρ/2)r\in(0,\rho/2)と有理中心aaを

d:=∥a−θ0∥<min⁡{r4,rc16C}d:=\|a-\theta_0\|<\min\left\{\frac r4, r\sqrt{\frac{c}{16C}}\right\}

となるように固定し、m−1<cm^{-1}<cとなるm∈N≥1m\in\NNを取る。この組の添字をj0j_0とする。K⊆B(θ0,ρ)K\subseteq B(\theta_0,\rho)であり、θ0∈B(a,r/2)\theta_0\in B(a,r/2)である。cIp⪯Jn⪯CIpcI_p\preceq J_n\preceq CI_pが半径ρ\rhoの閉球上で成り立つ事象上では、sn=Un(θ0)/ns_n=U_n(\theta_0)/nとして、各t∈∂Kt\in\partial Kに対する Taylor 評価から

ℓn(t)−ℓn(a)n≤∥sn∥(r+2d)−c2(r−d)2+C2d2.\frac{\ell_n(t)-\ell_n(a)}n \leq\|s_n\|(r+2d)-\frac c2(r-d)^2+\frac C2d^2.

右辺の定数部分は−9cr2/32+cr2/32=−cr2/4-9cr^2/32+cr^2/32=-cr^2/4以下である。sn→Pθ00s_n\xrightarrow{P_{\theta_0}}0およびTn→Pθ0θ0T_n\xrightarrow{P_{\theta_0}}\theta_0から、組j0j_0は確率が1へ収束する事象上で三条件を満たす。したがって、選ばれる添字は確率が1へ収束する事象上でj0j_0以下になる。

添字がj0j_0以下の有限個の組のうち、θ0∉B‾(a,r/2)\theta_0\notin\overline B(a,r/2)であるものについては、Tn∈B(a,r/2)T_n\in B(a,r/2)となる確率が00へ収束する。残る組ではθ0\theta_0はKKの内点である。その組が選ばれた標本では、h=θ^n−θ0h=\widehat\theta_n-\theta_0とおくと

sn=∫01Jn(θ0+th)h dt,m−1∥h∥2≤h⊤sn≤∥h∥∥sn∥.s_n=\int_0^1J_n(\theta_0+th)h\,dt,\qquad m^{-1}\|h\|^2\leq h^\top s_n\leq\|h\|\|s_n\|.

よって∥θ^n−θ0∥≤m∥sn∥\|\widehat\theta_n-\theta_0\|\leq m\|s_n\|である。有限個の組に現れるmmの最大値を用いれば、一致性が従う。選ばれた最大点は score 根であり、組が選ばれる確率は1へ収束するから、尤度方程式についての結論も成り立つ。▨

例 2.4.XiX_iが成功確率θ∈(0,1)\theta\in(0,1)の Bernoulli 分布に従うとき、

Un(t)=∑iXi−ntt(1−t).U_n(t)=\frac{\sum_iX_i-nt}{t(1-t)}.

0<∑iXi<n0<\sum_iX_i<nのときの唯一の根は標本平均である。一方、全観測が成功ならばUn(t)=n/t>0U_n(t)=n/t>0であり、全観測が失敗ならばUn(t)=−n/(1−t)<0U_n(t)=-n/(1-t)<0である。これらの標本では開母数空間に根がなく、大域最大点も存在しない。例外事象の確率はθn+(1−θ)n→0\theta^n+(1-\theta)^n\to0である。したがって、全標本で根となることを要求すると、正則なモデルでも存在の結論は成立しない。

3 漸近線形表示と二次展開

定理 3.1. 密度族が固定したθ0\theta_0における局所 Cramér 条件を満たし、標本がPθ0P_{\theta_0}に従う独立同分布列であるとする。Θ\Theta値の可測推定量列θ^n\widehat\theta_nが一致し、確率が1へ収束する事象上で局所領域に属してUn(θ^n)=0U_n(\widehat\theta_n)=0を満たすと仮定する。Δn=Un(θ0)/n\Delta_n=U_n(\theta_0)/\sqrt nとおくと、

n(θ^n−θ0)=I0−1Δn+oPθ0(1),n(θ^n−θ0)⇒Np(0,I0−1).\sqrt n(\widehat\theta_n-\theta_0) =I_0^{-1}\Delta_n+o_{P_{\theta_0}}(1),\qquad \sqrt n(\widehat\theta_n-\theta_0) \Rightarrow N_p(0,I_0^{-1}).

ここでoPθ0(1)o_{P_{\theta_0}}(1)はノルムが00へ確率収束する確率ベクトルを表す。この結論は任意の一致する尤度方程式解の列に成り立つ。

証明.hn=θ^n−θ0h_n=\widehat\theta_n-\theta_0とおく。θ^n\widehat\theta_nが局所閉球に属し、尤度方程式を満たす事象上では、score の線分積分によって

0=Un(θ^n)=Un(θ0)−nAnhn,An=∫01Jn(θ0+thn) dt0=U_n(\widehat\theta_n) =U_n(\theta_0)-nA_nh_n,\qquad A_n=\int_0^1J_n(\theta_0+th_n)\,dt

である。局所閉球の外ではAn=I0A_n=I_0と定める。補題 1.3 (3)によりAn→Pθ0I0A_n\xrightarrow{P_{\theta_0}}I_0である。

∥Ip−I0−1An∥op<1/2\|I_p-I_0^{-1}A_n\|_{\mathrm{op}}<1/2となる確率は1へ収束する。摂動可逆性§E4.7 補題 1.1によって、この事象上でAnA_nは可逆であり、∥An−1∥op≤2∥I0−1∥op\|A_n^{-1}\|_{\mathrm{op}}\leq2\|I_0^{-1}\|_{\mathrm{op}}である。

An−1−I0−1=An−1(I0−An)I0−1A_n^{-1}-I_0^{-1}=A_n^{-1}(I_0-A_n)I_0^{-1}

から、例外事象上でAn−1A_n^{-1}をI0−1I_0^{-1}に補完すればAn−1→Pθ0I0−1A_n^{-1}\xrightarrow{P_{\theta_0}}I_0^{-1}である。

確率が1へ収束する事象上でnhn=An−1Δn\sqrt n h_n=A_n^{-1}\Delta_nである。補題 1.3 (1)と行列 Slutsky の定理§E11.17 系 5.5により、右辺はNp(0,I0−1)N_p(0,I_0^{-1})に分布収束する。さらに、An−1−I0−1→Pθ00A_n^{-1}-I_0^{-1}\xrightarrow{P_{\theta_0}}0とΔn⇒Np(0,I0)\Delta_n\Rightarrow N_p(0,I_0)に行列 Slutsky の定理を適用すると、(An−1−I0−1)Δn→Pθ00(A_n^{-1}-I_0^{-1})\Delta_n\xrightarrow{P_{\theta_0}}0となる。等式が成立しない例外事象の確率も00へ収束するため、線形表示と正規極限の両方を得る。▨

系 3.2. 固定したθ0\theta_0で局所 Cramér 条件を満たす独立同分布モデルにおいて、可測な大域最尤推定量列θ^n\widehat\theta_nが存在し、θ^n→Pθ0θ0\widehat\theta_n\xrightarrow{P_{\theta_0}}\theta_0であるとする。このとき定理 3.1の線形表示と正規極限が成り立つ。

証明. 一致性によって、θ^n\widehat\theta_nは確率が1へ収束する事象上で、対数尤度が微分可能な局所開球に入る。大域最大点はその開球内でも最大点であるから各座標微分が00であり、定理 3.1を適用することができる。▨

命題 3.3. 密度族が固定したθ0\theta_0における局所 Cramér 条件を満たし、標本がPθ0P_{\theta_0}に従う独立同分布列であるとする。Θ\Theta値の可測推定量列TnT_nに対し、hn=n(Tn−θ0)h_n=\sqrt n(T_n-\theta_0)が確率有界であると仮定する。このとき、Δn=Un(θ0)/n\Delta_n=U_n(\theta_0)/\sqrt nとして

Jn(Tn)→Pθ0I0,ℓn(Tn)−ℓn(θ0)=Δn⊤hn−12hn⊤I0hn+oPθ0(1)J_n(T_n)\xrightarrow{P_{\theta_0}}I_0,\qquad \ell_n(T_n)-\ell_n(\theta_0) =\Delta_n^\top h_n-\frac12h_n^\top I_0h_n+o_{P_{\theta_0}}(1)

が成り立つ。局所領域の外では表示式の左辺を任意の固定値に補完してよい。

証明.hnh_nの確率有界性からTn→Pθ0θ0T_n\xrightarrow{P_{\theta_0}}\theta_0である。したがって観測情報の結論は補題 1.3 (3)による。TnT_nが局所閉球に属する事象上で Taylor の積分剰余公式を用いると、

ℓn(Tn)−ℓn(θ0)=Δn⊤hn−∫01(1−t)hn⊤Jn(θ0+t(Tn−θ0))hn dt.\ell_n(T_n)-\ell_n(\theta_0) =\Delta_n^\top h_n -\int_0^1(1-t)h_n^\top J_n(\theta_0+t(T_n-\theta_0))h_n\,dt.

積分とhn⊤I0hn/2h_n^\top I_0h_n/2の差の絶対値は

12∥hn∥2sup⁡0≤t≤1∥Jn(θ0+t(Tn−θ0))−I0∥op\frac12\|h_n\|^2 \sup_{0\leq t\leq1}\|J_n(\theta_0+t(T_n-\theta_0))-I_0\|_{\mathrm{op}}

以下である。上限は00へ確率収束し、∥hn∥2\|h_n\|^2は確率有界であるから、積は00へ確率収束する。具体的には∥hn∥≤K\|h_n\|\leq Kとその補事象に分け、先にn→∞n\to\infty、次にK→∞K\to\inftyとすればよい。▨

4 母数関数と漸近有効性

定理 4.1 (デルタ法).p,k∈N≥1p,k\in\NNとし、TnT_nをRp\R^p値の可測な確率ベクトル、an>0a_n>0をan→∞a_n\to\inftyを満たす定数列とする。固定したθ0∈Rp\theta_0\in\R^pと半正定値行列VVに対して

an(Tn−θ0)⇒Np(0,V)a_n(T_n-\theta_0)\Rightarrow N_p(0,V)

であると仮定する。θ0\theta_0の開近傍GG上の Borel 可測写像g:G→Rkg:G\to\R^kがθ0\theta_0で全微分可能ならば、

an{g(Tn)−g(θ0)}⇒Nk(0,Dg(θ0)VDg(θ0)⊤).a_n\{g(T_n)-g(\theta_0)\} \Rightarrow N_k\bigl(0,Dg(\theta_0)V Dg(\theta_0)^\top\bigr).

Tn∉GT_n\notin Gではg(Tn)g(T_n)を固定値に補完する。Dg(θ0)Dg(\theta_0)の階数が小さい場合やDg(θ0)=0Dg(\theta_0)=0の場合も含む。

証明.Zn=an(Tn−θ0)Z_n=a_n(T_n-\theta_0)とおく。§E11.17 補題 3.2からZnZ_nは確率有界である。任意のδ>0\delta>0についてP(∥Tn−θ0∥>δ)=P(∥Zn∥>anδ)→0P(\|T_n-\theta_0\|>\delta)=P(\|Z_n\|>a_n\delta)\to0であるから、Tn→Pθ0T_n\xrightarrow{P}\theta_0である。

全微分可能性により、θ0+h∈G\theta_0+h\in Gでは

g(θ0+h)−g(θ0)=Dg(θ0)h+r(h),∥r(h)∥∥h∥⟶0g(\theta_0+h)-g(\theta_0)=Dg(\theta_0)h+r(h),\qquad \frac{\|r(h)\|}{\|h\|}\longrightarrow0

であり、r(0)=0r(0)=0とする。ε,η>0\varepsilon,\eta>0を固定し、sup⁡nP(∥Zn∥>K)<η\sup_nP(\|Z_n\|>K)<\etaとなるK>0K>0を取る。あるδ>0\delta>0について、∥h∥≤δ\|h\|\leq\deltaならばθ0+h∈G\theta_0+h\in Gかつ∥r(h)∥≤ε∥h∥/K\|r(h)\|\leq\varepsilon\|h\|/Kである。したがって

P(an∥r(Tn−θ0)∥>ε)≤P(∥Zn∥>K)+P(∥Tn−θ0∥>δ)P(a_n\|r(T_n-\theta_0)\|>\varepsilon) \leq P(\|Z_n\|>K)+P(\|T_n-\theta_0\|>\delta)

となり、n→∞n\to\inftyの後にη↓0\eta\downarrow0とすると剰余は00へ確率収束する。局所領域の外の確率も00へ収束する。行列 Slutsky の定理§E11.17 系 5.5をDg(θ0)Zn+oP(1)Dg(\theta_0)Z_n+o_P(1)に適用すれば結論を得る。▨

定義 4.2 (漸近有効性).Θ⊆Rp\Theta\subseteq\R^p上の独立同分布モデルにおいて、1観測当たりの Fisher 情報行列I(θ0)I(\theta_0)が正定値であるとする。可測な推定量列TnT_nが

n(Tn−θ0)⇒Np(0,I(θ0)−1)\sqrt n(T_n-\theta_0)\Rightarrow N_p(0,I(\theta_0)^{-1})

を満たすとき、TnT_nはθ0\theta_0において漸近有効 (asymptotically efficient) であるという。すべてのθ0∈Θ\theta_0\in\Thetaにおいてこの性質をもつとき、モデル上で漸近有効であるという。一般にn(Tn−θ0)⇒Np(0,V)\sqrt n(T_n-\theta_0)\Rightarrow N_p(0,V)の極限共分散VVをここでの漸近分散と呼ぶ。

系 4.3.定理 2.3のモデルでは、同定理が構成する尤度方程式解の列はモデル上で漸近有効である。固定した真値における定理 3.1の仮定の下では、任意の一致する尤度方程式解の列がその真値で漸近有効である。

証明. それぞれの固定した真値で定理 3.1を適用する。▨

命題 4.4.定理 3.1の仮定の下で、V^n=Jn(θ^n)−1\widehat V_n=J_n(\widehat\theta_n)^{-1}とおく。観測情報が定義されないか正定値でない標本ではV^n=Ip\widehat V_n=I_pと定める。このとき

V^n→Pθ0I0−1,θ^n,j−θ0,j(V^n)jj/n⇒N(0,1)(j=1,…,p).\widehat V_n\xrightarrow{P_{\theta_0}}I_0^{-1},\qquad \frac{\widehat\theta_{n,j}-\theta_{0,j}} {\sqrt{(\widehat V_n)_{jj}/n}}\Rightarrow N(0,1) \quad(j=1,\ldots,p).

したがって(V^n)jj/n\sqrt{(\widehat V_n)_{jj}/n}は第jj座標の漸近標準誤差の一致する推定を与える。すなわち、この量と(I0−1)jj/n\sqrt{(I_0^{-1})_{jj}/n}の比は11へ確率収束する。さらに、I(θ)I(\theta)がθ0\theta_0の近傍で有限かつθ0\theta_0で連続であるならば、V^n\widehat V_nをI(θ^n)−1I(\widehat\theta_n)^{-1}に置き換えても同じ結論が成り立つ。近傍の外または逆行列が存在しない標本ではIpI_pに補完する。

証明.補題 1.3 (3)によってJn(θ^n)→Pθ0I0J_n(\widehat\theta_n)\xrightarrow{P_{\theta_0}}I_0である。正定値の下界と逆行列の摂動評価を定理 3.1の証明と同じ行列に適用すると、V^n→Pθ0I0−1\widehat V_n\xrightarrow{P_{\theta_0}}I_0^{-1}である。正定値行列I0−1I_0^{-1}の対角成分は正なので、平方根の連続性から

(V^n)jj/(I0−1)jj→Pθ01.\sqrt{(\widehat V_n)_{jj}/(I_0^{-1})_{jj}}\xrightarrow{P_{\theta_0}}1.

標準化された正規極限は定理 3.1と Slutsky の定理から従う。期待情報については、一致性と仮定した連続性からI(θ^n)→Pθ0I0I(\widehat\theta_n)\xrightarrow{P_{\theta_0}}I_0を得るので、同じ逆行列の評価と標準化を適用することができる。▨

注意 4.5. 一径数の場合、漸近標準誤差は1/nI(θ0)1/\sqrt{nI(\theta_0)}である。観測情報から得る漸近標準誤差の二乗の推定値は

1nJn(θ^n)=1−ℓn′′(θ^n)\frac1{nJ_n(\widehat\theta_n)} =\frac1{-\ell_n''(\widehat\theta_n)}

であり、期待情報を用いる場合は1/[nI(θ^n)]1/[nI(\widehat\theta_n)]である。いずれも命題 4.4の仮定と例外事象上の補完を伴う。

注意 4.6. 正規極限の共分散で定めた漸近分散は、有限標本の共分散についてのnCov⁡θ0(Tn)n\operatorname{Cov}_{\theta_0}(T_n)の極限を主張するものではない。分布収束だけから二次モーメントの収束は従わない。また、漸近有効性の定義は、すべての推定量列の漸近分散の中で逆 Fisher 情報が最小であるという主張を含まない。

例 4.7.Xi∼Np(θ,Ip)X_i\sim N_p(\theta,I_p)が独立同分布であり、θ∈Rp\theta\in\R^pとする。対数尤度は定数項を除いて−∑i∥Xi−θ∥2/2-\sum_i\|X_i-\theta\|^2/2であるから、θ^n=X‾n\widehat\theta_n=\overline X_nは唯一の大域最尤推定量であり、I(θ)=IpI(\theta)=I_pである。弱大数の法則を各成分へ適用すると一致性が従う。対数密度の三階微分は零であり、score はX−θX-\theta、Hessian は−Ip-I_pである。各固定K>0K>0に対し、∥θ∥≤K\|\theta\|\leq Kにおける密度の一階・二階微分の絶対値は、ある定数CKC_KによってCK(1+∥x∥2)e−∥x∥2/4C_K(1+\|x\|^2)e^{-\|x\|^2/4}以下である。この評価は∥x−θ∥2≥∥x∥2/2−∥θ∥2\|x-\theta\|^2\geq\|x\|^2/2-\|\theta\|^2と密度の微分公式から従う。右辺は可積分なので微分積分交換が成立し、局所 Cramér 条件を満たす。したがって

n(X‾n−θ)⇒Np(0,Ip).\sqrt n(\overline X_n-\theta)\Rightarrow N_p(0,I_p).

g(t)=∥t∥2g(t)=\|t\|^2にデルタ法を適用すると

n(∥X‾n∥2−∥θ∥2)⇒N(0,4∥θ∥2).\sqrt n(\|\overline X_n\|^2-\|\theta\|^2) \Rightarrow N(0,4\|\theta\|^2).

θ=0\theta=0では極限は原点に集中する確率分布である。

例 4.8 (Hodges の推定量).Xi∼N(θ,1)X_i\sim N(\theta,1)が独立同分布であり、θ∈R\theta\in\Rとする。標本平均X‾n\overline X_nを用いて

Hn={0,∣X‾n∣≤n−1/4,X‾n,∣X‾n∣>n−1/4H_n= \begin{cases} 0,&|\overline X_n|\leq n^{-1/4},\\ \overline X_n,&|\overline X_n|>n^{-1/4} \end{cases}

と定める。この可測な推定量列はすべてのθ\thetaで一致し、

n(Hn−θ)⇒{N(0,0),θ=0,N(0,1),θ≠0\sqrt n(H_n-\theta)\Rightarrow \begin{cases} N(0,0),&\theta=0,\\ N(0,1),&\theta\ne0 \end{cases}

を満たす。原点における漸近分散00はI(0)−1=1I(0)^{-1}=1より小さい。このような点での現象を超有効性という。

証明.θ=0\theta=0のとき、nX‾n⇒N(0,1)\sqrt n\overline X_n\Rightarrow N(0,1)であるから、この列は確率有界である。したがって

P0(Hn≠0)=P0(∣nX‾n∣>n1/4)⟶0.P_0(H_n\ne0) =P_0(|\sqrt n\overline X_n|>n^{1/4})\longrightarrow0.

任意のε>0\varepsilon>0に対してP0(∣nHn∣>ε)≤P0(Hn≠0)P_0(|\sqrt n H_n|>\varepsilon)\leq P_0(H_n\ne0)なので、nHn→P00\sqrt nH_n\xrightarrow{P_0}0である。

固定したθ≠0\theta\ne0について、十分大きなnnではn−1/4<∣θ∣/2n^{-1/4}<|\theta|/2である。標本平均の一致性によって

Pθ(Hn≠X‾n)≤Pθ(∣X‾n∣≤n−1/4)≤Pθ(∣X‾n−θ∣≥∣θ∣/2)⟶0.P_\theta(H_n\ne\overline X_n) \leq P_\theta(|\overline X_n|\leq n^{-1/4}) \leq P_\theta(|\overline X_n-\theta|\geq|\theta|/2) \longrightarrow0.

よってn(Hn−θ)\sqrt n(H_n-\theta)は、確率が1へ収束する事象上でn(X‾n−θ)\sqrt n(\overline X_n-\theta)と等しい。標本平均の正規極限から結論が従い、Hn→PθθH_n\xrightarrow{P_\theta}\thetaも得られる。▨

5 演習

問題 5.1.補題 2.2の証明を完成させよ。

解答.

Θ\Thetaの可算稠密列(qj)(q_j)を固定し、可測集合Ajk={x:pqj(x)>pqk(x)}A_{jk}=\{x:p_{q_j}(x)>p_{q_k}(x)\}を一列に並べて(Am)(A_m)と書く。この族はモデルを分離する。実際、θ≠η\theta\ne\etaに対してδ=∥pθ−pη∥1>0\delta=\|p_\theta-p_\eta\|_1>0とおく。L1L^1連続性から

e:=∥pqj−pθ∥1+∥pqk−pη∥1<δ/6e:=\|p_{q_j}-p_\theta\|_1+\|p_{q_k}-p_\eta\|_1<\delta/6

となるj,kj,kを選ぶことができる。f=pθ−pηf=p_\theta-p_\eta、g=pqj−pqkg=p_{q_j}-p_{q_k}とすると、∫g dμ=0\int g\,d\mu=0であるから、

∫Ajkf dμ≥∫Ajkg dμ−e=12∥g∥1−e≥δ2−3e2>δ4.\int_{A_{jk}}f\,d\mu \geq\int_{A_{jk}}g\,d\mu-e =\frac12\|g\|_1-e \geq\frac\delta2-\frac{3e}2>\frac\delta4.

したがってPθ(Ajk)≠Pη(Ajk)P_\theta(A_{jk})\ne P_\eta(A_{jk})である。

確率測度P,QP,Qに対して

d(P,Q)=∑m=1∞2−m∣P(Am)−Q(Am)∣d(P,Q)=\sum_{m=1}^\infty2^{-m}|P(A_m)-Q(A_m)|

とおく。モデル上ではddは距離であり、d(Pθ,Pη)≤∥pθ−pη∥1d(P_\theta,P_\eta)\leq\|p_\theta-p_\eta\|_1なのでθ↦Pθ\theta\mapsto P_\thetaはddについて連続である。経験測度PnP_nとDn(t)=d(Pn,Pt)D_n(t)=d(P_n,P_t)を定める。各mmの標本比率の分散は1/(4n)1/(4n)以下であるから、Cauchy–Schwarz の不等式と非負級数の単調収束定理から

Eθd(Pn,Pθ)≤∑m=1∞2−m12n=12n.E_\theta d(P_n,P_\theta) \leq\sum_{m=1}^\infty2^{-m}\frac1{2\sqrt n} =\frac1{2\sqrt n}.

εn=n−1/4\varepsilon_n=n^{-1/4}とおくと Markov の不等式によって

Pθ{d(Pn,Pθ)>εn}≤12n1/4⟶0.P_\theta\{d(P_n,P_\theta)>\varepsilon_n\} \leq\frac1{2n^{1/4}}\longrightarrow0.

また、三角不等式からすべてのt∈Θt\in\Thetaに対して

∣Dn(t)−d(Pθ,Pt)∣≤d(Pn,Pθ).|D_n(t)-d(P_\theta,P_t)|\leq d(P_n,P_\theta).

有理中心と正の有理半径をもち、半径を2倍にした閉球もΘ\Thetaに含まれる閉球を一列に並べる。その最初のjj個の和集合をKjK_jとする。各KjK_jは非空コンパクトであり、Kj⊆Kj+1K_j\subseteq K_{j+1}かつ⋃jint⁡(K)j=Θ\bigcup_j\tpint K_j=\Thetaである。各KjK_jに可算稠密列Dj=(tj,l)l∈N≥1D_j=(t_{j,l})_{l\in\NN}を固定する。標本を固定したときDn(t)D_n(t)はttについて連続なので、

vn,j=inf⁡lDn(tj,l)=min⁡t∈KjDn(t)v_{n,j}=\inf_lD_n(t_{j,l})=\min_{t\in K_j}D_n(t)

である。左辺は可算個の可測関数の下限であり、可測である。

vn,j<2εnv_{n,j}<2\varepsilon_nとなる最小のjjを選び、そのjjについてDn(tj,l)<vn,j+εnD_n(t_{j,l})<v_{n,j}+\varepsilon_nとなる最小のllを選んでTn=tj,lT_n=t_{j,l}と定める。該当するjjがなければ固定したθ∗∈Θ\theta_*\in\Thetaを用いる。下限の性質からllは存在し、選択は可算個の可測な比較だけで定まる。

真値θ\thetaを固定し、θ∈KJ\theta\in K_JとなるJJを取る。d(Pn,Pθ)≤εnd(P_n,P_\theta)\leq\varepsilon_nの事象上ではvn,J≤εnv_{n,J}\leq\varepsilon_nであるから、選ばれたjjはJJ以下であり、

Tn∈KJ,Dn(Tn)<3εn,d(PTn,Pθ)<4εn.T_n\in K_J,\qquad D_n(T_n)<3\varepsilon_n,\qquad d(P_{T_n},P_\theta)<4\varepsilon_n.

任意のδ>0\delta>0に対し、F=KJ∩{t:∥t−θ∥≥δ}F=K_J\cap\{t:\|t-\theta\|\geq\delta\}はコンパクトである。FFが空でなければ、連続関数t↦d(Pt,Pθ)t\mapsto d(P_t,P_\theta)はFF上で正の最小値bδb_\deltaをもつ。最小値が正であることにはモデルの識別可能性を用いた。十分大きなnnでは4εn<bδ4\varepsilon_n<b_\deltaであるため、上の事象上で∥Tn−θ∥<δ\|T_n-\theta\|<\deltaとなる。FFが空ならこの結論はTn∈KJT_n\in K_Jだけから従う。よってTn→PθθT_n\xrightarrow{P_\theta}\thetaである。θ,J,δ\theta,J,\deltaは収束の検証だけに用いており、TnT_nの構成には現れない。▨

問題 5.2. 成功確率θ∈(0,1)\theta\in(0,1)の独立同分布 Bernoulli 標本について、Tn=(1+∑i=1nXi)/(n+2)T_n=(1+\sum_{i=1}^nX_i)/(n+2)とおく。対数オッズの推定量log⁡{Tn/(1−Tn)}\log\{T_n/(1-T_n)\}の漸近正規分布を求めよ。

解答.

∣Tn−X‾n∣=∣1−2X‾n∣/(n+2)≤1/(n+2)|T_n-\overline X_n|=|1-2\overline X_n|/(n+2)\leq1/(n+2)である。中心極限定理と Slutsky の定理によって

n(Tn−θ)⇒N(0,θ(1−θ)).\sqrt n(T_n-\theta)\Rightarrow N(0,\theta(1-\theta)).

g(t)=log⁡{t/(1−t)}g(t)=\log\{t/(1-t)\}は(0,1)(0,1)で微分可能であり、g′(t)=1/[t(1−t)]g'(t)=1/[t(1-t)]である。0<Tn<10<T_n<1なので全標本でg(Tn)g(T_n)が定義される。デルタ法定理 4.1によって

n(log⁡Tn1−Tn−log⁡θ1−θ)⇒N(0,1θ(1−θ)).\sqrt n\left(\log\frac{T_n}{1-T_n}-\log\frac\theta{1-\theta}\right) \Rightarrow N\left(0,\frac1{\theta(1-\theta)}\right).

▨

前提記事

9 本の記事・単元を表示