1 score と Fisher 情報行列
定義 1.1 (score ベクトル).(X,A)上のシグマ有限測度μに支配された確率測度族(Pθ)θ∈Θを考え、pθをPθのμに関する密度とする。母数空間ΘはRpの開集合であるとする。また、あるS∈Aが存在し、すべてのθ∈Θについてpθ>0がS上で成り立ち、pθ=0がSの外で成り立つとする。各x∈Sについて写像θ↦pθ(x)が微分可能であるとき、
Uθ(x)=∇θlogpθ(x)=pθ(x)∇θpθ(x)をxにおける score ベクトル (score vector) という。観測が標本全体X=(X1,…,Xn)である場合には、pθは標本全体の同時密度であり、Uθ(X)も標本全体の score ベクトルである。
命題 1.2.定義 1.1のモデルにおいて、各j∈{1,…,p}と各θ∈Θについてx↦∂jpθ(x)がμ可積分であり、
∂j∫Spθ(x)μ(dx)=∫S∂jpθ(x)μ(dx)が成り立つとする。このときUθは成分ごとに可積分であり、
Eθ[Uθ]=0が成り立つ。
証明. 各j∈{1,…,p}について、共通台S上では
(Uθ)j(x)pθ(x)=∣∂jpθ(x)∣であるから、(Uθ)jはPθ可積分である。さらに、密度の規格化と仮定した微分積分交換から
Eθ[(Uθ)j]=∫Spθ(x)∂jpθ(x)pθ(x)μ(dx)=∂j∫Spθ(x)μ(dx)=∂j1=0を得る。すべての成分について同じ等式が成り立つため、Eθ[Uθ]=0である。▨
証明.x∈Sでは、各j,kについて
∂jklogpθ(x)=pθ(x)∂jkpθ(x)−pθ(x)2∂jpθ(x)∂kpθ(x)である。両辺をPθに関して積分すると、仮定した可積分性と微分積分交換により
Eθ[∂jklogpθ(X)]=∫S∂jkpθ(x)μ(dx)−Eθ[(Uθ)j(Uθ)k]=∂jk∫Spθ(x)μ(dx)−I(θ)jk=−I(θ)jkを得る。すべての成分についてこの等式が成り立つため、行列の等式が従う。▨
証明. 積密度の対数を微分すると
Uθ(x1,…,xn)=∇θr=1∑nlogpr,θ(xr)=r=1∑nUr,θ(xr)となる。命題 1.2により各Ur,θの期待値は零である。r=sのとき、独立性と期待値の積への分解§E11.7 定理 3.1を各成分に適用すると
Eθ[Ur,θUs,θ⊤]=Eθ[Ur,θ]Eθ[Us,θ]⊤=0である。したがって、
In(θ)=Eθ(r=1∑nUr,θ)(s=1∑nUs,θ)⊤=r=1∑nEθ[Ur,θUr,θ⊤]=r=1∑nIr(θ).独立同分布の場合には各Ir(θ)がI1(θ)に等しいため、最後の等式を得る。▨
2 不偏推定量の下界
定理 2.1 (Cramér–Rao の不等式).定義 1.1のモデルが命題 1.2の仮定を満たし、I(θ)がすべてのθ∈Θで有限な正定値行列であるとする。可測写像δ:X→Rkは、すべてのθ∈ΘについてEθ[∥δ∥2]<∞を満たし、微分可能な写像τ:Θ→Rkの不偏推定量、すなわち
Eθ[δ]=τ(θ)を満たすとする。さらに、各a∈{1,…,k}、j∈{1,…,p}と各θ∈Θについてx↦δa(x)∂jpθ(x)がμ可積分であり、
∂j∫Sδa(x)pθ(x)μ(dx)=∫Sδa(x)∂jpθ(x)μ(dx)が成り立つとする。このとき、Dτ(θ)をk×pJacobian 行列とすれば、半正定値順序に関して
Covθ(δ)⪰Dτ(θ)I(θ)−1Dτ(θ)⊤が成り立つ。ここで
Covθ(δ)=Eθ[(δ−Eθ[δ])(δ−Eθ[δ])⊤]である。等号が成り立つための必要十分条件は、
δ−τ(θ)=Dτ(θ)I(θ)−1UθPθ-ほとんど確実にが成り立つことである。
証明.B=Dτ(θ)と置く。各a,jについて、仮定した微分積分交換とEθ[Uθ]=0から
Eθ[(δa−τa(θ))(Uθ)j]=∫Sδa(x)∂jpθ(x)μ(dx)−τa(θ)Eθ[(Uθ)j]=∂jτa(θ).したがって、
Eθ[(δ−τ(θ))Uθ⊤]=B.A=BI(θ)−1および
V=δ−τ(θ)−AUθと置く。Eθ[δ]=τ(θ)とEθ[Uθ]=0によりEθ[V]=0である。I(θ)は対称であり、上で得た交差積の等式から
Covθ(V)=Eθ[VV⊤]=Covθ(δ)−AB⊤−BA⊤+AI(θ)A⊤=Covθ(δ)−BI(θ)−1B⊤となる。任意のc∈Rkに対して
c⊤Covθ(V)c=Eθ[(c⊤V)2]≥0であるため、Covθ(V)は半正定値である。従って主張した行列不等式を得る。
行列不等式で等号が成り立つことはCovθ(V)=0と同値である。Covθ(V)=0ならば、各成分VaについてEθ[Va2]=0であるためVa=0がPθ-ほとんど確実に成り立つ。成分は有限個であるからV=0がPθ-ほとんど確実に成り立つ。逆にV=0がPθ-ほとんど確実に成り立つならばCovθ(V)=0である。Vの定義を戻すと、主張した等号条件を得る。▨
系 2.2.X1,…,Xnを一径数の独立同分布標本とし、一観測の Fisher 情報量I1(θ)が0<I1(θ)<∞を満たすとする。定理 2.1の正則性と微分積分交換の仮定を満たす実数値推定量δが、微分可能な実数値関数τ(θ)の不偏推定量であるならば、
Varθ(δ)≥nI1(θ)τ′(θ)2である。特にEθ[δ]=θならば、
Varθ(δ)≥nI1(θ)1.
証明.命題 1.5により標本全体の Fisher 情報量はIn(θ)=nI1(θ)である。定理 2.1にp=k=1とDτ(θ)=τ′(θ)を代入すると最初の不等式を得る。τ(θ)=θの場合にはτ′(θ)=1である。▨
定義 2.3 (有限標本の有効性).X1,…,Xnを一径数の独立同分布標本とし、母数空間のすべてのθで系 2.2の仮定が成り立ち、0<I1(θ)<∞であるとする。Eθ[δ]=θとVarθ(δ)<∞をすべてのθで満たす推定量δに対して、θにおける有限標本の 有効性 (efficiency) を
effθ(δ)=Varθ(δ)1/(nI1(θ))と定める。系 2.2により0<effθ(δ)≤1である。effθ(δ)=1であるとき、δはθにおいて有限標本で有効であるという。すべてのθで等号が成り立つとき、δはこのモデルにおいて有限標本で有効であるという。
3 例
例 3.1 (Poisson 模型).X1,…,Xnを平均λ>0の Poisson 分布からの独立同分布標本とし、S=∑i=1nXiと置く。観測値をx1,…,xnと書き、Sの観測値を同じ文字で表せば、対数尤度、score および対数尤度の二階導関数は
ℓ(λ)Uλℓ′′(λ)=−nλ+Slogλ−i=1∑nlog(xi!),=−n+λS,=−λ2Sである。§E11.5 命題 1.5と独立性からEλ[S]=nλおよびVarλ(S)=nλであるため、
Eλ[Uλ]=0,Varλ(Uλ)=λn,−Eλ[ℓ′′(λ)]=λnを得る。従って一観測の Fisher 情報量はI1(λ)=1/λであり、標本全体の Fisher 情報量はIn(λ)=n/λである。
観測値が(1,3,2,0,4)である場合にはn=5、S=10である。score は0<λ<2で正、λ>2で負であるから、対数尤度はλ=2で全域の一意な最大値をとる。従ってλ=2であり、ℓ′′(2)=−10/4=−2.5である。真値もλ=2ならば、標本全体の Fisher 情報量はI5(2)=5/2=2.5である。
この観測値に対する尤度を格子上で評価した数値記録でも、最大点はλ=2.0である。また、同じn=5、真値λ=2の設定で200万回の標本を生成した数値記録では、score の標本平均は約−0.0007、標本分散は約2.497であり、理論値0と2.5に近い。
標本平均Xˉはλの不偏推定量であり、In(λ)=n/λであるから、
Varλ(Xˉ)=nλ=In(λ)1を満たす。従ってXˉは Cramér–Rao 下界を達成し、有限標本で有効である。
例 3.2 (Bernoulli 標本平均).X1,…,Xnを成功確率p∈(0,1)の Bernoulli 分布からの独立同分布標本とする。標本全体の score は
Up=i=1∑n(pXi−1−p1−Xi)=p(1−p)∑i=1nXi−npである。§E11.5 命題 1.3によりEp[Up]=0であり、
In(p)=Ep[Up2]=p2(1−p)2Varp(∑i=1nXi)=p(1−p)n.また、p=Xはpの不偏推定量であり、
Varp(p)=np(1−p)=In(p)1を満たす。従ってpはすべてのp∈(0,1)で Cramér–Rao 下界を達成し、有限標本で有効である。母数空間を[0,1]として尤度を最大化する場合には、p=Xは最尤推定量でもある。
p=0.3、n=100のとき、一観測の Fisher 情報量は
I1(p)=0.3⋅0.71=4.76190…であり、標本全体の情報量はI100(p)=476.190…である。下界とpの分散はいずれも0.0021であり、標準偏差は0.0021≈0.04583である。
例 3.3 (Bernoulli 標本における等号の非達成).X1,X2を成功確率p∈(0,1)の Bernoulli 分布からの独立同分布標本とし、τ(p)=p2を推定する。δ=X1X2は成功確率p2の Bernoulli 確率変数であるから、
Ep[δ]=p2,Varp(δ)=p2(1−p2)である。二観測の Fisher 情報量は
I2(p)=p(1−p)2であり、τ′(p)=2pである。したがって Cramér–Rao 下界は
I2(p)τ′(p)2=2p3(1−p)となる。実際の分散と下界との差は
p2(1−p2)−2p3(1−p)=p2(1−p)2>0であるため、δはどのp∈(0,1)でも下界を達成しない。
等号条件からも同じ結論を得る。標本全体の score は
Up=p(1−p)X1+X2−2pであるため、等号が成り立つならば
δ−p2=I2(p)τ′(p)Up=p(X1+X2−2p)がほとんど確実に成り立つ。しかし、正の確率(1−p)2をもつ標本点(X1,X2)=(0,0)では、左辺が−p2、右辺が−2p2であり、この等式は成り立たない。