§E14.12Cramér–Rao の不等式

最終更新

平均がλ>0\lambda>0である Poisson 分布から大きさnnの独立同分布標本を得ると、標本平均はλ\lambdaの不偏推定量であり、その分散はλ/n\lambda/nである。この値が推定方法の一つに付随する偶然の精度なのか、それともこのモデルの不偏推定量に対する分散下界なのかを判定するには、確率モデル自体がもつ情報量を測る必要がある。

密度の対数を母数で微分して得る score は、観測が母数の微小な変化に示す感度を表す。Fisher 情報は score の二次モーメントとしてその感度を集約し、独立な観測を加えると加法的に増加する。Cramér–Rao の不等式は、正則性の下で Fisher 情報を不偏推定量の分散下界へ変換する最も基本的な結果の一つであり、下界の達成は有限標本における有効性を定める。

本記事では、score と Fisher 情報を導入し、Cramér–Rao の不等式と等号条件を扱う。

1 score と Fisher 情報行列

定義 1.1 (score ベクトル).(X,A)(\mathcal X,\mathcal A)上のシグマ有限測度μ\muに支配された確率測度族(Pθ)θ∈Θ(P_\theta)_{\theta\in\Theta}を考え、pθp_\thetaをPθP_\thetaのμ\muに関する密度とする。母数空間Θ\ThetaはRp\R^pの開集合であるとする。また、あるS∈AS\in\mathcal Aが存在し、すべてのθ∈Θ\theta\in\Thetaについてpθ>0p_\theta>0がSS上で成り立ち、pθ=0p_\theta=0がSSの外で成り立つとする。各x∈Sx\in Sについて写像θ↦pθ(x)\theta\mapsto p_\theta(x)が微分可能であるとき、

Uθ(x)=∇θlog⁡pθ(x)=∇θpθ(x)pθ(x)U_\theta(x)=\nabla_\theta\log p_\theta(x) =\frac{\nabla_\theta p_\theta(x)}{p_\theta(x)}

をxxにおける score ベクトル (score vector) という。観測が標本全体X=(X1,…,Xn)X=(X_1,\ldots,X_n)である場合には、pθp_\thetaは標本全体の同時密度であり、Uθ(X)U_\theta(X)も標本全体の score ベクトルである。

命題 1.2.定義 1.1のモデルにおいて、各j∈{1,…,p}j\in\{1,\ldots,p\}と各θ∈Θ\theta\in\Thetaについてx↦∂jpθ(x)x\mapsto\partial_jp_\theta(x)がμ\mu可積分であり、

∂j∫Spθ(x) μ(dx)=∫S∂jpθ(x) μ(dx)\partial_j\int_Sp_\theta(x)\,\mu(dx) =\int_S\partial_jp_\theta(x)\,\mu(dx)

が成り立つとする。このときUθU_\thetaは成分ごとに可積分であり、

Eθ[Uθ]=0E_\theta[U_\theta]=0

が成り立つ。

証明. 各j∈{1,…,p}j\in\{1,\ldots,p\}について、共通台SS上では

∣(Uθ)j(x)∣pθ(x)=∣∂jpθ(x)∣\bigl|(U_\theta)_j(x)\bigr|p_\theta(x) =|\partial_jp_\theta(x)|

であるから、(Uθ)j(U_\theta)_jはPθP_\theta可積分である。さらに、密度の規格化と仮定した微分積分交換から

Eθ[(Uθ)j]=∫S∂jpθ(x)pθ(x)pθ(x) μ(dx)=∂j∫Spθ(x) μ(dx)=∂j1=0E_\theta[(U_\theta)_j] =\int_S\frac{\partial_jp_\theta(x)}{p_\theta(x)}p_\theta(x)\,\mu(dx) =\partial_j\int_Sp_\theta(x)\,\mu(dx) =\partial_j1 =0

を得る。すべての成分について同じ等式が成り立つため、Eθ[Uθ]=0E_\theta[U_\theta]=0である。▨

定義 1.3 (Fisher 情報行列).定義 1.1のモデルにおいてEθ[∥Uθ∥2]<∞E_\theta[\lVert U_\theta\rVert^2]<\inftyであるとき、

I(θ)=Eθ[UθUθ⊤]I(\theta)=E_\theta[U_\theta U_\theta^\top]

を Fisher 情報行列 (Fisher information matrix) という。任意のa∈Rpa\in\R^pに対して

a⊤I(θ)a=Eθ[(a⊤Uθ)2]≥0a^\top I(\theta)a=E_\theta[(a^\top U_\theta)^2]\geq0

であるから、I(θ)I(\theta)は対称半正定値行列である。命題 1.2の仮定も満たされる場合には、I(θ)I(\theta)はUθU_\thetaの共分散行列に等しい。

命題 1.4 (情報等式).定義 1.1のモデルにおいて、各x∈Sx\in Sについてθ↦pθ(x)\theta\mapsto p_\theta(x)が二回微分可能であるとする。各j,k∈{1,…,p}j,k\in\{1,\ldots,p\}と各θ∈Θ\theta\in\Thetaについて、∂jkpθ\partial_{jk}p_\thetaと∂jklog⁡pθ\partial_{jk}\log p_\thetaがそれぞれμ\muとPθP_\thetaに関して可積分であり、

∂jk∫Spθ(x) μ(dx)=∫S∂jkpθ(x) μ(dx)\partial_{jk}\int_Sp_\theta(x)\,\mu(dx) =\int_S\partial_{jk}p_\theta(x)\,\mu(dx)

が成り立つとする。さらにI(θ)I(\theta)が有限であるとする。このとき

I(θ)=−Eθ[∇θ2log⁡pθ(X)]I(\theta)=-E_\theta[\nabla_\theta^2\log p_\theta(X)]

が成り立つ。

証明.x∈Sx\in Sでは、各j,kj,kについて

∂jklog⁡pθ(x)=∂jkpθ(x)pθ(x)−∂jpθ(x) ∂kpθ(x)pθ(x)2\partial_{jk}\log p_\theta(x) =\frac{\partial_{jk}p_\theta(x)}{p_\theta(x)} -\frac{\partial_jp_\theta(x)\,\partial_kp_\theta(x)}{p_\theta(x)^2}

である。両辺をPθP_\thetaに関して積分すると、仮定した可積分性と微分積分交換により

Eθ[∂jklog⁡pθ(X)]=∫S∂jkpθ(x) μ(dx)−Eθ[(Uθ)j(Uθ)k]=∂jk∫Spθ(x) μ(dx)−I(θ)jk=−I(θ)jk\begin{aligned} E_\theta[\partial_{jk}\log p_\theta(X)] &=\int_S\partial_{jk}p_\theta(x)\,\mu(dx) -E_\theta[(U_\theta)_j(U_\theta)_k]\\ &=\partial_{jk}\int_Sp_\theta(x)\,\mu(dx)-I(\theta)_{jk}\\ &=-I(\theta)_{jk} \end{aligned}

を得る。すべての成分についてこの等式が成り立つため、行列の等式が従う。▨

命題 1.5.X1,…,XnX_1,\ldots,X_nを独立な観測とする。各r∈{1,…,n}r\in\{1,\ldots,n\}について、XrX_rの密度pr,θp_{r,\theta}が定義 1.1と命題 1.2の仮定を満たし、score ベクトルUr,θU_{r,\theta}の Fisher 情報行列Ir(θ)I_r(\theta)が有限であるとする。標本全体の同時密度が

pθ(x1,…,xn)=∏r=1npr,θ(xr)p_\theta(x_1,\ldots,x_n)=\prod_{r=1}^np_{r,\theta}(x_r)

であるとき、標本全体の score ベクトルと Fisher 情報行列は

Uθ=∑r=1nUr,θ,In(θ)=∑r=1nIr(θ)U_\theta=\sum_{r=1}^nU_{r,\theta}, \qquad I_n(\theta)=\sum_{r=1}^nI_r(\theta)

を満たす。特にX1,…,XnX_1,\ldots,X_nが独立同分布であり、一観測の Fisher 情報行列をI1(θ)I_1(\theta)と書くならば、

In(θ)=nI1(θ)I_n(\theta)=nI_1(\theta)

である。

証明. 積密度の対数を微分すると

Uθ(x1,…,xn)=∇θ∑r=1nlog⁡pr,θ(xr)=∑r=1nUr,θ(xr)U_\theta(x_1,\ldots,x_n) =\nabla_\theta\sum_{r=1}^n\log p_{r,\theta}(x_r) =\sum_{r=1}^nU_{r,\theta}(x_r)

となる。命題 1.2により各Ur,θU_{r,\theta}の期待値は零である。r≠sr\neq sのとき、独立性と期待値の積への分解§E11.7 定理 3.1を各成分に適用すると

Eθ[Ur,θUs,θ⊤]=Eθ[Ur,θ]Eθ[Us,θ]⊤=0E_\theta[U_{r,\theta}U_{s,\theta}^\top] =E_\theta[U_{r,\theta}]E_\theta[U_{s,\theta}]^\top =0

である。したがって、

In(θ)=Eθ[(∑r=1nUr,θ)(∑s=1nUs,θ)⊤]=∑r=1nEθ[Ur,θUr,θ⊤]=∑r=1nIr(θ).\begin{aligned} I_n(\theta) &=E_\theta\left[\left(\sum_{r=1}^nU_{r,\theta}\right) \left(\sum_{s=1}^nU_{s,\theta}\right)^\top\right]\\ &=\sum_{r=1}^nE_\theta[U_{r,\theta}U_{r,\theta}^\top] =\sum_{r=1}^nI_r(\theta). \end{aligned}

独立同分布の場合には各Ir(θ)I_r(\theta)がI1(θ)I_1(\theta)に等しいため、最後の等式を得る。▨

2 不偏推定量の下界

定理 2.1 (Cramér–Rao の不等式).定義 1.1のモデルが命題 1.2の仮定を満たし、I(θ)I(\theta)がすべてのθ∈Θ\theta\in\Thetaで有限な正定値行列であるとする。可測写像δ:X→Rk\delta:\mathcal X\to\R^kは、すべてのθ∈Θ\theta\in\ThetaについてEθ[∥δ∥2]<∞E_\theta[\lVert\delta\rVert^2]<\inftyを満たし、微分可能な写像τ:Θ→Rk\tau:\Theta\to\R^kの不偏推定量、すなわち

Eθ[δ]=τ(θ)E_\theta[\delta]=\tau(\theta)

を満たすとする。さらに、各a∈{1,…,k}a\in\{1,\ldots,k\}、j∈{1,…,p}j\in\{1,\ldots,p\}と各θ∈Θ\theta\in\Thetaについてx↦δa(x)∂jpθ(x)x\mapsto\delta_a(x)\partial_jp_\theta(x)がμ\mu可積分であり、

∂j∫Sδa(x)pθ(x) μ(dx)=∫Sδa(x)∂jpθ(x) μ(dx)\partial_j\int_S\delta_a(x)p_\theta(x)\,\mu(dx) =\int_S\delta_a(x)\partial_jp_\theta(x)\,\mu(dx)

が成り立つとする。このとき、Dτ(θ)D\tau(\theta)をk×pk\times pJacobian 行列とすれば、半正定値順序に関して

Cov⁡θ(δ)⪰Dτ(θ)I(θ)−1Dτ(θ)⊤\operatorname{Cov}_\theta(\delta) \succeq D\tau(\theta)I(\theta)^{-1}D\tau(\theta)^\top

が成り立つ。ここで

Cov⁡θ(δ)=Eθ[(δ−Eθ[δ])(δ−Eθ[δ])⊤]\operatorname{Cov}_\theta(\delta) =E_\theta[(\delta-E_\theta[\delta])(\delta-E_\theta[\delta])^\top]

である。等号が成り立つための必要十分条件は、

δ−τ(θ)=Dτ(θ)I(θ)−1UθPθ-ほとんど確実に\delta-\tau(\theta) =D\tau(\theta)I(\theta)^{-1}U_\theta \qquad P_\theta\text{-ほとんど確実に}

が成り立つことである。

証明.B=Dτ(θ)B=D\tau(\theta)と置く。各a,ja,jについて、仮定した微分積分交換とEθ[Uθ]=0E_\theta[U_\theta]=0から

Eθ[(δa−τa(θ))(Uθ)j]=∫Sδa(x)∂jpθ(x) μ(dx)−τa(θ)Eθ[(Uθ)j]=∂jτa(θ).\begin{aligned} E_\theta[(\delta_a-\tau_a(\theta))(U_\theta)_j] &=\int_S\delta_a(x)\partial_jp_\theta(x)\,\mu(dx) -\tau_a(\theta)E_\theta[(U_\theta)_j]\\ &=\partial_j\tau_a(\theta). \end{aligned}

したがって、

Eθ[(δ−τ(θ))Uθ⊤]=B.E_\theta[(\delta-\tau(\theta))U_\theta^\top]=B.

A=BI(θ)−1A=BI(\theta)^{-1}および

V=δ−τ(θ)−AUθV=\delta-\tau(\theta)-AU_\theta

と置く。Eθ[δ]=τ(θ)E_\theta[\delta]=\tau(\theta)とEθ[Uθ]=0E_\theta[U_\theta]=0によりEθ[V]=0E_\theta[V]=0である。I(θ)I(\theta)は対称であり、上で得た交差積の等式から

Cov⁡θ(V)=Eθ[VV⊤]=Cov⁡θ(δ)−AB⊤−BA⊤+AI(θ)A⊤=Cov⁡θ(δ)−BI(θ)−1B⊤\begin{aligned} \operatorname{Cov}_\theta(V) &=E_\theta[VV^\top]\\ &=\operatorname{Cov}_\theta(\delta)-AB^\top-BA^\top+AI(\theta)A^\top\\ &=\operatorname{Cov}_\theta(\delta)-BI(\theta)^{-1}B^\top \end{aligned}

となる。任意のc∈Rkc\in\R^kに対して

c⊤Cov⁡θ(V)c=Eθ[(c⊤V)2]≥0c^\top\operatorname{Cov}_\theta(V)c =E_\theta[(c^\top V)^2]\geq0

であるため、Cov⁡θ(V)\operatorname{Cov}_\theta(V)は半正定値である。従って主張した行列不等式を得る。

行列不等式で等号が成り立つことはCov⁡θ(V)=0\operatorname{Cov}_\theta(V)=0と同値である。Cov⁡θ(V)=0\operatorname{Cov}_\theta(V)=0ならば、各成分VaV_aについてEθ[Va2]=0E_\theta[V_a^2]=0であるためVa=0V_a=0がPθP_\theta-ほとんど確実に成り立つ。成分は有限個であるからV=0V=0がPθP_\theta-ほとんど確実に成り立つ。逆にV=0V=0がPθP_\theta-ほとんど確実に成り立つならばCov⁡θ(V)=0\operatorname{Cov}_\theta(V)=0である。VVの定義を戻すと、主張した等号条件を得る。▨

系 2.2.X1,…,XnX_1,\ldots,X_nを一径数の独立同分布標本とし、一観測の Fisher 情報量I1(θ)I_1(\theta)が0<I1(θ)<∞0<I_1(\theta)<\inftyを満たすとする。定理 2.1の正則性と微分積分交換の仮定を満たす実数値推定量δ\deltaが、微分可能な実数値関数τ(θ)\tau(\theta)の不偏推定量であるならば、

Var⁡θ(δ)≥τ′(θ)2nI1(θ)\operatorname{Var}_\theta(\delta) \geq\frac{\tau'(\theta)^2}{nI_1(\theta)}

である。特にEθ[δ]=θE_\theta[\delta]=\thetaならば、

Var⁡θ(δ)≥1nI1(θ).\operatorname{Var}_\theta(\delta)\geq\frac1{nI_1(\theta)}.

証明.命題 1.5により標本全体の Fisher 情報量はIn(θ)=nI1(θ)I_n(\theta)=nI_1(\theta)である。定理 2.1にp=k=1p=k=1とDτ(θ)=τ′(θ)D\tau(\theta)=\tau'(\theta)を代入すると最初の不等式を得る。τ(θ)=θ\tau(\theta)=\thetaの場合にはτ′(θ)=1\tau'(\theta)=1である。▨

定義 2.3 (有限標本の有効性).X1,…,XnX_1,\ldots,X_nを一径数の独立同分布標本とし、母数空間のすべてのθ\thetaで系 2.2の仮定が成り立ち、0<I1(θ)<∞0<I_1(\theta)<\inftyであるとする。Eθ[δ]=θE_\theta[\delta]=\thetaとVar⁡θ(δ)<∞\operatorname{Var}_\theta(\delta)<\inftyをすべてのθ\thetaで満たす推定量δ\deltaに対して、θ\thetaにおける有限標本の 有効性 (efficiency) を

eff⁡θ(δ)=1/(nI1(θ))Var⁡θ(δ)\operatorname{eff}_\theta(\delta) =\frac{1/(nI_1(\theta))}{\operatorname{Var}_\theta(\delta)}

と定める。系 2.2により0<eff⁡θ(δ)≤10<\operatorname{eff}_\theta(\delta)\leq1である。eff⁡θ(δ)=1\operatorname{eff}_\theta(\delta)=1であるとき、δ\deltaはθ\thetaにおいて有限標本で有効であるという。すべてのθ\thetaで等号が成り立つとき、δ\deltaはこのモデルにおいて有限標本で有効であるという。

3 例

例 3.1 (Poisson 模型).X1,…,XnX_1,\ldots,X_nを平均λ>0\lambda>0の Poisson 分布からの独立同分布標本とし、S=∑i=1nXiS=\sum_{i=1}^nX_iと置く。観測値をx1,…,xnx_1,\ldots,x_nと書き、SSの観測値を同じ文字で表せば、対数尤度、score および対数尤度の二階導関数は

ℓ(λ)=−nλ+Slog⁡λ−∑i=1nlog⁡(xi!),Uλ=−n+Sλ,ℓ′′(λ)=−Sλ2\begin{aligned} \ell(\lambda) &=-n\lambda+S\log\lambda-\sum_{i=1}^n\log(x_i!),\\ U_\lambda &=-n+\frac{S}{\lambda},\\ \ell''(\lambda) &=-\frac{S}{\lambda^2} \end{aligned}

である。§E11.5 命題 1.5と独立性からEλ[S]=nλE_\lambda[S]=n\lambdaおよびVar⁡λ(S)=nλ\operatorname{Var}_\lambda(S)=n\lambdaであるため、

Eλ[Uλ]=0,Var⁡λ(Uλ)=nλ,−Eλ[ℓ′′(λ)]=nλE_\lambda[U_\lambda]=0, \qquad \operatorname{Var}_\lambda(U_\lambda)=\frac n\lambda, \qquad -E_\lambda[\ell''(\lambda)]=\frac n\lambda

を得る。従って一観測の Fisher 情報量はI1(λ)=1/λI_1(\lambda)=1/\lambdaであり、標本全体の Fisher 情報量はIn(λ)=n/λI_n(\lambda)=n/\lambdaである。

観測値が(1,3,2,0,4)(1,3,2,0,4)である場合にはn=5n=5、S=10S=10である。score は0<λ<20<\lambda<2で正、λ>2\lambda>2で負であるから、対数尤度はλ=2\lambda=2で全域の一意な最大値をとる。従ってλ^=2\widehat\lambda=2であり、ℓ′′(2)=−10/4=−2.5\ell''(2)=-10/4=-2.5である。真値もλ=2\lambda=2ならば、標本全体の Fisher 情報量はI5(2)=5/2=2.5I_5(2)=5/2=2.5である。

この観測値に対する尤度を格子上で評価した数値記録でも、最大点はλ=2.0\lambda=2.0である。また、同じn=5n=5、真値λ=2\lambda=2の設定で200万回の標本を生成した数値記録では、score の標本平均は約−0.0007-0.0007、標本分散は約2.4972.497であり、理論値00と2.52.5に近い。

標本平均Xˉ\bar Xはλ\lambdaの不偏推定量であり、In(λ)=n/λI_n(\lambda)=n/\lambdaであるから、

Var⁡λ(Xˉ)=λn=1In(λ)\operatorname{Var}_\lambda(\bar X)=\frac\lambda n=\frac1{I_n(\lambda)}

を満たす。従ってXˉ\bar Xは Cramér–Rao 下界を達成し、有限標本で有効である。

例 3.2 (Bernoulli 標本平均).X1,…,XnX_1,\ldots,X_nを成功確率p∈(0,1)p\in(0,1)の Bernoulli 分布からの独立同分布標本とする。標本全体の score は

Up=∑i=1n(Xip−1−Xi1−p)=∑i=1nXi−npp(1−p)U_p =\sum_{i=1}^n\left(\frac{X_i}{p}-\frac{1-X_i}{1-p}\right) =\frac{\sum_{i=1}^nX_i-np}{p(1-p)}

である。§E11.5 命題 1.3によりEp[Up]=0E_p[U_p]=0であり、

In(p)=Ep[Up2]=Var⁡p(∑i=1nXi)p2(1−p)2=np(1−p).I_n(p)=E_p[U_p^2] =\frac{\operatorname{Var}_p(\sum_{i=1}^nX_i)}{p^2(1-p)^2} =\frac n{p(1-p)}.

また、p^=X‾\widehat p=\overline Xはppの不偏推定量であり、

Var⁡p(p^)=p(1−p)n=1In(p)\operatorname{Var}_p(\widehat p)=\frac{p(1-p)}n=\frac1{I_n(p)}

を満たす。従ってp^\widehat pはすべてのp∈(0,1)p\in(0,1)で Cramér–Rao 下界を達成し、有限標本で有効である。母数空間を[0,1][0,1]として尤度を最大化する場合には、p^=X‾\widehat p=\overline Xは最尤推定量でもある。

p=0.3p=0.3、n=100n=100のとき、一観測の Fisher 情報量は

I1(p)=10.3⋅0.7=4.76190…I_1(p)=\frac1{0.3\cdot0.7}=4.76190\ldots

であり、標本全体の情報量はI100(p)=476.190…I_{100}(p)=476.190\ldotsである。下界とp^\widehat pの分散はいずれも0.00210.0021であり、標準偏差は0.0021≈0.04583\sqrt{0.0021}\approx0.04583である。

例 3.3 (Bernoulli 標本における等号の非達成).X1,X2X_1,X_2を成功確率p∈(0,1)p\in(0,1)の Bernoulli 分布からの独立同分布標本とし、τ(p)=p2\tau(p)=p^2を推定する。δ=X1X2\delta=X_1X_2は成功確率p2p^2の Bernoulli 確率変数であるから、

Ep[δ]=p2,Var⁡p(δ)=p2(1−p2)E_p[\delta]=p^2, \qquad \operatorname{Var}_p(\delta)=p^2(1-p^2)

である。二観測の Fisher 情報量は

I2(p)=2p(1−p)I_2(p)=\frac2{p(1-p)}

であり、τ′(p)=2p\tau'(p)=2pである。したがって Cramér–Rao 下界は

τ′(p)2I2(p)=2p3(1−p)\frac{\tau'(p)^2}{I_2(p)}=2p^3(1-p)

となる。実際の分散と下界との差は

p2(1−p2)−2p3(1−p)=p2(1−p)2>0p^2(1-p^2)-2p^3(1-p)=p^2(1-p)^2>0

であるため、δ\deltaはどのp∈(0,1)p\in(0,1)でも下界を達成しない。

等号条件からも同じ結論を得る。標本全体の score は

Up=X1+X2−2pp(1−p)U_p=\frac{X_1+X_2-2p}{p(1-p)}

であるため、等号が成り立つならば

δ−p2=τ′(p)I2(p)Up=p(X1+X2−2p)\delta-p^2 =\frac{\tau'(p)}{I_2(p)}U_p =p(X_1+X_2-2p)

がほとんど確実に成り立つ。しかし、正の確率(1−p)2(1-p)^2をもつ標本点(X1,X2)=(0,0)(X_1,X_2)=(0,0)では、左辺が−p2-p^2、右辺が−2p2-2p^2であり、この等式は成り立たない。

注意 3.4 (母数に依存する台).X1,…,XnX_1,\ldots,X_nを[0,θ][0,\theta]上の一様分布からの独立同分布標本とし、θ>0\theta>0とする。密度

pθ(x1,…,xn)=θ−n1[0,θ]n(x1,…,xn)p_\theta(x_1,\ldots,x_n) =\theta^{-n}\mathbf1_{[0,\theta]^n}(x_1,\ldots,x_n)

の台はθ\thetaに依存するため、定義 1.1の固定台の仮定を満たさない。

M=max⁡1≤i≤nXiM=\max_{1\leq i\leq n}X_iと置く。0≤t≤θ0\leq t\leq\thetaに対して

Pθ(M≤t)=Pθ(X1≤t,…,Xn≤t)=(tθ)nP_\theta(M\leq t) =P_\theta(X_1\leq t,\ldots,X_n\leq t) =\left(\frac t\theta\right)^n

であるから、MMの密度はntn−1/θnnt^{n-1}/\theta^nである。従って任意のr>−nr>-nに対して

Eθ[Mr]=∫0θtrntn−1θn dt=nn+rθr.E_\theta[M^r] =\int_0^\theta t^r\frac{nt^{n-1}}{\theta^n}\,dt =\frac n{n+r}\theta^r.

特に、

Eθ[M]=nn+1θ,Var⁡θ(M)=n(n+1)2(n+2)θ2.E_\theta[M]=\frac n{n+1}\theta, \qquad \operatorname{Var}_\theta(M) =\frac{n}{(n+1)^2(n+2)}\theta^2.

M>0M>0である標本では最大値MMが尤度を最大にし、Pθ(M>0)=1P_\theta(M>0)=1であるためMMはほとんど確実に最尤推定量である。MMの偏りは−θ/(n+1)-\theta/(n+1)である。不偏補正した

θ~=n+1nM\widetilde\theta=\frac{n+1}{n}M

は

Eθ[θ~]=θ,Var⁡θ(θ~)=θ2n(n+2)E_\theta[\widetilde\theta]=\theta, \qquad \operatorname{Var}_\theta(\widetilde\theta)=\frac{\theta^2}{n(n+2)}

を満たす。

固定した標本点が台の内部にある範囲だけで対数密度を微分すると∂θlog⁡pθ=−n/θ\partial_\theta\log p_\theta=-n/\thetaとなり、その期待値は零ではない。規格化積分を微分するときには動く境界からの項が生じるため、密度の内部での微分を積分した値とは一致しない。従って命題 1.2と定理 2.1はこのモデルに適用されず、θ~\widetilde\thetaの分散を正則モデルの Cramér–Rao 下界と比較することはできない。

参考文献

  1. Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer Texts in Statistics, Springer, 1998.情報不等式、等号条件、および不偏推定量の有限標本における有効性を参考にした。
  2. A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998.score と Fisher 情報行列の多径数における定式化を参考にした。

前提記事