§E14.11許容性と minimax 推定

最終更新

正規母集団の平均ベクトルを二乗損失のもとで推定する場合、標本平均による推定を考えることができる。しかし、推定量を評価するには、母数ごとのリスクを一様に改善する推定量が存在するかという問いと、母数全体にわたる最大リスクをどこまで小さくすることができるかという問いを区別する必要がある。

前者に関わる許容性と、後者を定式化する minimax 性は、推定量の異なる側面を捉える基本概念である。共分散行列が既知の正の定数倍の単位行列である場合、三次元以上の正規平均に対して標本平均は minimax である。一方、James–Stein 型の縮小推定量はすべての母数で標本平均より小さいリスクをもち、標本平均は許容的でない。

本記事では、Bayes リスクによる許容性と minimax 性の判定を整え、正規平均の縮小推定において二つの基準が一致しないことを示す。

1 許容性と Bayes 推定量

定義 1.1 (許容性).§E14.6 定義 1.2の統計モデル、行動空間および損失関数を考える。二つの可測な決定則δ,δ′\delta,\delta'に対し、すべてのθ∈Θ\theta\in\Thetaで

Rθ(δ′)≤Rθ(δ)R_\theta(\delta')\leq R_\theta(\delta)

が成り立ち、さらに

Rθ0(δ′)<Rθ0(δ)R_{\theta_0}(\delta')<R_{\theta_0}(\delta)

を満たすθ0∈Θ\theta_0\in\Thetaが存在するとき、δ′\delta'はδ\deltaを 支配する (dominate) という。δ\deltaを支配する可測な決定則が存在しないとき、δ\deltaは 許容的 (admissible) であるという。

二つの決定則が各θ∈Θ\theta\in\ThetaについてPθP_\thetaに関してほとんど確実に等しいとき、両者を同値とする。この同値性では、例外となる零集合は母数ごとに異なってよい。

定理 1.2.§E14.8 定義 3.1の仮定のもとで、事前分布Π\Piに対する Bayes 推定量δΠ\delta_\Piが

rΠ(δΠ)<∞r_\Pi(\delta_\Pi)<\infty

を満たすとする。任意の Bayes 推定量δ\deltaがすべてのθ∈Θ\theta\in\Thetaについてδ=δΠ\delta=\delta_\Pi、PθP_\theta-ほとんど確実に成り立つならば、δΠ\delta_\Piは許容的である。

証明.δΠ\delta_\Piを支配する決定則δ\deltaが存在すると仮定する。リスクの不等式をΠ\Piで積分すると

rΠ(δ)≤rΠ(δΠ)r_\Pi(\delta)\leq r_\Pi(\delta_\Pi)

である。δΠ\delta_\Piの Bayes 最適性から逆向きの不等式も成り立つため、δ\deltaも Bayes 推定量である。仮定した一意性により、すべてのθ\thetaでδ=δΠ\delta=\delta_\Pi、PθP_\theta-ほとんど確実である。したがって、すべてのθ\thetaでRθ(δ)=Rθ(δΠ)R_\theta(\delta)=R_\theta(\delta_\Pi)となり、少なくとも一つの母数での狭義不等式に反する。よって支配する決定則は存在しない。▨

系 1.3.§E14.8 定義 3.1の仮定のもとで、事前予測分布をMΠ(dx)=m(x)μ(dx)M_\Pi(dx)=m(x)\mu(dx)とする。可測な決定則δΠ\delta_\Piが存在し、MΠM_\Piに関してほとんどすべてのxxで、a↦rx(a)a\mapsto r_x(a)がa=δΠ(x)a=\delta_\Pi(x)において一意な最小値を取るとする。さらに

rΠ(δΠ)<∞,Pθ≪MΠ(θ∈Θ)r_\Pi(\delta_\Pi)<\infty,\qquad P_\theta\ll M_\Pi\quad(\theta\in\Theta)

を仮定する。このときδΠ\delta_\Piは許容的である。

証明.§E14.8 定理 3.2によりδΠ\delta_\Piは Bayes 推定量である。任意の Bayes 推定量δ\deltaを取る。有限性の仮定と同じ定理の積分表示から、rx(δΠ(x))r_x(\delta_\Pi(x))とrx(δ(x))r_x(\delta(x))はMΠM_\Pi-ほとんど至る所で有限である。その集合上での非負の差は積分が零であるため、MΠM_\Pi-ほとんどすべてのxxで

rx(δ(x))=rx(δΠ(x))r_x(\delta(x))=r_x(\delta_\Pi(x))

となる。最小点の一意性からδ=δΠ\delta=\delta_\Pi、MΠM_\Pi-ほとんど確実である。各Pθ≪MΠP_\theta\ll M_\Piにより同じ等式が各PθP_\thetaに関してもほとんど確実に成り立つので、定理 1.2を適用することができる。▨

例 1.4. 母数空間、標本空間および行動空間をいずれも{0,1}\{0,1\}とし、零一損失

L(θ,a)=1{θ≠a}L(\theta,a)=\mathbf{1}_{\{\theta\ne a\}}

を用いる。標本分布をP0({0})=1P_0(\{0\})=1、P1({1})=1P_1(\{1\})=1とし、事前分布をΠ({0})=1\Pi(\{0\})=1とする。事前予測分布はMΠ=P0M_\Pi=P_0であり、観測値00における事後分布は母数00に集中する。したがって、事後平均損失の最小点はMΠM_\Pi-ほとんど確実に一意である。

決定則δΠ(x)=0\delta_\Pi(x)=0は Bayes 平均リスク零の Bayes 推定量である。一方、δ′(x)=x\delta'(x)=xと置くと、各母数におけるリスクは

θ\theta Rθ(δΠ)R_\theta(\delta_\Pi) Rθ(δ′)R_\theta(\delta')
00 00 00
11 11 00

となる。ゆえにδ′\delta'はδΠ\delta_\Piを支配し、δΠ\delta_\Piは許容的でない。この例ではMΠ({1})=0<P1({1})M_\Pi(\{1\})=0<P_1(\{1\})であり、P1≪MΠP_1\ll M_\Piが成り立たない。

2 最大リスクと事前分布による下界

定義 2.1 (minimax 推定量).§E14.6 定義 1.2の統計モデル、行動空間および損失関数を考える。すべての可測な決定則の集合をD\mathcal Dとする。

V=inf⁡δ∈Dsup⁡θ∈ΘRθ(δ)V=\inf_{\delta\in\mathcal D}\sup_{\theta\in\Theta}R_\theta(\delta)

を minimax 値 (minimax value) という。δ∗∈D\delta^*\in\mathcal Dがsup⁡θRθ(δ∗)=V\sup_\theta R_\theta(\delta^*)=Vを満たすとき、δ∗\delta^*を minimax 推定量 (minimax estimator) という。

定義 2.2 (最も不利な事前分布).§E14.8 定義 3.1の統計モデルと損失について、事前分布Π\Piに対する最小 Bayes 平均リスクを

b(Π)=inf⁡δ∈DrΠ(δ)b(\Pi)=\inf_{\delta\in\mathcal D}r_\Pi(\delta)

と書く。ここでD\mathcal Dはすべての可測な決定則の集合である。事前分布Π∗\Pi^*が、同じ母数空間と基準測度に対する任意の事前確率密度Π\Piについて

b(Π)≤b(Π∗)b(\Pi)\leq b(\Pi^*)

を満たすとき、Π∗\Pi^*を 最も不利な事前分布 (least favourable prior) という。

定理 2.3.§E14.8 定義 3.1の仮定のもとで、任意の事前分布Π\Piに対して

b(Π)≤Vb(\Pi)\leq V

が成り立つ。特に、ある事前分布Π∗\Pi^*と決定則δ∗\delta^*が

sup⁡θ∈ΘRθ(δ∗)=rΠ∗(δ∗)=b(Π∗)<∞\sup_{\theta\in\Theta}R_\theta(\delta^*) =r_{\Pi^*}(\delta^*)=b(\Pi^*)<\infty

を満たすならば、δ∗\delta^*は minimax 推定量であり、Π∗\Pi^*は最も不利な事前分布である。

証明. 任意の可測な決定則δ\deltaについて、Π\Piが確率測度であることから

sup⁡θ∈ΘRθ(δ)≥∫ΘRθ(δ) Π(dθ)=rΠ(δ)≥b(Π)\sup_{\theta\in\Theta}R_\theta(\delta) \geq\int_\Theta R_\theta(\delta)\,\Pi(d\theta) =r_\Pi(\delta)\geq b(\Pi)

である。δ\deltaについて下限を取るとV≥b(Π)V\geq b(\Pi)を得る。仮定を満たすΠ∗,δ∗\Pi^*,\delta^*に対しては

b(Π∗)≤V≤sup⁡θRθ(δ∗)=b(Π∗)b(\Pi^*)\leq V\leq\sup_\theta R_\theta(\delta^*)=b(\Pi^*)

であり、δ∗\delta^*は minimax である。任意の事前分布Π\Piに対してb(Π)≤V=b(Π∗)b(\Pi)\leq V=b(\Pi^*)なので、Π∗\Pi^*は最も不利である。▨

系 2.4.§E14.8 定義 3.1の統計モデルと損失について、決定則δ∗\delta^*と事前分布列(Πk)k≥1(\Pi_k)_{k\geq1}が

C=sup⁡θ∈ΘRθ(δ∗)<∞,b(Πk)⟶CC=\sup_{\theta\in\Theta}R_\theta(\delta^*)<\infty, \qquad b(\Pi_k)\longrightarrow C

を満たすならば、δ∗\delta^*は minimax 推定量であり、minimax 値はCCである。

証明.定理 2.3により各kkでb(Πk)≤V≤Cb(\Pi_k)\leq V\leq Cである。k→∞k\to\inftyとするとV=CV=Cを得る。▨

命題 2.5.n∈N≥1n\in\NN、p∈[0,1]p\in[0,1]とし、Y∼Bin⁡(n,p)Y\sim\operatorname{Bin}(n,p)を観測して、二乗損失(a−p)2(a-p)^2のもとでppを実数値の決定則によって推定する。このとき

δ∗(Y)=Y+n/2n+n\delta^*(Y)=\frac{Y+\sqrt n/2}{n+\sqrt n}

は minimax 推定量であり、minimax 値は1/[4(n+1)2]1/[4(\sqrt n+1)^2]である。また、Beta⁡(n/2,n/2)\operatorname{Beta}(\sqrt n/2,\sqrt n/2)は最も不利な事前分布である。

証明.a>0a>0とし、事前分布Beta⁡(a,a)\operatorname{Beta}(a,a)を取る。§E14.8 命題 4.2と§E14.8 命題 3.3により

δa(Y)=Y+an+2a\delta_a(Y)=\frac{Y+a}{n+2a}

は Bayes 推定量である。§E11.5 命題 1.3から、その分散はnp(1−p)/(n+2a)2np(1-p)/(n+2a)^2、偏りはa(1−2p)/(n+2a)a(1-2p)/(n+2a)である。したがって

Rp(δa)=np(1−p)+a2(1−2p)2(n+2a)2.R_p(\delta_a) =\frac{np(1-p)+a^2(1-2p)^2}{(n+2a)^2}.

a=n/2a=\sqrt n/2とすると、分子は

n[p(1−p)+14(1−2p)2]=n4n\left[p(1-p)+\frac14(1-2p)^2\right]=\frac n4

となる。リスクはすべてのp∈[0,1]p\in[0,1]で1/[4(n+1)2]1/[4(\sqrt n+1)^2]に等しい。最大リスクと Bayes 平均リスクが一致するので、定理 2.3から結論を得る。▨

3 正規平均の推定

命題 3.1.d∈N≥1d\in\NN、θ∈Rd\theta\in\R^dとし、X∼Nd(θ,Id)X\sim N_d(\theta,I_d)を観測して、損失L(θ,a)=∥a−θ∥2L(\theta,a)=\|a-\theta\|^2のもとでθ\thetaをRd\R^d値の決定則によって推定する。τ>0\tau>0に対する事前分布Πτ=Nd(0,τ2Id)\Pi_\tau=N_d(0,\tau^2I_d)の Bayes 推定量は

δτ(X)=cτX,cτ=τ21+τ2\delta_\tau(X)=c_\tau X,\qquad c_\tau=\frac{\tau^2}{1+\tau^2}

であり、各母数の標本分布に関する同値を除いて一意である。また、δτ\delta_\tauは許容的であり、

Rθ(δτ)=cτ2d+(1−cτ)2∥θ∥2,b(Πτ)=dcτR_\theta(\delta_\tau) =c_\tau^2d+(1-c_\tau)^2\|\theta\|^2, \qquad b(\Pi_\tau)=dc_\tau

が成り立つ。

証明.§E11.10 定理 5.1により、尤度と事前密度の積は各座標の正規密度の積に分かれる。§E14.8 命題 4.2 (2)をn=1n=1、μ0=0\mu_0=0、σ2=1\sigma^2=1として各座標へ適用すると、事後分布は

θ∣X=x∼Nd(cτx,cτId)\theta\mid X=x\sim N_d(c_\tau x,c_\tau I_d)

である。各座標の事後二次積率は有限である。§E14.8 命題 3.3の分解を座標について加えると、任意のa∈Rda\in\R^dについて

rx(a)=dcτ+∥a−cτx∥2r_x(a)=dc_\tau+\|a-c_\tau x\|^2

を得る。x↦cτxx\mapsto c_\tau xは可測である。§E14.8 定理 3.2の積分表示により、任意の可測な決定則δ\deltaについて

rΠτ(δ)=dcτ+∫Rd∥δ(x)−cτx∥2 MΠτ(dx)r_{\Pi_\tau}(\delta) =dc_\tau+ \int_{\R^d}\|\delta(x)-c_\tau x\|^2\,M_{\Pi_\tau}(dx)

である。したがってδτ(x)=cτx\delta_\tau(x)=c_\tau xは Bayes 推定量であり、b(Πτ)=dcτ<∞b(\Pi_\tau)=dc_\tau<\inftyである。さらに、δ\deltaも Bayes 推定量ならば、非負な積分項は零であるから、δ=δτ\delta=\delta_\tauがMΠτM_{\Pi_\tau}に関してほとんど確実に成り立つ。

予測密度

mτ(x)=∫Rdfθ(x)πτ(θ) dθm_\tau(x)=\int_{\R^d}f_\theta(x)\pi_\tau(\theta)\,d\theta

はすべてのxxで正である。実際、被積分関数はすべてのθ\thetaで正である。またfθ(x)≤(2π)−d/2f_\theta(x)\leq(2\pi)^{-d/2}なのでmτ(x)≤(2π)−d/2<∞m_\tau(x)\leq(2\pi)^{-d/2}<\inftyである。したがって、予測分布の零集合は Lebesgue 零集合であり、すべてのPθP_\thetaで零集合となる。ゆえに任意の Bayes 推定量は、すべてのθ\thetaについてδτ\delta_\tauとPθP_\theta-ほとんど確実に等しい。定理 1.2によりδτ\delta_\tauは許容的である。

X=θ+ZX=\theta+Z、Z∼Nd(0,Id)Z\sim N_d(0,I_d)と書くと

δτ(X)−θ=cτZ−(1−cτ)θ.\delta_\tau(X)-\theta=c_\tau Z-(1-c_\tau)\theta.

正規分布の平均と分散§E11.5 命題 2.5からE[Z]=0E[Z]=0、E∥Z∥2=dE\|Z\|^2=dである。二乗ノルムを展開して期待値を取ると、表示した固定母数リスクを得る。▨

命題 3.2.d∈N≥1d\in\NN、X∼Nd(θ,Id)X\sim N_d(\theta,I_d)、θ∈Rd\theta\in\R^dとし、損失を∥a−θ∥2\|a-\theta\|^2とする。通常の推定量δ0(X)=X\delta_0(X)=Xは minimax であり、minimax 値はddである。一方、任意の0<c<10<c<1に対してcXcXは許容的であるが minimax でない。

証明. 通常の推定量のリスクはRθ(δ0)=Eθ∥X−θ∥2=dR_\theta(\delta_0)=E_\theta\|X-\theta\|^2=dである。事前分布Πk=Nd(0,k2Id)\Pi_k=N_d(0,k^2I_d)を取ると、命題 3.1により

b(Πk)=dk21+k2⟶d.b(\Pi_k)=\frac{dk^2}{1+k^2}\longrightarrow d.

系 2.4によって minimax 値はddであり、δ0\delta_0は minimax である。

0<c<10<c<1に対してτ2=c/(1−c)\tau^2=c/(1-c)とすればc=cτc=c_\tauである。命題 3.1からcXcXは許容的であるが、その最大リスクは

sup⁡θ∈Rd{c2d+(1−c)2∥θ∥2}=∞\sup_{\theta\in\R^d}\{c^2d+(1-c)^2\|\theta\|^2\}=\infty

なので minimax ではない。▨

命題 3.3.d,n∈N≥1d,n\in\NN、σ2>0\sigma^2>0とする。Y1,…,YnY_1,\ldots,Y_nは独立にNd(μ,σ2Id)N_d(\mu,\sigma^2I_d)に従い、μ∈Rd\mu\in\R^dは未知、σ2\sigma^2は既知であるとする。二乗損失L(μ,a)=∥a−μ∥2L(\mu,a)=\|a-\mu\|^2のもとで、すべての Borel 可測な決定則

δ:(Rd)n⟶Rd\delta:(\R^d)^n\longrightarrow\R^d

を比較する。このとき標本平均Y‾=n−1∑j=1nYj\overline Y=n^{-1}\sum_{j=1}^nY_jは minimax 推定量であり、minimax 値はdσ2/nd\sigma^2/nである。

証明.τ>0\tau>0とし、μ\muの事前分布をΠτ=Nd(0,τ2Id)\Pi_\tau=N_d(0,\tau^2I_d)とする。§E14.8 命題 4.2 (2)を各座標へ適用すると、全標本Y=(Y1,…,Yn)Y=(Y_1,\ldots,Y_n)のもとでの事後分布は

μ∣Y∼Nd(cτ,nY‾,vτ,nId),vτ,n=(1τ2+nσ2)−1,cτ,n=nτ2σ2+nτ2\mu\mid Y \sim N_d(c_{\tau,n}\overline Y,v_{\tau,n}I_d), \qquad v_{\tau,n}=\left(\frac1{\tau^2}+\frac n{\sigma^2}\right)^{-1}, \qquad c_{\tau,n}=\frac{n\tau^2}{\sigma^2+n\tau^2}

である。§E14.8 命題 3.3の平方差分解を各座標について加え、§E14.8 定理 3.2で事前予測について積分すると、全標本から作る任意の可測な決定則δ\deltaに対して

rΠτ(δ)=dvτ,n+EMΠτ ⁣[∥δ(Y)−cτ,nY‾∥2].r_{\Pi_\tau}(\delta) =dv_{\tau,n} +E_{M_{\Pi_\tau}}\!\left[\|\delta(Y)-c_{\tau,n}\overline Y\|^2\right].

したがって、この決定問題における最小 Bayes 平均リスクは

b(Πτ)=dvτ,n=dτ2σ2σ2+nτ2⟶dσ2nb(\Pi_\tau)=dv_{\tau,n} =\frac{d\tau^2\sigma^2}{\sigma^2+n\tau^2} \longrightarrow\frac{d\sigma^2}{n}

である。

各YjY_jの座標は独立な一変量正規変数であり、標本間も独立である。したがって、全標本の座標を並べたベクトルに§E11.10 定理 4.2を適用し、さらに標本平均を与える線形写像を取ると

Y‾∼Nd ⁣(μ,σ2nId)\overline Y\sim N_d\!\left(\mu,\frac{\sigma^2}{n}I_d\right)

を得る。ゆえに、すべてのμ∈Rd\mu\in\R^dについて

Rμ(Y‾)=Eμ∥Y‾−μ∥2=dσ2n.R_\mu(\overline Y)=E_\mu\|\overline Y-\mu\|^2 =\frac{d\sigma^2}{n}.

系 2.4を事前分布列(Πk)k∈N≥1(\Pi_k)_{k\in\NN}へ適用すると、標本平均は minimax であり、minimax 値はdσ2/nd\sigma^2/nである。▨

4 Stein の恒等式と縮小推定

補題 4.1 (Stein の補題).d∈N≥1d\in\NN、θ∈Rd\theta\in\R^d、X∼Nd(θ,Id)X\sim N_d(\theta,I_d)とする。g:Rd→Rdg:\R^d\to\R^dを Borel 可測とする。各i∈{1,…,d}i\in\{1,\ldots,d\}について、他のd−1d-1座標に関する Lebesgue 測度でほとんどすべての座標線上で、gig_iは第ii座標の関数として局所絶対連続であるとする。d=1d=1ではg1g_1がR\R上で局所絶対連続であるとする。∂igi\partial_i g_iを、ほとんど至る所に存在する偏導関数の有限値可測な代表とし、

Eθ[gi(X)2]<∞,Eθ[∣∂igi(X)∣]<∞E_\theta[g_i(X)^2]<\infty, \qquad E_\theta[|\partial_i g_i(X)|]<\infty

を仮定する。このとき

Eθ[(Xi−θi)gi(X)]=Eθ[∂igi(X)](1≤i≤d)E_\theta[(X_i-\theta_i)g_i(X)] =E_\theta[\partial_i g_i(X)] \qquad(1\leq i\leq d)

が成り立つ。

証明. 第ii座標をtt、残りの座標をyyと書く。§E11.10 定理 5.1により、XXの密度はϕθi(t)ϕθ−i(y)\phi_{\theta_i}(t)\phi_{\theta_{-i}}(y)と分解される。ただし

ϕθi(t)=(2π)−1/2e−(t−θi)2/2,ϕθi′(t)=−(t−θi)ϕθi(t)\phi_{\theta_i}(t)=(2\pi)^{-1/2}e^{-(t-\theta_i)^2/2}, \qquad \phi_{\theta_i}'(t)=-(t-\theta_i)\phi_{\theta_i}(t)

である。d=1d=1の場合、以下のyyに関する積分は不要である。

各R≥1R\geq1に対して関数χR:R→[0,1]\chi_R:\R\to[0,1]を

χR(t)={1,∣t∣≤R,2−∣t∣/R,R<∣t∣<2R,0,∣t∣≥2R\chi_R(t)= \begin{cases} 1,&|t|\leq R,\\ 2-|t|/R,&R<|t|<2R,\\ 0,&|t|\geq2R \end{cases}

と定める。χR\chi_RはR\R上で絶対連続であり、ほとんど至る所∣χR′∣≤1/R|\chi_R'|\leq1/Rを満たす。

gig_iが局所絶対連続である座標線を固定する。§E10.2 定理 3.1 (2)によりgi(t,y)χR(t)g_i(t,y)\chi_R(t)は[−2R,2R][-2R,2R]上で絶対連続である。§E10.2 定理 3.3をこの関数とϕθi\phi_{\theta_i}に適用すると、χR(±2R)=0\chi_R(\pm2R)=0なので境界項は零となり、

∫R(t−θi)gi(t,y)χR(t)ϕθi(t) dt=∫R∂igi(t,y)χR(t)ϕθi(t) dt+∫Rgi(t,y)χR′(t)ϕθi(t) dt\begin{aligned} &\int_\R(t-\theta_i)g_i(t,y)\chi_R(t)\phi_{\theta_i}(t)\,dt\\ &\quad=\int_\R\partial_i g_i(t,y)\chi_R(t)\phi_{\theta_i}(t)\,dt +\int_\R g_i(t,y)\chi_R'(t)\phi_{\theta_i}(t)\,dt \end{aligned}

を得る。

§E11.4 定理 2.2から

Eθ[∣(Xi−θi)gi(X)∣]≤(Eθ[gi(X)2])1/2<∞,Eθ∣gi(X)∣<∞E_\theta[|(X_i-\theta_i)g_i(X)|] \leq \bigl(E_\theta[g_i(X)^2]\bigr)^{1/2}<\infty, \qquad E_\theta|g_i(X)|<\infty

である。偏導関数の積分条件も合わせると、有限RRでの三つの積分はyyについて積分した後も絶対可積分である。したがって§E9.11 定理 3.2により

Eθ[(Xi−θi)gi(X)χR(Xi)]=Eθ[∂igi(X)χR(Xi)]+Eθ[gi(X)χR′(Xi)]E_\theta[(X_i-\theta_i)g_i(X)\chi_R(X_i)] =E_\theta[\partial_i g_i(X)\chi_R(X_i)] +E_\theta[g_i(X)\chi_R'(X_i)]

となる。局所絶対連続性を満たさない座標線の集合は、yyの正規分布に関しても零集合である。

切断の微分を含む項は

∣Eθ[gi(X)χR′(Xi)]∣≤1REθ∣gi(X)∣⟶0\left|E_\theta[g_i(X)\chi_R'(X_i)]\right| \leq\frac1R E_\theta|g_i(X)|\longrightarrow0

を満たす。χR(Xi)→1\chi_R(X_i)\to1、0≤χR≤10\leq\chi_R\leq1であるから、残る二項にはそれぞれ∣(Xi−θi)gi(X)∣|(X_i-\theta_i)g_i(X)|と∣∂igi(X)∣|\partial_i g_i(X)|を支配関数として§E9.7 定理 3.2を適用することができる。整数R→∞R\to\inftyとして主張を得る。▨

例 4.2.X∼N(0,1)X\sim N(0,1)とし、g(x)=1(0,∞)(x)g(x)=\mathbf1_{(0,\infty)}(x)とおく。ggは原点以外で微分可能であり、g′=0g'=0がほとんど至る所で成り立つ。またE[g(X)2]=1/2E[g(X)^2]=1/2である。しかし、標準正規密度をϕ\phiとすると

E[Xg(X)]=∫0∞xϕ(x) dx=lim⁡R→∞{ϕ(0)−ϕ(R)}=12π>0=E[g′(X)].E[Xg(X)]=\int_0^\infty x\phi(x)\,dx =\lim_{R\to\infty}\{\phi(0)-\phi(R)\} =\frac1{\sqrt{2\pi}}>0=E[g'(X)].

したがって、補題 4.1の局所絶対連続性を、ほとんど至る所での微分可能性だけに置き換えることができない。

命題 4.3.X∼Nd(θ,Id)X\sim N_d(\theta,I_d)、θ∈Rd\theta\in\R^dとし、ggが補題 4.1の仮定を満たすとする。損失∥a−θ∥2\|a-\theta\|^2のもとで、δ(X)=X+g(X)\delta(X)=X+g(X)のリスクは有限であり、

Rθ(δ)=d+Eθ[∥g(X)∥2+2∑i=1d∂igi(X)]R_\theta(\delta) =d+E_\theta\left[\|g(X)\|^2+2\sum_{i=1}^d\partial_i g_i(X)\right]

である。

証明.∥X+g(X)−θ∥2\|X+g(X)-\theta\|^2を展開する。Eθ∥X−θ∥2=dE_\theta\|X-\theta\|^2=d、Eθ∥g(X)∥2<∞E_\theta\|g(X)\|^2<\inftyであり、交差項も Cauchy–Schwarz の不等式によって可積分である。したがって

Rθ(δ)=d+Eθ∥g(X)∥2+2∑i=1dEθ[(Xi−θi)gi(X)].R_\theta(\delta) =d+E_\theta\|g(X)\|^2 +2\sum_{i=1}^dE_\theta[(X_i-\theta_i)g_i(X)].

各交差項へ補題 4.1を適用すると結論を得る。▨

補題 4.4.d≥3d\geq3、θ∈Rd\theta\in\R^d、X∼Nd(θ,Id)X\sim N_d(\theta,I_d)とする。∥x∥−2\|x\|^{-2}を原点で零と補完すると

0<Eθ[∥X∥−2]<∞0<E_\theta[\|X\|^{-2}]<\infty

である。

証明. Gaussian 密度はM=(2π)−d/2M=(2\pi)^{-d/2}以下である。k∈N≥0k\in\Nに対して

Ak={x∈Rd:2−(k+1)<∥x∥≤2−k}A_k=\{x\in\R^d:2^{-(k+1)}<\|x\|\leq2^{-k}\}

とおく。AkA_k上では∥x∥−2≤22k+2\|x\|^{-2}\leq2^{2k+2}であり、AkA_kは一辺21−k2^{1-k}の立方体に含まれる。したがって、Lebesgue 測度をλd\lambda_dと書くと

∫0<∥x∥≤1∥x∥−2fθ(x) dx≤M∑k=0∞22k+2λd(Ak)≤M2d+2∑k=0∞2−k(d−2)<∞.\int_{0<\|x\|\leq1}\|x\|^{-2}f_\theta(x)\,dx \leq M\sum_{k=0}^\infty2^{2k+2}\lambda_d(A_k) \leq M2^{d+2}\sum_{k=0}^\infty2^{-k(d-2)}<\infty.

∥x∥>1\|x\|>1では∥x∥−2≤1\|x\|^{-2}\leq1なので、球外の積分は11以下である。Pθ(X=0)=0P_\theta(X=0)=0であり、被積分関数は原点以外で正であるため、期待値は正である。▨

定義 4.5 (James–Stein 推定量).d≥3d\geq3とする。実数aaに対して、Borel 可測な決定則δa:Rd→Rd\delta_a:\R^d\to\R^dを

δa(x)={(1−a∥x∥2)x,x≠0,0,x=0\delta_a(x)= \begin{cases} \displaystyle\left(1-\frac a{\|x\|^2}\right)x,&x\ne0,\\ 0,&x=0 \end{cases}

と定める。δd−2\delta_{d-2}を James–Stein 推定量 (James–Stein estimator) といい、δJS\delta_{\mathrm{JS}}と書く。

定理 4.6 (James–Stein).d≥3d\geq3、θ∈Rd\theta\in\R^d、X∼Nd(θ,Id)X\sim N_d(\theta,I_d)とし、損失をL(θ,b)=∥b−θ∥2L(\theta,b)=\|b-\theta\|^2とする。実数aaに対して、定義 4.5の決定則は

Rθ(δa)=d+{a2−2a(d−2)}Eθ[∥X∥−2]R_\theta(\delta_a) =d+\{a^2-2a(d-2)\}E_\theta[\|X\|^{-2}]

を満たす。特に0<a<2(d−2)0<a<2(d-2)ならば、すべてのθ∈Rd\theta\in\R^dでRθ(δa)<dR_\theta(\delta_a)<dであり、通常の推定量XXは許容的でない。James–Stein 推定量は、各θ\thetaにおいて、この族の中で最小のリスクをもつ。

証明.g(x)=δa(x)−xg(x)=\delta_a(x)-xとおく。x≠0x\ne0では

gi(x)=−axi∥x∥2,∂igi(x)=−a∥x∥2+2axi2∥x∥4.g_i(x)=-\frac{ax_i}{\|x\|^2}, \qquad \partial_i g_i(x)=-\frac a{\|x\|^2}+\frac{2ax_i^2}{\|x\|^4}.

第ii座標以外の座標がすべて零となる場合を除けば、各座標線は原点を通らず、その線上でgig_iはC1C^1である。除いた座標の集合はRd−1\R^{d-1}の一点であるから Lebesgue 零集合である。また、

gi(x)2≤a2∥x∥2,∣∂igi(x)∣≤3∣a∣∥x∥2g_i(x)^2\leq\frac{a^2}{\|x\|^2}, \qquad |\partial_i g_i(x)|\leq\frac{3|a|}{\|x\|^2}

であり、補題 4.4により必要な積分条件を満たす。

x≠0x\ne0で

∥g(x)∥2=a2∥x∥2,∑i=1d∂igi(x)=−ad∥x∥2+2a∑ixi2∥x∥4=−a(d−2)∥x∥2\|g(x)\|^2=\frac{a^2}{\|x\|^2}, \qquad \sum_{i=1}^d\partial_i g_i(x) =-\frac{ad}{\|x\|^2}+\frac{2a\sum_i x_i^2}{\|x\|^4} =-\frac{a(d-2)}{\|x\|^2}

である。命題 4.3へ代入するとリスクの式を得る。0<a<2(d−2)0<a<2(d-2)では係数a{a−2(d−2)}a\{a-2(d-2)\}が負であり、逆二乗ノルムの期待値は正なので、すべてのθ\thetaで狭義改善が成り立つ。

係数は

a2−2a(d−2)={a−(d−2)}2−(d−2)2a^2-2a(d-2)=\{a-(d-2)\}^2-(d-2)^2

と書くことができる。したがって、この族の中ではa=d−2a=d-2が各母数におけるリスクを最小にする。▨

系 4.7.d≥3d\geq3、X∼Nd(θ,Id)X\sim N_d(\theta,I_d)、θ∈Rd\theta\in\R^dとし、損失をL(θ,b)=∥b−θ∥2L(\theta,b)=\|b-\theta\|^2とする。0<a<2(d−2)0<a<2(d-2)ならば、定理 4.6のδa\delta_aは minimax 推定量である。したがって、通常の推定量XXは minimax であっても許容的でない。

証明.定理 4.6によりsup⁡θRθ(δa)≤d\sup_\theta R_\theta(\delta_a)\leq dである。命題 3.2の minimax 値はddなので、最大リスクはddに等しく、δa\delta_aは minimax である。通常の推定量については命題 3.2と定理 4.6を合わせると結論を得る。▨

系 4.8.d≥3d\geq3、n∈N≥1n\in\NN、σ2>0\sigma^2>0とする。Y1,…,YnY_1,\ldots,Y_nは独立にNd(μ,σ2Id)N_d(\mu,\sigma^2I_d)に従い、μ∈Rd\mu\in\R^dは未知、σ2\sigma^2は既知であるとする。標本平均をYˉ=n−1∑j=1nYj\bar Y=n^{-1}\sum_{j=1}^nY_j、v=σ2/nv=\sigma^2/nとおく。損失L(μ,b)=∥b−μ∥2L(\mu,b)=\|b-\mu\|^2のもとで、実数aaに対する決定則

μ^a={(1−av∥Yˉ∥2)Yˉ,Yˉ≠0,0,Yˉ=0\widehat\mu_a= \begin{cases} \displaystyle\left(1-\frac{av}{\|\bar Y\|^2}\right)\bar Y,&\bar Y\ne0,\\ 0,&\bar Y=0 \end{cases}

は

Rμ(μ^a)=dv+v2{a2−2a(d−2)}Eμ[∥Yˉ∥−2]R_\mu(\widehat\mu_a) =dv+v^2\{a^2-2a(d-2)\}E_\mu[\|\bar Y\|^{-2}]

を満たす。特に0<a<2(d−2)0<a<2(d-2)ならば、すべてのμ\muでRμ(μ^a)<dv=Rμ(Yˉ)R_\mu(\widehat\mu_a)<dv=R_\mu(\bar Y)となり、標本平均は許容的でない。

証明.n≥2n\geq2では§E14.3 定理 4.1を各座標へ適用すると、Yˉi∼N(μi,v)\bar Y_i\sim N(\mu_i,v)である。n=1n=1では同じ分布は仮定そのものである。各YjY_jの密度が座標ごとの積に分かれ、標本間も独立であるから、異なる座標の標本列は独立である。したがって、Yˉ\bar Yの座標も独立であり、Yˉ∼Nd(μ,vId)\bar Y\sim N_d(\mu,vI_d)である。

X=Yˉ/vX=\bar Y/\sqrt v、θ=μ/v\theta=\mu/\sqrt vとおくとX∼Nd(θ,Id)X\sim N_d(\theta,I_d)であり、μ^a=v δa(X)\widehat\mu_a=\sqrt v\,\delta_a(X)である。よって

∥μ^a−μ∥2=v∥δa(X)−θ∥2,∥X∥−2=v∥Yˉ∥−2\|\widehat\mu_a-\mu\|^2=v\|\delta_a(X)-\theta\|^2, \qquad \|X\|^{-2}=v\|\bar Y\|^{-2}

が原点以外で成り立つ。定理 4.6のリスクをvv倍すると表示式と狭義改善を得る。▨

前提記事

11 本の記事・単元を表示