1 許容性と Bayes 推定量
定義 1.1 (許容性).§E14.6 定義 1.2の統計モデル、行動空間および損失関数を考える。二つの可測な決定則δ,δ′に対し、すべてのθ∈Θで
Rθ(δ′)≤Rθ(δ)が成り立ち、さらに
Rθ0(δ′)<Rθ0(δ)を満たすθ0∈Θが存在するとき、δ′はδを 支配する (dominate) という。δを支配する可測な決定則が存在しないとき、δは 許容的 (admissible) であるという。
二つの決定則が各θ∈ΘについてPθに関してほとんど確実に等しいとき、両者を同値とする。この同値性では、例外となる零集合は母数ごとに異なってよい。
定理 1.2.§E14.8 定義 3.1の仮定のもとで、事前分布Πに対する Bayes 推定量δΠが
rΠ(δΠ)<∞を満たすとする。任意の Bayes 推定量δがすべてのθ∈Θについてδ=δΠ、Pθ-ほとんど確実に成り立つならば、δΠは許容的である。
証明.δΠを支配する決定則δが存在すると仮定する。リスクの不等式をΠで積分すると
rΠ(δ)≤rΠ(δΠ)である。δΠの Bayes 最適性から逆向きの不等式も成り立つため、δも Bayes 推定量である。仮定した一意性により、すべてのθでδ=δΠ、Pθ-ほとんど確実である。したがって、すべてのθでRθ(δ)=Rθ(δΠ)となり、少なくとも一つの母数での狭義不等式に反する。よって支配する決定則は存在しない。▨
系 1.3.§E14.8 定義 3.1の仮定のもとで、事前予測分布をMΠ(dx)=m(x)μ(dx)とする。可測な決定則δΠが存在し、MΠに関してほとんどすべてのxで、a↦rx(a)がa=δΠ(x)において一意な最小値を取るとする。さらに
rΠ(δΠ)<∞,Pθ≪MΠ(θ∈Θ)を仮定する。このときδΠは許容的である。
証明.§E14.8 定理 3.2によりδΠは Bayes 推定量である。任意の Bayes 推定量δを取る。有限性の仮定と同じ定理の積分表示から、rx(δΠ(x))とrx(δ(x))はMΠ-ほとんど至る所で有限である。その集合上での非負の差は積分が零であるため、MΠ-ほとんどすべてのxで
rx(δ(x))=rx(δΠ(x))となる。最小点の一意性からδ=δΠ、MΠ-ほとんど確実である。各Pθ≪MΠにより同じ等式が各Pθに関してもほとんど確実に成り立つので、定理 1.2を適用することができる。▨
例 1.4. 母数空間、標本空間および行動空間をいずれも{0,1}とし、零一損失
L(θ,a)=1{θ=a}を用いる。標本分布をP0({0})=1、P1({1})=1とし、事前分布をΠ({0})=1とする。事前予測分布はMΠ=P0であり、観測値0における事後分布は母数0に集中する。したがって、事後平均損失の最小点はMΠ-ほとんど確実に一意である。
決定則δΠ(x)=0は Bayes 平均リスク零の Bayes 推定量である。一方、δ′(x)=xと置くと、各母数におけるリスクは
| θ |
Rθ(δΠ) |
Rθ(δ′) |
| 0 |
0 |
0 |
| 1 |
1 |
0 |
となる。ゆえにδ′はδΠを支配し、δΠは許容的でない。この例ではMΠ({1})=0<P1({1})であり、P1≪MΠが成り立たない。
2 最大リスクと事前分布による下界
定義 2.1 (minimax 推定量).§E14.6 定義 1.2の統計モデル、行動空間および損失関数を考える。すべての可測な決定則の集合をDとする。
V=δ∈Dinfθ∈ΘsupRθ(δ)を minimax 値 (minimax value) という。δ∗∈DがsupθRθ(δ∗)=Vを満たすとき、δ∗を minimax 推定量 (minimax estimator) という。
定義 2.2 (最も不利な事前分布).§E14.8 定義 3.1の統計モデルと損失について、事前分布Πに対する最小 Bayes 平均リスクを
b(Π)=δ∈DinfrΠ(δ)と書く。ここでDはすべての可測な決定則の集合である。事前分布Π∗が、同じ母数空間と基準測度に対する任意の事前確率密度Πについて
b(Π)≤b(Π∗)を満たすとき、Π∗を 最も不利な事前分布 (least favourable prior) という。
定理 2.3.§E14.8 定義 3.1の仮定のもとで、任意の事前分布Πに対して
b(Π)≤Vが成り立つ。特に、ある事前分布Π∗と決定則δ∗が
θ∈ΘsupRθ(δ∗)=rΠ∗(δ∗)=b(Π∗)<∞を満たすならば、δ∗は minimax 推定量であり、Π∗は最も不利な事前分布である。
証明. 任意の可測な決定則δについて、Πが確率測度であることから
θ∈ΘsupRθ(δ)≥∫ΘRθ(δ)Π(dθ)=rΠ(δ)≥b(Π)である。δについて下限を取るとV≥b(Π)を得る。仮定を満たすΠ∗,δ∗に対しては
b(Π∗)≤V≤θsupRθ(δ∗)=b(Π∗)であり、δ∗は minimax である。任意の事前分布Πに対してb(Π)≤V=b(Π∗)なので、Π∗は最も不利である。▨
系 2.4.§E14.8 定義 3.1の統計モデルと損失について、決定則δ∗と事前分布列(Πk)k≥1が
C=θ∈ΘsupRθ(δ∗)<∞,b(Πk)⟶Cを満たすならば、δ∗は minimax 推定量であり、minimax 値はCである。
証明.定理 2.3により各kでb(Πk)≤V≤Cである。k→∞とするとV=Cを得る。▨
命題 2.5.n∈N≥1、p∈[0,1]とし、Y∼Bin(n,p)を観測して、二乗損失(a−p)2のもとでpを実数値の決定則によって推定する。このとき
δ∗(Y)=n+nY+n/2は minimax 推定量であり、minimax 値は1/[4(n+1)2]である。また、Beta(n/2,n/2)は最も不利な事前分布である。
証明.a>0とし、事前分布Beta(a,a)を取る。§E14.8 命題 4.2と§E14.8 命題 3.3により
δa(Y)=n+2aY+aは Bayes 推定量である。§E11.5 命題 1.3から、その分散はnp(1−p)/(n+2a)2、偏りはa(1−2p)/(n+2a)である。したがって
Rp(δa)=(n+2a)2np(1−p)+a2(1−2p)2.a=n/2とすると、分子は
n[p(1−p)+41(1−2p)2]=4nとなる。リスクはすべてのp∈[0,1]で1/[4(n+1)2]に等しい。最大リスクと Bayes 平均リスクが一致するので、定理 2.3から結論を得る。▨
3 正規平均の推定
命題 3.1.d∈N≥1、θ∈Rdとし、X∼Nd(θ,Id)を観測して、損失L(θ,a)=∥a−θ∥2のもとでθをRd値の決定則によって推定する。τ>0に対する事前分布Πτ=Nd(0,τ2Id)の Bayes 推定量は
δτ(X)=cτX,cτ=1+τ2τ2であり、各母数の標本分布に関する同値を除いて一意である。また、δτは許容的であり、
Rθ(δτ)=cτ2d+(1−cτ)2∥θ∥2,b(Πτ)=dcτが成り立つ。
証明.§E11.10 定理 5.1により、尤度と事前密度の積は各座標の正規密度の積に分かれる。§E14.8 命題 4.2 (2)をn=1、μ0=0、σ2=1として各座標へ適用すると、事後分布は
θ∣X=x∼Nd(cτx,cτId)である。各座標の事後二次積率は有限である。§E14.8 命題 3.3の分解を座標について加えると、任意のa∈Rdについて
rx(a)=dcτ+∥a−cτx∥2を得る。x↦cτxは可測である。§E14.8 定理 3.2の積分表示により、任意の可測な決定則δについて
rΠτ(δ)=dcτ+∫Rd∥δ(x)−cτx∥2MΠτ(dx)である。したがってδτ(x)=cτxは Bayes 推定量であり、b(Πτ)=dcτ<∞である。さらに、δも Bayes 推定量ならば、非負な積分項は零であるから、δ=δτがMΠτに関してほとんど確実に成り立つ。
予測密度
mτ(x)=∫Rdfθ(x)πτ(θ)dθはすべてのxで正である。実際、被積分関数はすべてのθで正である。またfθ(x)≤(2π)−d/2なのでmτ(x)≤(2π)−d/2<∞である。したがって、予測分布の零集合は Lebesgue 零集合であり、すべてのPθで零集合となる。ゆえに任意の Bayes 推定量は、すべてのθについてδτとPθ-ほとんど確実に等しい。定理 1.2によりδτは許容的である。
X=θ+Z、Z∼Nd(0,Id)と書くと
δτ(X)−θ=cτZ−(1−cτ)θ.正規分布の平均と分散§E11.5 命題 2.5からE[Z]=0、E∥Z∥2=dである。二乗ノルムを展開して期待値を取ると、表示した固定母数リスクを得る。▨
命題 3.2.d∈N≥1、X∼Nd(θ,Id)、θ∈Rdとし、損失を∥a−θ∥2とする。通常の推定量δ0(X)=Xは minimax であり、minimax 値はdである。一方、任意の0<c<1に対してcXは許容的であるが minimax でない。
証明. 通常の推定量のリスクはRθ(δ0)=Eθ∥X−θ∥2=dである。事前分布Πk=Nd(0,k2Id)を取ると、命題 3.1により
b(Πk)=1+k2dk2⟶d.系 2.4によって minimax 値はdであり、δ0は minimax である。
0<c<1に対してτ2=c/(1−c)とすればc=cτである。命題 3.1からcXは許容的であるが、その最大リスクは
θ∈Rdsup{c2d+(1−c)2∥θ∥2}=∞なので minimax ではない。▨
命題 3.3.d,n∈N≥1、σ2>0とする。Y1,…,Ynは独立にNd(μ,σ2Id)に従い、μ∈Rdは未知、σ2は既知であるとする。二乗損失L(μ,a)=∥a−μ∥2のもとで、すべての Borel 可測な決定則
δ:(Rd)n⟶Rdを比較する。このとき標本平均Y=n−1∑j=1nYjは minimax 推定量であり、minimax 値はdσ2/nである。
証明.τ>0とし、μの事前分布をΠτ=Nd(0,τ2Id)とする。§E14.8 命題 4.2 (2)を各座標へ適用すると、全標本Y=(Y1,…,Yn)のもとでの事後分布は
μ∣Y∼Nd(cτ,nY,vτ,nId),vτ,n=(τ21+σ2n)−1,cτ,n=σ2+nτ2nτ2である。§E14.8 命題 3.3の平方差分解を各座標について加え、§E14.8 定理 3.2で事前予測について積分すると、全標本から作る任意の可測な決定則δに対して
rΠτ(δ)=dvτ,n+EMΠτ[∥δ(Y)−cτ,nY∥2].したがって、この決定問題における最小 Bayes 平均リスクは
b(Πτ)=dvτ,n=σ2+nτ2dτ2σ2⟶ndσ2である。
各Yjの座標は独立な一変量正規変数であり、標本間も独立である。したがって、全標本の座標を並べたベクトルに§E11.10 定理 4.2を適用し、さらに標本平均を与える線形写像を取ると
Y∼Nd(μ,nσ2Id)を得る。ゆえに、すべてのμ∈Rdについて
Rμ(Y)=Eμ∥Y−μ∥2=ndσ2.系 2.4を事前分布列(Πk)k∈N≥1へ適用すると、標本平均は minimax であり、minimax 値はdσ2/nである。▨
4 Stein の恒等式と縮小推定
補題 4.1 (Stein の補題).d∈N≥1、θ∈Rd、X∼Nd(θ,Id)とする。g:Rd→Rdを Borel 可測とする。各i∈{1,…,d}について、他のd−1座標に関する Lebesgue 測度でほとんどすべての座標線上で、giは第i座標の関数として局所絶対連続であるとする。d=1ではg1がR上で局所絶対連続であるとする。∂igiを、ほとんど至る所に存在する偏導関数の有限値可測な代表とし、
Eθ[gi(X)2]<∞,Eθ[∣∂igi(X)∣]<∞を仮定する。このとき
Eθ[(Xi−θi)gi(X)]=Eθ[∂igi(X)](1≤i≤d)が成り立つ。
証明. 第i座標をt、残りの座標をyと書く。§E11.10 定理 5.1により、Xの密度はϕθi(t)ϕθ−i(y)と分解される。ただし
ϕθi(t)=(2π)−1/2e−(t−θi)2/2,ϕθi′(t)=−(t−θi)ϕθi(t)である。d=1の場合、以下のyに関する積分は不要である。
各R≥1に対して関数χR:R→[0,1]を
χR(t)=⎩⎨⎧1,2−∣t∣/R,0,∣t∣≤R,R<∣t∣<2R,∣t∣≥2Rと定める。χRはR上で絶対連続であり、ほとんど至る所∣χR′∣≤1/Rを満たす。
giが局所絶対連続である座標線を固定する。§E10.2 定理 3.1 (2)によりgi(t,y)χR(t)は[−2R,2R]上で絶対連続である。§E10.2 定理 3.3をこの関数とϕθiに適用すると、χR(±2R)=0なので境界項は零となり、
∫R(t−θi)gi(t,y)χR(t)ϕθi(t)dt=∫R∂igi(t,y)χR(t)ϕθi(t)dt+∫Rgi(t,y)χR′(t)ϕθi(t)dtを得る。
§E11.4 定理 2.2から
Eθ[∣(Xi−θi)gi(X)∣]≤(Eθ[gi(X)2])1/2<∞,Eθ∣gi(X)∣<∞である。偏導関数の積分条件も合わせると、有限Rでの三つの積分はyについて積分した後も絶対可積分である。したがって§E9.11 定理 3.2により
Eθ[(Xi−θi)gi(X)χR(Xi)]=Eθ[∂igi(X)χR(Xi)]+Eθ[gi(X)χR′(Xi)]となる。局所絶対連続性を満たさない座標線の集合は、yの正規分布に関しても零集合である。
切断の微分を含む項は
∣Eθ[gi(X)χR′(Xi)]∣≤R1Eθ∣gi(X)∣⟶0を満たす。χR(Xi)→1、0≤χR≤1であるから、残る二項にはそれぞれ∣(Xi−θi)gi(X)∣と∣∂igi(X)∣を支配関数として§E9.7 定理 3.2を適用することができる。整数R→∞として主張を得る。▨
例 4.2.X∼N(0,1)とし、g(x)=1(0,∞)(x)とおく。gは原点以外で微分可能であり、g′=0がほとんど至る所で成り立つ。またE[g(X)2]=1/2である。しかし、標準正規密度をϕとすると
E[Xg(X)]=∫0∞xϕ(x)dx=R→∞lim{ϕ(0)−ϕ(R)}=2π1>0=E[g′(X)].したがって、補題 4.1の局所絶対連続性を、ほとんど至る所での微分可能性だけに置き換えることができない。
命題 4.3.X∼Nd(θ,Id)、θ∈Rdとし、gが補題 4.1の仮定を満たすとする。損失∥a−θ∥2のもとで、δ(X)=X+g(X)のリスクは有限であり、
Rθ(δ)=d+Eθ[∥g(X)∥2+2i=1∑d∂igi(X)]である。
証明.∥X+g(X)−θ∥2を展開する。Eθ∥X−θ∥2=d、Eθ∥g(X)∥2<∞であり、交差項も Cauchy–Schwarz の不等式によって可積分である。したがって
Rθ(δ)=d+Eθ∥g(X)∥2+2i=1∑dEθ[(Xi−θi)gi(X)].各交差項へ補題 4.1を適用すると結論を得る。▨
補題 4.4.d≥3、θ∈Rd、X∼Nd(θ,Id)とする。∥x∥−2を原点で零と補完すると
0<Eθ[∥X∥−2]<∞である。
証明. Gaussian 密度はM=(2π)−d/2以下である。k∈N≥0に対して
Ak={x∈Rd:2−(k+1)<∥x∥≤2−k}とおく。Ak上では∥x∥−2≤22k+2であり、Akは一辺21−kの立方体に含まれる。したがって、Lebesgue 測度をλdと書くと
∫0<∥x∥≤1∥x∥−2fθ(x)dx≤Mk=0∑∞22k+2λd(Ak)≤M2d+2k=0∑∞2−k(d−2)<∞.∥x∥>1では∥x∥−2≤1なので、球外の積分は1以下である。Pθ(X=0)=0であり、被積分関数は原点以外で正であるため、期待値は正である。▨
定義 4.5 (James–Stein 推定量).d≥3とする。実数aに対して、Borel 可測な決定則δa:Rd→Rdを
δa(x)=⎩⎨⎧(1−∥x∥2a)x,0,x=0,x=0と定める。δd−2を James–Stein 推定量 (James–Stein estimator) といい、δJSと書く。
定理 4.6 (James–Stein).d≥3、θ∈Rd、X∼Nd(θ,Id)とし、損失をL(θ,b)=∥b−θ∥2とする。実数aに対して、定義 4.5の決定則は
Rθ(δa)=d+{a2−2a(d−2)}Eθ[∥X∥−2]を満たす。特に0<a<2(d−2)ならば、すべてのθ∈RdでRθ(δa)<dであり、通常の推定量Xは許容的でない。James–Stein 推定量は、各θにおいて、この族の中で最小のリスクをもつ。
証明.g(x)=δa(x)−xとおく。x=0では
gi(x)=−∥x∥2axi,∂igi(x)=−∥x∥2a+∥x∥42axi2.第i座標以外の座標がすべて零となる場合を除けば、各座標線は原点を通らず、その線上でgiはC1である。除いた座標の集合はRd−1の一点であるから Lebesgue 零集合である。また、
gi(x)2≤∥x∥2a2,∣∂igi(x)∣≤∥x∥23∣a∣であり、補題 4.4により必要な積分条件を満たす。
x=0で
∥g(x)∥2=∥x∥2a2,i=1∑d∂igi(x)=−∥x∥2ad+∥x∥42a∑ixi2=−∥x∥2a(d−2)である。命題 4.3へ代入するとリスクの式を得る。0<a<2(d−2)では係数a{a−2(d−2)}が負であり、逆二乗ノルムの期待値は正なので、すべてのθで狭義改善が成り立つ。
係数は
a2−2a(d−2)={a−(d−2)}2−(d−2)2と書くことができる。したがって、この族の中ではa=d−2が各母数におけるリスクを最小にする。▨
系 4.7.d≥3、X∼Nd(θ,Id)、θ∈Rdとし、損失をL(θ,b)=∥b−θ∥2とする。0<a<2(d−2)ならば、定理 4.6のδaは minimax 推定量である。したがって、通常の推定量Xは minimax であっても許容的でない。
証明.定理 4.6によりsupθRθ(δa)≤dである。命題 3.2の minimax 値はdなので、最大リスクはdに等しく、δaは minimax である。通常の推定量については命題 3.2と定理 4.6を合わせると結論を得る。▨
系 4.8.d≥3、n∈N≥1、σ2>0とする。Y1,…,Ynは独立にNd(μ,σ2Id)に従い、μ∈Rdは未知、σ2は既知であるとする。標本平均をYˉ=n−1∑j=1nYj、v=σ2/nとおく。損失L(μ,b)=∥b−μ∥2のもとで、実数aに対する決定則
μa=⎩⎨⎧(1−∥Yˉ∥2av)Yˉ,0,Yˉ=0,Yˉ=0は
Rμ(μa)=dv+v2{a2−2a(d−2)}Eμ[∥Yˉ∥−2]を満たす。特に0<a<2(d−2)ならば、すべてのμでRμ(μa)<dv=Rμ(Yˉ)となり、標本平均は許容的でない。
証明.n≥2では§E14.3 定理 4.1を各座標へ適用すると、Yˉi∼N(μi,v)である。n=1では同じ分布は仮定そのものである。各Yjの密度が座標ごとの積に分かれ、標本間も独立であるから、異なる座標の標本列は独立である。したがって、Yˉの座標も独立であり、Yˉ∼Nd(μ,vId)である。
X=Yˉ/v、θ=μ/vとおくとX∼Nd(θ,Id)であり、μa=vδa(X)である。よって
∥μa−μ∥2=v∥δa(X)−θ∥2,∥X∥−2=v∥Yˉ∥−2が原点以外で成り立つ。定理 4.6のリスクをv倍すると表示式と狭義改善を得る。▨