1 凸損失の改善
定理 1.1 (Rao–Blackwell の定理). ( X , A ) (\mathcal X,\mathcal A) ( X , A ) 上の確率測度の非空な族( P θ ) θ ∈ Θ (P_\theta)_{\theta\in\Theta} ( P θ ) θ ∈ Θ がシグマ有限測度に支配され、T : ( X , A ) → ( Y , B ) T:(\mathcal X,\mathcal A)\to(\mathcal Y,\mathcal B) T : ( X , A ) → ( Y , B ) が十分であるとする。A ⊆ R A\subseteq\R A ⊆ R を非空な区間とし、δ : X → A \delta:\mathcal X\to A δ : X → A を可測関数で、すべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ についてE θ ∣ δ ∣ < ∞ E_\theta|\delta|<\infty E θ ∣ δ ∣ < ∞ を満たすものとする。
各θ ∈ Θ \theta\in\Theta θ ∈ Θ に対し、L θ : A → [ 0 , ∞ ) L_\theta:A\to[0,\infty) L θ : A → [ 0 , ∞ ) が有限値の可測な凸関数であり、L θ ( δ ) L_\theta(\delta) L θ ( δ ) がP θ P_\theta P θ 可積分であるとする。このとき、母数θ \theta θ に依存しない有限値B \mathcal B B 可測関数g : Y → A g:\mathcal Y\to A g : Y → A が存在し、推定量
δ T = g ( T ) \delta_T=g(T) δ T = g ( T ) は、すべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ について
δ T = E θ [ δ ∣ σ ( T ) ] P θ -ほとんど確実に \delta_T=E_\theta[\delta\mid\sigma(T)]\qquad P_\theta\text{-ほとんど確実に} δ T = E θ [ δ ∣ σ ( T )] P θ - ほとんど確実に を満たす。さらに、L θ ( δ T ) L_\theta(\delta_T) L θ ( δ T ) はP θ P_\theta P θ 可積分であり、
R θ ( δ T ) : = E θ [ L θ ( δ T ) ] ≤ E θ [ L θ ( δ ) ] = : R θ ( δ ) R_\theta(\delta_T):=E_\theta[L_\theta(\delta_T)]
\leq E_\theta[L_\theta(\delta)]=:R_\theta(\delta) R θ ( δ T ) := E θ [ L θ ( δ T )] ≤ E θ [ L θ ( δ )] =: R θ ( δ ) がすべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ について成り立つ。
証明. §E14.5 命題 3.3 をu = δ u=\delta u = δ に適用し、有限値B \mathcal B B 可測関数a δ a_\delta a δ を、すべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ について
a δ ( T ) = E θ [ δ ∣ σ ( T ) ] P θ -ほとんど確実に a_\delta(T)=E_\theta[\delta\mid\sigma(T)]\qquad P_\theta\text{-ほとんど確実に} a δ ( T ) = E θ [ δ ∣ σ ( T )] P θ - ほとんど確実に となるように取る。a 0 ∈ A a_0\in A a 0 ∈ A を一つ取り、
g ( y ) = { a δ ( y ) , a δ ( y ) ∈ A , a 0 , a δ ( y ) ∉ A g(y)=
\begin{cases}
a_\delta(y),&a_\delta(y)\in A,\\
a_0,&a_\delta(y)\notin A
\end{cases} g ( y ) = { a δ ( y ) , a 0 , a δ ( y ) ∈ A , a δ ( y ) ∈ / A と定める。区間A A A は Borel 集合であるから、g g g は有限値B \mathcal B B 可測関数であり、すべての点でA A A に値を取る。
θ ∈ Θ \theta\in\Theta θ ∈ Θ を固定し、M = a δ ( T ) M=a_\delta(T) M = a δ ( T ) と置く。下端α = inf A \alpha=\inf A α = inf A が有限ならば、δ ≥ α \delta\geq\alpha δ ≥ α と条件付き期待値の正値性§E11.11 命題 2.1 (2) からM ≥ α M\geq\alpha M ≥ α がP θ P_\theta P θ -ほとんど確実に成り立つ。α ∉ A \alpha\notin A α ∈ / A の場合にはδ − α > 0 \delta-\alpha>0 δ − α > 0 である。B = { M = α } ∈ σ ( T ) B=\{M=\alpha\}\in\sigma(T) B = { M = α } ∈ σ ( T ) と置くと、条件付き期待値の定義から
E θ [ ( δ − α ) 1 B ] = E θ [ ( M − α ) 1 B ] = 0 E_\theta[(\delta-\alpha)\mathbf1_B]
=E_\theta[(M-\alpha)\mathbf1_B]=0 E θ [( δ − α ) 1 B ] = E θ [( M − α ) 1 B ] = 0 となるため、P θ ( B ) = 0 P_\theta(B)=0 P θ ( B ) = 0 である。したがって、下端がA A A に属さない場合にはM > α M>\alpha M > α がP θ P_\theta P θ -ほとんど確実に成り立つ。上端β = sup A \beta=\sup A β = sup A が有限である場合には、β − δ \beta-\delta β − δ に同じ議論を適用すると、M ≤ β M\leq\beta M ≤ β が成り立ち、β ∉ A \beta\notin A β ∈ / A ならばM < β M<\beta M < β が成り立つ。有限でない端点には条件がないので、いずれの場合にもM ∈ A M\in A M ∈ A がP θ P_\theta P θ -ほとんど確実に成り立つ。
関数g g g はa δ a_\delta a δ がA A A の外に値を取る点だけで補正されているから、
δ T = g ( T ) = M = E θ [ δ ∣ σ ( T ) ] \delta_T=g(T)=M=E_\theta[\delta\mid\sigma(T)] δ T = g ( T ) = M = E θ [ δ ∣ σ ( T )] がP θ P_\theta P θ -ほとんど確実に成り立つ。§E11.11 定理 3.2 を区間A A A 上の凸関数L θ L_\theta L θ に適用すると、
L θ ( δ T ) ≤ E θ [ L θ ( δ ) ∣ σ ( T ) ] P θ -ほとんど確実に L_\theta(\delta_T)
\leq E_\theta[L_\theta(\delta)\mid\sigma(T)]
\qquad P_\theta\text{-ほとんど確実に} L θ ( δ T ) ≤ E θ [ L θ ( δ ) ∣ σ ( T )] P θ - ほとんど確実に を得る。右辺は非負かつ可積分であるから、左辺も可積分である。両辺の期待値を取り、期待値保存§E11.11 命題 2.1 (4) を用いると、
R θ ( δ T ) ≤ R θ ( δ ) R_\theta(\delta_T)\leq R_\theta(\delta) R θ ( δ T ) ≤ R θ ( δ ) となる。g g g はすべての母数に対して同じ関数であり、θ \theta θ は任意であったから、主張はすべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ について成り立つ。▨
例 1.2 (凸性を外した場合). P ( X = 1 ) = P ( X = − 1 ) = 1 / 2 P(X=1)=P(X=-1)=1/2 P ( X = 1 ) = P ( X = − 1 ) = 1/2 とし、母数空間を一点集合とする。定数統計量T = 0 T=0 T = 0 は十分であり、δ = X \delta=X δ = X に対して
E [ δ ∣ σ ( T ) ] = E [ X ] = 0 E[\delta\mid\sigma(T)]=E[X]=0 E [ δ ∣ σ ( T )] = E [ X ] = 0 である。行動空間をA = [ − 1 , 1 ] A=[-1,1] A = [ − 1 , 1 ] とし、非負損失をL ( a ) = 1 − a 2 L(a)=1-a^2 L ( a ) = 1 − a 2 と定めると、L L L は凸ではない。元の推定量と条件付き期待値による推定量のリスクはそれぞれ
E [ L ( δ ) ] = 0 , E [ L ( E [ δ ∣ σ ( T ) ] ) ] = L ( 0 ) = 1 E[L(\delta)]=0,
\qquad
E[L(E[\delta\mid\sigma(T)])]=L(0)=1 E [ L ( δ )] = 0 , E [ L ( E [ δ ∣ σ ( T )])] = L ( 0 ) = 1 である。したがって、損失の凸性を外すと、十分統計量による条件付けがリスクを増加させる場合がある。
2 不偏性と分散
定理 2.1. ( X , A ) (\mathcal X,\mathcal A) ( X , A ) 上の確率測度の非空な族( P θ ) θ ∈ Θ (P_\theta)_{\theta\in\Theta} ( P θ ) θ ∈ Θ がシグマ有限測度に支配され、T : ( X , A ) → ( Y , B ) T:(\mathcal X,\mathcal A)\to(\mathcal Y,\mathcal B) T : ( X , A ) → ( Y , B ) が十分であるとする。τ : Θ → R \tau:\Theta\to\R τ : Θ → R とし、実数値可測関数τ ^ \widehat\tau τ が、すべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ について
E θ [ τ ^ ] = τ ( θ ) , E θ [ τ ^ 2 ] < ∞ E_\theta[\widehat\tau]=\tau(\theta),
\qquad E_\theta[\widehat\tau^2]<\infty E θ [ τ ] = τ ( θ ) , E θ [ τ 2 ] < ∞ を満たすとする。このとき有限値B \mathcal B B 可測関数h h h が存在し、τ ~ = h ( T ) \widetilde\tau=h(T) τ = h ( T ) と置くと次が成り立つ。
τ ~ \widetilde\tau τ は母数θ \theta θ に依存しない統計量である。
τ ~ \widetilde\tau τ はτ ( θ ) \tau(\theta) τ ( θ ) の不偏推定量である。すなわち、すべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ についてE θ [ τ ~ ] = τ ( θ ) E_\theta[\widetilde\tau]=\tau(\theta) E θ [ τ ] = τ ( θ ) である。
すべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ について
Var θ ( τ ^ ) − Var θ ( τ ~ ) = E θ [ ( τ ^ − τ ~ ) 2 ] ≥ 0 \operatorname{Var}_\theta(\widehat\tau)-\operatorname{Var}_\theta(\widetilde\tau)
=E_\theta[(\widehat\tau-\widetilde\tau)^2]\geq0 Var θ ( τ ) − Var θ ( τ ) = E θ [( τ − τ ) 2 ] ≥ 0
が成り立つ。固定したθ \theta θ について分散が等しいための必要十分条件は、τ ^ = τ ~ \widehat\tau=\widetilde\tau τ = τ がP θ P_\theta P θ -ほとんど確実に成り立つことであり、これはτ ^ \widehat\tau τ がP θ P_\theta P θ に関してσ ( T ) \sigma(T) σ ( T ) 可測な版をもつことと同値である。
証明. 定理 1.1 をA = R A=\R A = R 、δ = τ ^ \delta=\widehat\tau δ = τ および
L θ ( a ) = ( a − τ ( θ ) ) 2 L_\theta(a)=(a-\tau(\theta))^2 L θ ( a ) = ( a − τ ( θ ) ) 2 に適用する。E θ [ τ ^ 2 ] < ∞ E_\theta[\widehat\tau^2]<\infty E θ [ τ 2 ] < ∞ であるからL θ ( τ ^ ) L_\theta(\widehat\tau) L θ ( τ ) は可積分である。したがって、母数に依存しない有限値B \mathcal B B 可測関数h h h が存在し、τ ~ = h ( T ) \widetilde\tau=h(T) τ = h ( T ) と置けば
τ ~ = E θ [ τ ^ ∣ σ ( T ) ] P θ -ほとんど確実に \widetilde\tau=E_\theta[\widehat\tau\mid\sigma(T)]
\qquad P_\theta\text{-ほとんど確実に} τ = E θ [ τ ∣ σ ( T )] P θ - ほとんど確実に がすべてのθ ∈ Θ \theta\in\Theta θ ∈ Θ について成り立つ。特に、T T T とh h h の可測性から(1) が成り立つ。
(2) を示す。期待値保存§E11.11 命題 2.1 (4) により、任意のθ ∈ Θ \theta\in\Theta θ ∈ Θ について
E θ [ τ ~ ] = E θ [ τ ^ ] = τ ( θ ) E_\theta[\widetilde\tau]=E_\theta[\widehat\tau]=\tau(\theta) E θ [ τ ] = E θ [ τ ] = τ ( θ ) である。
(3) を示す。θ ∈ Θ \theta\in\Theta θ ∈ Θ を固定する。全分散公式§E11.11 定理 4.4 とτ ~ = E θ [ τ ^ ∣ σ ( T ) ] \widetilde\tau=E_\theta[\widehat\tau\mid\sigma(T)] τ = E θ [ τ ∣ σ ( T )] から
Var θ ( τ ^ ) = E θ [ ( τ ^ − τ ~ ) 2 ] + Var θ ( τ ~ ) \operatorname{Var}_\theta(\widehat\tau)
=E_\theta[(\widehat\tau-\widetilde\tau)^2]
+\operatorname{Var}_\theta(\widetilde\tau) Var θ ( τ ) = E θ [( τ − τ ) 2 ] + Var θ ( τ ) を得る。したがって分散差の恒等式と分散改善が成り立つ。分散が等しいことは、非負確率変数( τ ^ − τ ~ ) 2 (\widehat\tau-\widetilde\tau)^2 ( τ − τ ) 2 の期待値が零であることと同値であり、さらにτ ^ = τ ~ \widehat\tau=\widetilde\tau τ = τ がP θ P_\theta P θ -ほとんど確実に成り立つことと同値である。この等式が成り立つならばτ ~ \widetilde\tau τ がσ ( T ) \sigma(T) σ ( T ) 可測なので、τ ^ \widehat\tau τ はσ ( T ) \sigma(T) σ ( T ) 可測な版をもつ。逆にτ ^ \widehat\tau τ がσ ( T ) \sigma(T) σ ( T ) 可測な版をもつならば、条件付き期待値の可測変数に対する性質§E11.11 命題 2.1 (3) によりτ ^ = τ ~ \widehat\tau=\widetilde\tau τ = τ がP θ P_\theta P θ -ほとんど確実に成り立つ。▨
3 Bernoulli 標本
例 3.1. n ≥ 2 n\geq2 n ≥ 2 とし、X 1 , … , X n X_1,\ldots,X_n X 1 , … , X n を成功確率p ∈ ( 0 , 1 ) p\in(0,1) p ∈ ( 0 , 1 ) の Bernoulli 分布からの独立同分布標本とする。X 1 X_1 X 1 はp p p の不偏推定量であり、§E14.5 例 1.3 により成功回数
T = ∑ i = 1 n X i T=\sum_{i=1}^nX_i T = i = 1 ∑ n X i はp p p に対して十分である。
s ∈ { 1 , … , n − 1 } s\in\{1,\ldots,n-1\} s ∈ { 1 , … , n − 1 } に対して、T = s T=s T = s となる零と一の列のうち第一成分が一であるものは( n − 1 s − 1 ) \binom{n-1}{s-1} ( s − 1 n − 1 ) 個である。条件付き分布はこのような列の上の一様分布であるから、
E p [ X 1 ∣ T = s ] = ( n − 1 s − 1 ) ( n s ) = s n E_p[X_1\mid T=s]
=\frac{\binom{n-1}{s-1}}{\binom ns}
=\frac sn E p [ X 1 ∣ T = s ] = ( s n ) ( s − 1 n − 1 ) = n s となる。s = 0 , n s=0,n s = 0 , n でも同じ等式は直接成り立つ。したがって
E p [ X 1 ∣ σ ( T ) ] = T n = X ‾ E_p[X_1\mid\sigma(T)]=\frac Tn=\overline X E p [ X 1 ∣ σ ( T )] = n T = X であり、条件付き期待値の表示はp p p に依存しない。
T ∼ Bin ( n , p ) T\sim\operatorname{Bin}(n,p) T ∼ Bin ( n , p ) であるから、§E11.5 命題 1.3 により
Var p ( X 1 ) = p ( 1 − p ) , Var p ( X ‾ ) = p ( 1 − p ) n . \operatorname{Var}_p(X_1)=p(1-p),
\qquad
\operatorname{Var}_p(\overline X)=\frac{p(1-p)}n. Var p ( X 1 ) = p ( 1 − p ) , Var p ( X ) = n p ( 1 − p ) . 二乗損失L p ( a ) = ( a − p ) 2 L_p(a)=(a-p)^2 L p ( a ) = ( a − p ) 2 の下では、両推定量が不偏であるためリスクはそれぞれの分散に等しい。したがって、p ∈ ( 0 , 1 ) p\in(0,1) p ∈ ( 0 , 1 ) とn ≥ 2 n\geq2 n ≥ 2 の全範囲でX ‾ \overline X X のリスクはX 1 X_1 X 1 のリスクより真に小さい。
4 Jensen の不等式の等号
命題 4.1 (Jensen の不等式と狭義凸の場合の等号). I ⊆ R I\subseteq\R I ⊆ R を区間とし、φ : I → R \varphi:I\to\R φ : I → R とする。X X X とφ ( X ) \varphi(X) φ ( X ) が可積分で、P ( X ∈ I ) = 1 P(X\in I)=1 P ( X ∈ I ) = 1 およびE [ X ] ∈ I E[X]\in I E [ X ] ∈ I を満たすとする。
φ \varphi φ が凸ならば、φ ( E [ X ] ) ≤ E [ φ ( X ) ] \varphi(E[X])\leq E[\varphi(X)] φ ( E [ X ]) ≤ E [ φ ( X )] である。
φ \varphi φ が狭義凸ならば、等号φ ( E [ X ] ) = E [ φ ( X ) ] \varphi(E[X])=E[\varphi(X)] φ ( E [ X ]) = E [ φ ( X )] が成り立つための必要十分条件は、X = E [ X ] X=E[X] X = E [ X ] がほとんど確実に成り立つことである。
φ \varphi φ が凹ならば、φ ( E [ X ] ) ≥ E [ φ ( X ) ] \varphi(E[X])\geq E[\varphi(X)] φ ( E [ X ]) ≥ E [ φ ( X )] である。φ \varphi φ がアフィンならば等号が成り立つ。
証明. 凸関数に対する不等式は§E11.4 定理 3.4 である。m = E [ X ] m=E[X] m = E [ X ] と置き、φ \varphi φ が狭義凸であるとする。m m m がI I I の端点ならば、X − m X-m X − m またはm − X m-X m − X は非負で期待値が零であるから、X = m X=m X = m がほとんど確実に成り立つ。
m m m がI I I の内点である場合には、m m m における支持直線の傾きs s s を取り、
D = φ ( X ) − φ ( m ) − s ( X − m ) D=\varphi(X)-\varphi(m)-s(X-m) D = φ ( X ) − φ ( m ) − s ( X − m ) と置く。支持直線の性質からD ≥ 0 D\geq0 D ≥ 0 であり、狭義凸性からD = 0 D=0 D = 0 となるのはX = m X=m X = m の場合に限る。Jensen の不等式で等号が成り立つならば
E [ D ] = E [ φ ( X ) ] − φ ( m ) − s ( E [ X ] − m ) = 0 E[D]=E[\varphi(X)]-\varphi(m)-s(E[X]-m)=0 E [ D ] = E [ φ ( X )] − φ ( m ) − s ( E [ X ] − m ) = 0 である。非負確率変数の期待値が零であるためD = 0 D=0 D = 0 がほとんど確実に成り立ち、したがってX = m X=m X = m がほとんど確実に成り立つ。逆にX = m X=m X = m がほとんど確実ならば、期待値を直接取ると等号を得る。
凹関数φ \varphi φ については凸関数− φ -\varphi − φ に第一の主張を適用する。アフィン関数は凸かつ凹であるため、二つの不等式から等号が成り立つ。▨