§E14.6点推定量

最終更新

同じ推定対象に対して、標本から定めることができる推定量は一つとは限らない。正規標本の分散を推定する場合にも、偏りのない標本分散、最尤推定量、および平均二乗誤差を小さくする別の除数を用いた推定量が現れる。

これらの推定量は、単に値を計算するだけでは比較することができない。不偏性は推定量の平均に関する性質であり、推定値と推定対象との差の大きさを直接には制御しない。また、固定した標本サイズでの性質と、標本サイズを増やしたときの収束も別の問題である。

損失関数とリスクは推定誤差の評価基準を明示し、二乗損失の下では平均二乗誤差が偏りと分散の双方を一つの量にまとめる。さらに、一致性は推定量列が各母数の下で推定対象へ確率収束することを表す。これらの概念は、推定法によって構成された推定量の性能を比較する際に広く用いられる。

本記事では、点推定量の誤差を評価する基本的な概念と代表的な例について解説する。

1 推定量、損失、リスク

定義 1.1.(X,A)(\mathcal X,\mathcal A)上の確率測度の非空な族(Pθ)θ∈Θ(P_\theta)_{\theta\in\Theta}を統計モデルとし、(A,G)(A,\mathcal G)を可測な行動空間、τ:Θ→A\tau:\Theta\to Aを推定対象とする。可測写像δ:(X,A)→(A,G)\delta:(\mathcal X,\mathcal A)\to(A,\mathcal G)をτ\tauの 推定量 (estimator) という。観測値x∈Xx\in\mathcal Xに対するδ(x)\delta(x)を 推定値 (estimate) という。各θ∈Θ\theta\in\Thetaの下での像測度Pθ∘δ−1P_\theta\circ\delta^{-1}を推定量の 標本分布 (sampling distribution) という。

定義 1.2.定義 1.1の統計モデル、行動空間、推定対象を考える。各θ∈Θ\theta\in\Thetaについてa↦L(θ,a)a\mapsto L(\theta,a)がG\mathcal G可測である関数

L:Θ×A⟶[0,∞]L:\Theta\times A\longrightarrow[0,\infty]

を 損失関数 (loss function) という。推定量δ\deltaのθ\thetaにおける リスク (risk) を

Rθ(δ)=Eθ[L(θ,δ)]=∫XL(θ,δ(x)) Pθ(dx)∈[0,∞]R_\theta(\delta)=E_\theta[L(\theta,\delta)] =\int_{\mathcal X}L(\theta,\delta(x))\,P_\theta(dx) \in[0,\infty]

で定義する。

注意 1.3. リスクは各母数を固定した期待損失であり、正の無限大となる場合も含む。リスクを事前分布について積分する場合には、母数方向の可測性を別に仮定する必要がある。

2 偏りと平均二乗誤差

定義 2.1.定義 1.1においてA=RA=\Rとし、τ:Θ→R\tau:\Theta\to\Rを実数値推定対象とする。実数値推定量δ\deltaがすべてのθ∈Θ\theta\in\Thetaについて可積分であるとき、θ\thetaにおける 偏り (bias) を

Bias⁡θ(δ)=Eθ[δ]−τ(θ)\operatorname{Bias}_\theta(\delta)=E_\theta[\delta]-\tau(\theta)

で定義する。すべてのθ∈Θ\theta\in\ThetaについてBias⁡θ(δ)=0\operatorname{Bias}_\theta(\delta)=0であるとき、δ\deltaをτ\tauの 不偏推定量 (unbiased estimator) という。

不偏性は、すべての母数において推定量の平均が推定対象に一致する性質である。各観測で得る推定値と推定対象との差が小さいことは、不偏性だけからは従わない。

定義 2.2. 実数値推定対象τ:Θ→R\tau:\Theta\to\Rと実数値推定量δ\deltaに対し、θ\thetaにおける 平均二乗誤差 (mean squared error)(MSE)を

MSE⁡θ(δ)=Eθ ⁣[(δ−τ(θ))2]∈[0,∞]\operatorname{MSE}_\theta(\delta) =E_\theta\!\left[(\delta-\tau(\theta))^2\right] \in[0,\infty]

で定義する。これは二乗損失L(θ,a)=(a−τ(θ))2L(\theta,a)=(a-\tau(\theta))^2に対するリスクである。

命題 2.3. 実数値推定量δ\deltaがすべてのθ∈Θ\theta\in\Thetaについて二乗可積分であるとする。このとき、すべてのθ∈Θ\theta\in\Thetaについて

MSE⁡θ(δ)=Var⁡θ(δ)+Bias⁡θ(δ)2\operatorname{MSE}_\theta(\delta) =\operatorname{Var}_\theta(\delta) +\operatorname{Bias}_\theta(\delta)^2

が成り立つ。特に、δ\deltaが不偏ならば、すべてのθ∈Θ\theta\in\ThetaについてMSE⁡θ(δ)=Var⁡θ(δ)\operatorname{MSE}_\theta(\delta)=\operatorname{Var}_\theta(\delta)である。

証明.bθ=Eθ[δ]−τ(θ)b_\theta=E_\theta[\delta]-\tau(\theta)と置き、誤差を

δ−τ(θ)={δ−Eθ[δ]}+bθ\delta-\tau(\theta) =\{\delta-E_\theta[\delta]\}+b_\theta

と分解する。二乗して期待値を取ると、交差項の期待値は

2bθEθ[δ−Eθ[δ]]=02b_\theta E_\theta[\delta-E_\theta[\delta]]=0

である。残る二項はそれぞれVar⁡θ(δ)\operatorname{Var}_\theta(\delta)とbθ2b_\theta^2であるから、主張を得る。▨

この分解により、偏りを導入して分散を減らした推定量が、不偏推定量より小さな平均二乗誤差をもつ場合がある。次の例では、この比較を同じ形の推定量族の中で行う。

例 2.4.n≥2n\geq2とし、X1,…,XnX_1,\ldots,X_nをN(μ,σ2)N(\mu,\sigma^2)からの独立同分布標本とする。ただし、μ∈R\mu\in\Rとσ2>0\sigma^2>0はともに未知である。

X‾=1n∑i=1nXi,Q=∑i=1n(Xi−X‾)2\overline X=\frac1n\sum_{i=1}^nX_i, \qquad Q=\sum_{i=1}^n(X_i-\overline X)^2

と置く。§E14.3 定理 4.1とカイ二乗分布の積率により

Qσ2∼χn−12,Eμ,σ2[Q]=(n−1)σ2,Var⁡μ,σ2(Q)=2(n−1)σ4\frac Q{\sigma^2}\sim\chi^2_{n-1},\qquad E_{\mu,\sigma^2}[Q]=(n-1)\sigma^2,\qquad \operatorname{Var}_{\mu,\sigma^2}(Q)=2(n-1)\sigma^4

である。

c>0c>0に対してδc=Q/c\delta_c=Q/cと置く。このとき

Bias⁡μ,σ2(δc)=(n−1c−1)σ2,Var⁡μ,σ2(δc)=2(n−1)c2σ4\operatorname{Bias}_{\mu,\sigma^2}(\delta_c) =\left(\frac{n-1}{c}-1\right)\sigma^2, \qquad \operatorname{Var}_{\mu,\sigma^2}(\delta_c) =\frac{2(n-1)}{c^2}\sigma^4

である。したがって命題 2.3により

MSE⁡μ,σ2(δc)=σ4c2{2(n−1)+(n−1−c)2}.\operatorname{MSE}_{\mu,\sigma^2}(\delta_c) =\frac{\sigma^4}{c^2}\left\{2(n-1)+(n-1-c)^2\right\}.

m=n−1m=n-1と置けば、σ−4MSE⁡μ,σ2(δc)\sigma^{-4}\operatorname{MSE}_{\mu,\sigma^2}(\delta_c)のccによる導関数は

2m{c−(m+2)}c3\frac{2m\{c-(m+2)\}}{c^3}

である。この導関数は0<c<m+20<c<m+2で負、c>m+2c>m+2で正であるから、Q/cQ/cという推定量族の中ではc=n+1c=n+1が MSE を一意に最小にする。

§E14.7 命題 1.7により、Q/nQ/nは未知の平均と分散をもつ正規モデルにおける分散の最尤推定量とほとんど確実に等しい。

n=10n=10、σ2=1\sigma^2=1の場合には次の値を得る。

推定量 除数cc 偏り 偏りの二乗 分散 MSE
Q/(n−1)Q/(n-1)(不偏) 99 00 00 2/9≈0.22222/9\approx0.2222 0.22220.2222
σ^ML2\widehat\sigma^2_{\mathrm{ML}}(Q/nQ/nとほとんど確実に等しい) 1010 −0.1-0.1 0.010.01 0.180.18 0.190.19
Q/(n+1)Q/(n+1) 1111 −2/11≈−0.1818-2/11\approx-0.1818 4/121≈0.033064/121\approx0.03306 18/121≈0.1487618/121\approx0.14876 2/11≈0.181822/11\approx0.18182

Q/nQ/nについてはE[Q/n]=0.9E[Q/n]=0.9であり、その MSE は(2n−1)/n2=19/100=0.19(2n-1)/n^2=19/100=0.19である。Q/(n+1)Q/(n+1)は、不偏推定量Q/(n−1)Q/(n-1)と最尤推定量にほとんど確実に等しいQ/nQ/nのいずれよりも小さな MSE をもつ。この比較はQ/cQ/cという族の中での比較であり、すべての推定量の中でQ/(n+1)Q/(n+1)が MSE を最小にするとは主張していない。

3 一致性

定義 3.1. 各n∈N≥1n\in\NNについて、(Xn,An)(\mathcal X_n,\mathcal A_n)上の統計モデル(Pθ(n))θ∈Θ(P_\theta^{(n)})_{\theta\in\Theta}と、実数値推定量δn:Xn→R\delta_n:\mathcal X_n\to\Rを考える。推定量列(δn)(\delta_n)が実数値推定対象τ:Θ→R\tau:\Theta\to\Rの 一致推定量 (consistent estimator) であるとは、すべてのθ∈Θ\theta\in\Thetaとすべてのε>0\varepsilon>0について

Pθ(n) ⁣(∣δn−τ(θ)∣>ε)⟶0P_\theta^{(n)}\!\left(|\delta_n-\tau(\theta)|>\varepsilon\right) \longrightarrow0

となることをいう。この収束をδn→Pθτ(θ)\delta_n\xrightarrow{P_\theta}\tau(\theta)と書く。

一致性はすべての母数について要求される。固定したθ0∈Θ\theta_0\in\Thetaに対して定数推定量δn=τ(θ0)\delta_n=\tau(\theta_0)を用いれば、θ0\theta_0では誤差が常に零になる。しかし、τ(θ)≠τ(θ0)\tau(\theta)\ne\tau(\theta_0)を満たす母数θ\thetaが存在する場合、この推定量列はその母数では一致しないため、モデル上の一致推定量ではない。推定対象が定数関数ならば、この定数推定量列はモデル上でも一致する。

命題 3.2. 各n∈N≥1n\in\NNについて実数値推定量δn\delta_nを考える。すべてのθ∈Θ\theta\in\Thetaについて

MSE⁡θ(δn)=Eθ(n) ⁣[(δn−τ(θ))2]⟶0\operatorname{MSE}_\theta(\delta_n) =E_\theta^{(n)}\!\left[(\delta_n-\tau(\theta))^2\right] \longrightarrow0

であるとする。このとき(δn)(\delta_n)はτ\tauの一致推定量である。

証明.θ∈Θ\theta\in\Thetaとε>0\varepsilon>0を固定し、非負確率変数(δn−τ(θ))2(\delta_n-\tau(\theta))^2に§E11.4 定理 3.1を適用する。すると

Pθ(n) ⁣(∣δn−τ(θ)∣>ε)≤Pθ(n) ⁣((δn−τ(θ))2≥ε2)≤MSE⁡θ(δn)ε2P_\theta^{(n)}\!\left(|\delta_n-\tau(\theta)|>\varepsilon\right) \leq P_\theta^{(n)}\!\left((\delta_n-\tau(\theta))^2\geq\varepsilon^2\right) \leq\frac{\operatorname{MSE}_\theta(\delta_n)}{\varepsilon^2}

を得る。右辺は仮定により零へ収束する。θ\thetaとε\varepsilonは任意であるから、定義 3.1の条件が成り立つ。▨

分散が有限な独立同分布標本の標本平均X‾n\overline X_nは母平均μ\muの不偏推定量であり、分散はσ2/n\sigma^2/nである。したがって各母集団分布の下でX‾n\overline X_nの MSE はσ2/n→0\sigma^2/n\to0であり、命題 3.2によって母平均に一致する。この結論は弱大数の法則§E14.2 定理 4.1と同じ確率収束を与える。

一方、σ2>0\sigma^2>0を既知とし、各nnについてN(μ,σ2)N(\mu,\sigma^2)からの独立同分布標本の第一観測だけを用いてδn=X1\delta_n=X_1と置く。この推定量列はすべてのμ∈R\mu\in\Rについて不偏である。Z∼N(0,σ2)Z\sim N(0,\sigma^2)とすれば、任意のε>0\varepsilon>0について

Pμ(∣δn−μ∣>ε)=P(∣Z∣>ε)>0P_\mu(|\delta_n-\mu|>\varepsilon) =P(|Z|>\varepsilon)>0

であり、右辺はnnによらない。したがって(δn)(\delta_n)はμ\muの一致推定量ではない。不偏性だけでは一致性は従わない。

正規標本分散の例では、Qn/nQ_n/nの偏りは−σ2/n-\sigma^2/n、分散は2(n−1)σ4/n22(n-1)\sigma^4/n^2である。したがって

MSE⁡μ,σ2(Qn/n)=2n−1n2σ4⟶0\operatorname{MSE}_{\mu,\sigma^2}(Q_n/n) =\frac{2n-1}{n^2}\sigma^4 \longrightarrow0

となり、有限標本では偏っていてもσ2\sigma^2に一致する。固定した標本サイズでの不偏性と、標本サイズを増やしたときの一致性は異なる性質である。

4 精度比較への接続

有限標本の不偏推定量は、§E14.9 定理 2.1による十分統計量での分散改善、§E14.10 定理 2.2による完備十分統計量の関数としての一意性、または§E14.12 定理 2.1による正則な支配モデルでの分散下界によって比較する。台が母数とともに変わるモデルでは、Cramér–Rao の不等式の正則条件を個別に確認する必要がある。

大標本では、§E14.13 定理 3.1が一致する尤度方程式解の正規極限を与えるため、極限分布と漸近分散を比較する。この結論は有限標本における正規近似の精度を自動的には与えない。

参考文献

  1. Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer Texts in Statistics, Springer, 1998.統計的決定問題における推定量、損失、リスクおよび平均二乗誤差の定式化を参考にした。
  2. George Casella and Roger L. Berger, Statistical Inference, 2nd ed., CRC Press, Boca Raton, 2024, originally published 2002.不偏性、平均二乗誤差および一致性の標準的な定式化を参考にした。

前提記事