§E14.18信頼区間

最終更新

成功確率が未知である Bernoulli 分布から独立同分布の標本を得た場合、観測された成功回数から成功確率の候補となる区間を定めることができる。区間を構成する前には、未知の成功確率は固定されており、標本に応じて区間の端点が変化する。すべての成功確率について、ランダムな区間が真の値を少なくとも指定した割合で含むための保証が問題となる。

信頼区間は、各母数の下で真の値を含む確率が所定の水準以上になる区間推定法である。二項分布では標本値が離散的であるため、有限標本で被覆確率の下限を保証すると、被覆確率が指定した水準を上回ることがある。したがって、有限標本での被覆保証と、被覆確率がすべての母数で指定値に一致する正確性とは区別する必要がある。

被覆確率は、区間推定法の頻度論的な性質を評価するための最も基本的な基準の一つである。

本記事では、信頼区間の定義と代表的な有限標本での構成を扱う。

1 信頼集合と被覆確率

定義 1.1. 可測空間(X,A)(\mathcal X,\mathcal A)上の確率測度族(Pθ)θ∈Θ(P_\theta)_{\theta\in\Theta}を統計モデルとする。各x∈Xx\in\mathcal Xに対して集合C(x)⊆ΘC(x)\subseteq\Thetaが定まり、各θ∈Θ\theta\in\Thetaに対して{x∈X:θ∈C(x)}∈A\{x\in\mathcal X:\theta\in C(x)\}\in\mathcal Aが成り立つとする。0<α<10<\alpha<1とする。

CCが水準1−α1-\alphaの信頼集合 (confidence set) であるとは、すべてのθ∈Θ\theta\in\Thetaに対して

Pθ(θ∈C(X))≥1−αP_\theta\bigl(\theta\in C(X)\bigr)\geq1-\alpha

が成り立つことをいう。左辺をθ\thetaにおける被覆確率 (coverage probability) といい、1−α1-\alphaを信頼係数 (confidence coefficient) または信頼水準 (confidence level) という。被覆確率がすべてのθ∈Θ\theta\in\Thetaで1−α1-\alphaに等しいとき、CCを水準1−α1-\alphaの正確な信頼集合 (exact confidence set) という。

Θ⊆R\Theta\subseteq\Rであり、各x∈Xx\in\mathcal Xに対してC(x)C(x)が空でない閉区間であるとき、CCを水準1−α1-\alphaの信頼区間 (confidence interval) という。正確な信頼集合でもある信頼区間を正確な信頼区間 (exact confidence interval) という。

注意 1.2. 標本を観測してC(X)=cC(X)=cが確定した後、頻度論の母数θ\thetaは固定された未知の値である。したがって、命題θ∈c\theta\in cは真または偽であり、観測後の確率が1−α1-\alphaであるとは解釈しない。信頼水準は、同じ母数の下で標本を取り直して集合C(X)C(X)を構成する手続きを反復したときの被覆確率に対する保証である。

これに対して、Bayes の信用区間は事後分布の下で母数が区間に属する確率を指定する(§E14.8 定義 5.1)。二つの区間が同じ数値になる場合でも、被覆確率に関する標本抽出前の言明と、事後確率に関する観測後の言明は異なる。

2 枢軸量による構成

命題 2.1. 関数Q:X×Θ→RQ:\mathcal X\times\Theta\to\Rについて、各θ∈Θ\theta\in\Thetaに対する切片Q(⋅,θ)Q(\cdot,\theta)が可測であり、PθP_\thetaの下で同じ分布GGに従うとする。B⊆RB\subseteq\Rを Borel 集合とし、G(B)=1−αG(B)=1-\alphaとおく。このとき

C(x)={θ∈Θ:Q(x,θ)∈B}C(x)=\{\theta\in\Theta:Q(x,\theta)\in B\}

は水準1−α1-\alphaの正確な信頼集合である。

さらに、Θ\Thetaが区間、B=[a,b]B=[a,b]であり、各x∈Xx\in\mathcal Xに対してθ↦Q(x,θ)\theta\mapsto Q(x,\theta)が連続かつ狭義単調で、その値域が[a,b][a,b]を含むとする。このときC(x)C(x)は閉区間であり、その二つの端点は方程式Q(x,θ)=a,bQ(x,\theta)=a,bの解で与えられる。

証明.θ∈Θ\theta\in\Thetaを固定する。Q(⋅,θ)Q(\cdot,\theta)の可測性により{x:θ∈C(x)}={x:Q(x,θ)∈B}\{x:\theta\in C(x)\}=\{x:Q(x,\theta)\in B\}は可測であり、

Pθ(θ∈C(X))=Pθ(Q(X,θ)∈B)=G(B)=1−αP_\theta\bigl(\theta\in C(X)\bigr)=P_\theta\bigl(Q(X,\theta)\in B\bigr)=G(B)=1-\alpha

が成り立つ。したがってCCは正確な信頼集合である。

B=[a,b]B=[a,b]とし、θ↦Q(x,θ)\theta\mapsto Q(x,\theta)が狭義増加である場合を考える。連続性、狭義単調性および値域の仮定により、Q(x,θa)=aQ(x,\theta_a)=aとQ(x,θb)=bQ(x,\theta_b)=bを満たすθa,θb∈Θ\theta_a,\theta_b\in\Thetaが一意に存在し、

a≤Q(x,θ)≤b⟺θa≤θ≤θba\leq Q(x,\theta)\leq b\quad\Longleftrightarrow\quad\theta_a\leq\theta\leq\theta_b

となる。狭義減少の場合には二つの端点の順序を入れ替えれば同じ結論を得る。▨

3 検定との双対性

定理 3.1. 可測空間(X,A)(\mathcal X,\mathcal A)上の統計モデル(Pθ)θ∈Θ(P_\theta)_{\theta\in\Theta}を取り、各θ0∈Θ\theta_0\in\Thetaに対して単純帰無仮説H0:θ=θ0H_0:\theta=\theta_0の水準α\alphaの検定φθ0:X→[0,1]\varphi_{\theta_0}:\mathcal X\to[0,1]が与えられているとする。標本XXと独立なU∼Unif⁡(0,1)U\sim\operatorname{Unif}(0,1)を取り、

C(x,u)={θ0∈Θ:u>φθ0(x)}C(x,u)=\{\theta_0\in\Theta:u>\varphi_{\theta_0}(x)\}

と定める。このとき次が成り立つ。

  1. C(X,U)C(X,U)は水準1−α1-\alphaの信頼集合である。各θ\thetaに対してEθ[φθ(X)]=αE_\theta[\varphi_\theta(X)]=\alphaならば、被覆確率はすべてのθ\thetaで1−α1-\alphaに等しい。
  2. θ0∉C(x,u)\theta_0\notin C(x,u)であることと、補助変数の値がuuであるときに検定φθ0\varphi_{\theta_0}がH0:θ=θ0H_0:\theta=\theta_0を棄却することは同値である。

逆に、水準1−α1-\alphaの信頼集合C(X)C(X)が与えられたとき、φθ0(x)=1{θ0∉C(x)}\varphi_{\theta_0}(x)=\mathbf1_{\{\theta_0\notin C(x)\}}と定めると、φθ0\varphi_{\theta_0}はH0:θ=θ0H_0:\theta=\theta_0の水準α\alphaの検定である。

証明.(1)を示す。θ∈Θ\theta\in\Thetaを固定する。φθ\varphi_\thetaの可測性により{(x,u):u>φθ(x)}\{(x,u):u>\varphi_\theta(x)\}は積可測集合である。条件付き確率をUUについて計算すると、

Pθ(θ∈C(X,U))=Pθ(U>φθ(X))=Eθ[1−φθ(X)]≥1−αP_\theta\bigl(\theta\in C(X,U)\bigr)=P_\theta\bigl(U>\varphi_\theta(X)\bigr)=E_\theta[1-\varphi_\theta(X)]\geq1-\alpha

となる。最後の不等号はφθ\varphi_\thetaが単純帰無仮説H0:θ=θH_0:\theta=\thetaの水準α\alphaの検定であることによる。期待値がα\alphaに等しければ、表示した不等号も等号になる。

(2)を示す。CCの定義から

θ0∉C(x,u)⟺u≤φθ0(x)\theta_0\notin C(x,u)\quad\Longleftrightarrow\quad u\leq\varphi_{\theta_0}(x)

であり、右辺は検定関数を補助変数で実現した棄却規則である。

逆向きでは、信頼集合の可測性によりφθ0\varphi_{\theta_0}は可測である。θ=θ0\theta=\theta_0の下で

Eθ0[φθ0(X)]=Pθ0(θ0∉C(X))≤αE_{\theta_0}[\varphi_{\theta_0}(X)]=P_{\theta_0}\bigl(\theta_0\notin C(X)\bigr)\leq\alpha

となるため、φθ0\varphi_{\theta_0}は水準α\alphaの検定である。▨

4 正規母集団の区間

例 4.1.n≥2n\geq2、0<α<10<\alpha<1とし、X1,…,XnX_1,\ldots,X_nをN(μ,σ2)N(\mu,\sigma^2)からの無作為標本とする。Xˉ\bar Xを標本平均、S2S^2を不偏標本分散とする。Φ\Phiを標準正規分布関数とし、自由度n−1n-1のtt分布の下側pp分位点をqtn−1(p)q_{t_{n-1}}(p)と書く。

  1. σ2>0\sigma^2>0が既知ならば、 [Xˉ−Φ−1(1−α/2)σn,Xˉ+Φ−1(1−α/2)σn]\left[\bar X-\Phi^{-1}(1-\alpha/2)\frac{\sigma}{\sqrt n},\bar X+\Phi^{-1}(1-\alpha/2)\frac{\sigma}{\sqrt n}\right] はμ\muの水準1−α1-\alphaの正確な信頼区間である。
  2. σ2>0\sigma^2>0が未知ならば、 [Xˉ−qtn−1(1−α/2)Sn,Xˉ+qtn−1(1−α/2)Sn]\left[\bar X-q_{t_{n-1}}(1-\alpha/2)\frac S{\sqrt n},\bar X+q_{t_{n-1}}(1-\alpha/2)\frac S{\sqrt n}\right] はμ\muの水準1−α1-\alphaの正確な信頼区間である。

n=16n=16、Xˉ=100\bar X=100、S=8S=8のとき、95%95\%の t 区間を求める。qt15(0.975)≈2.1314q_{t_{15}}(0.975)\approx2.1314である。分位点を小数第4位まで丸めて計算すると、標準誤差はS/n=2S/\sqrt n=2であるから、区間端点の表示計算は

100±2.1314⋅2=[95.7372,104.2628]100\pm2.1314\cdot2=[95.7372,104.2628]

である。小数第3位まで丸めれば[95.737,104.263][95.737,104.263]となる。比較のためσ=8\sigma=8が既知ならば、Φ−1(0.975)≈1.9600\Phi^{-1}(0.975)\approx1.9600から z 区間の表示計算は100±1.9600⋅2=[96.080,103.920]100\pm1.9600\cdot2=[96.080,103.920]となる。

証明.(1)を示す。§E14.3 定理 4.1によりZ=n(Xˉ−μ)/σ∼N(0,1)Z=\sqrt n(\bar X-\mu)/\sigma\sim N(0,1)であり、標準正規分布の対称性により

Pμ,σ2(−Φ−1(1−α/2)≤Z≤Φ−1(1−α/2))=1−αP_{\mu,\sigma^2}\bigl(-\Phi^{-1}(1-\alpha/2)\leq Z\leq \Phi^{-1}(1-\alpha/2)\bigr)=1-\alpha

となる。この事象をμ\muについて解くと(1)の区間を得る。

(2)を示す。§E14.3 定理 4.3によりT=(Xˉ−μ)/(S/n)∼tn−1T=(\bar X-\mu)/(S/\sqrt n)\sim t_{n-1}である。§E14.3 命題 2.4の分位点の対称性から

Pμ,σ2(−qtn−1(1−α/2)≤T≤qtn−1(1−α/2))=1−αP_{\mu,\sigma^2}\bigl(-q_{t_{n-1}}(1-\alpha/2)\leq T\leq q_{t_{n-1}}(1-\alpha/2)\bigr)=1-\alpha

であり、この事象をμ\muについて解くと(2)の区間を得る。▨

命題 4.2.n≥2n\geq2、0<α<10<\alpha<1、σ2>0\sigma^2>0とし、X1,…,XnX_1,\ldots,X_nをN(μ,σ2)N(\mu,\sigma^2)からの無作為標本とする。S2S^2を不偏標本分散とし、qχn−12(p)q_{\chi^2_{n-1}}(p)を自由度n−1n-1のカイ二乗分布の下側pp分位点とする。このとき

C(X)={[(n−1)S2qχn−12(1−α/2),(n−1)S2qχn−12(α/2)],S2>0,[1,1],S2=0C(X)= \begin{cases} \displaystyle\left[\frac{(n-1)S^2}{q_{\chi^2_{n-1}}(1-\alpha/2)},\frac{(n-1)S^2}{q_{\chi^2_{n-1}}(\alpha/2)}\right],&S^2>0,\\[8pt] [1,1],&S^2=0 \end{cases}

はσ2\sigma^2の水準1−α1-\alphaの正確な信頼区間である。

証明.§E14.3 定理 4.1によりW=(n−1)S2/σ2∼χn−12W=(n-1)S^2/\sigma^2\sim\chi^2_{n-1}である。カイ二乗分布は00に質量をもたないため、Pμ,σ2(S2>0)=1P_{\mu,\sigma^2}(S^2>0)=1である。したがってS2=0S^2=0で指定した正の一点区間は被覆確率を変えず、すべての標本点でC(X)C(X)は母数空間(0,∞)(0,\infty)の空でない閉区間になる。さらに、S2S^2の可測性から、各σ2>0\sigma^2>0に対する包含事象{σ2∈C(X)}\{\sigma^2\in C(X)\}は可測である。

§E14.3 命題 2.4により

Pμ,σ2(qχn−12(α/2)≤W≤qχn−12(1−α/2))=1−αP_{\mu,\sigma^2}\left(q_{\chi^2_{n-1}}(\alpha/2)\leq W\leq q_{\chi^2_{n-1}}(1-\alpha/2)\right)=1-\alpha

となる。二つの分位点は正であり、表示した不等式をσ2\sigma^2について解くとσ2∈C(X)\sigma^2\in C(X)を得る。ゆえにPμ,σ2(σ2∈C(X))=1−αP_{\mu,\sigma^2}(\sigma^2\in C(X))=1-\alphaである。▨

5 二項モデルの区間

§E14.2 補題 2.1の二項尾確率の連続性と単調性を用いて、区間の両端を定める。

定理 5.1 (Clopper–Pearson 区間).n≥1n\geq1、0<α<10<\alpha<1とし、X∼Bin⁡(n,p)X\sim\operatorname{Bin}(n,p)、p∈[0,1]p\in[0,1]とする。各x∈{0,…,n}x\in\{0,\ldots,n\}に対して、下端L(x)L(x)と上端U(x)U(x)を次のように定める。

  1. L(0)=0L(0)=0とする。1≤x≤n1\leq x\leq nでは、L(x)∈(0,1)L(x)\in(0,1)をPL(x)(X≥x)=α/2P_{L(x)}(X\geq x)=\alpha/2の一意な解とする。
  2. U(n)=1U(n)=1とする。0≤x≤n−10\leq x\leq n-1では、U(x)∈(0,1)U(x)\in(0,1)をPU(x)(X≤x)=α/2P_{U(x)}(X\leq x)=\alpha/2の一意な解とする。

このときL(x)<U(x)L(x)<U(x)がすべてのxxで成り立ち、[L(X),U(X)][L(X),U(X)]はppの水準1−α1-\alphaの信頼区間である。すなわち、すべてのp∈[0,1]p\in[0,1]に対して

Pp(L(X)≤p≤U(X))≥1−αP_p\bigl(L(X)\leq p\leq U(X)\bigr)\geq1-\alpha

が成り立つ。この区間を Clopper–Pearson 区間という。

証明.§E14.2 補題 2.1と中間値の定理により、1≤x≤n1\leq x\leq nに対するL(x)L(x)と0≤x≤n−10\leq x\leq n-1に対するU(x)U(x)はそれぞれ存在して一意である。

1≤x<n1\leq x<nでは、0<L(x)<10<L(x)<1であるため

Tx+1(L(x))=Tx(L(x))−PL(x)(X=x)<α2=Tx+1(L(x+1)).T_{x+1}(L(x))=T_x(L(x))-P_{L(x)}(X=x)<\frac\alpha2=T_{x+1}(L(x+1)).

Tx+1T_{x+1}の狭義増加性によりL(x)<L(x+1)L(x)<L(x+1)である。同様に、0≤x<n−10\leq x<n-1では

Hx+1(U(x))=Hx(U(x))+PU(x)(X=x+1)>α2=Hx+1(U(x+1)).H_{x+1}(U(x))=H_x(U(x))+P_{U(x)}(X=x+1)>\frac\alpha2=H_{x+1}(U(x+1)).

Hx+1H_{x+1}の狭義減少性によりU(x)<U(x+1)U(x)<U(x+1)である。したがってLLとUUは標本値について非減少である。

1≤x≤n−11\leq x\leq n-1とする。PL(x)(X≥x)=α/2P_{L(x)}(X\geq x)=\alpha/2であるから

PL(x)(X≤x)=1−PL(x)(X≥x+1)>1−α2>α2.P_{L(x)}(X\leq x)=1-P_{L(x)}(X\geq x+1)>1-\frac\alpha2>\frac\alpha2.

p↦Pp(X≤x)p\mapsto P_p(X\leq x)は狭義単調減少であり、U(x)U(x)ではα/2\alpha/2に等しいため、L(x)<U(x)L(x)<U(x)である。x=0x=0ではL(0)=0<U(0)L(0)=0<U(0)、x=nx=nではL(n)<1=U(n)L(n)<1=U(n)となる。

p∈(0,1)p\in(0,1)を固定する。単純帰無仮説の下で成功確率をppとし、検定統計量をそれぞれXXと−X-Xとすると、

pp+(x)=Pp(X≥x),pp−(x)=Pp(X≤x)p_p^+(x)=P_p(X\geq x),\qquad p_p^-(x)=P_p(X\leq x)

は上側確率から定まる p 値である。したがって§E14.14 定義 3.1 (1)により、任意のa∈[0,1]a\in[0,1]に対して

Pp(pp+(X)≤a)≤a,Pp(pp−(X)≤a)≤aP_p\bigl(p_p^+(X)\leq a\bigr)\leq a,\qquad P_p\bigl(p_p^-(X)\leq a\bigr)\leq a

が成り立つ。

x≥1x\geq1ではTx(L(x))=α/2T_x(L(x))=\alpha/2であり、TxT_xは狭義増加であるから、L(x)>pL(x)>pとpp+(x)<α/2p_p^+(x)<\alpha/2は同値である。x=0x=0でも両方とも偽であるため、

{L(X)>p}={pp+(X)<α/2}\{L(X)>p\}=\{p_p^+(X)<\alpha/2\}

となる。この事象が空でなければ、有限集合{x:pp+(x)<α/2}\{x:p_p^+(x)<\alpha/2\}上でpp+(x)p_p^+(x)の最大値a+a_+を取ることができ、a+<α/2a_+<\alpha/2である。p 値の水準保証から

Pp(L(X)>p)=Pp(pp+(X)≤a+)≤a+<α2P_p(L(X)>p)=P_p\bigl(p_p^+(X)\leq a_+\bigr)\leq a_+<\frac\alpha2

を得る。事象が空ならば、この確率は00である。

同様に、x≤n−1x\leq n-1ではHx(U(x))=α/2H_x(U(x))=\alpha/2であり、HxH_xは狭義減少であるから、U(x)<pU(x)<pとpp−(x)<α/2p_p^-(x)<\alpha/2は同値である。x=nx=nでも両方とも偽であるため、

{U(X)<p}={pp−(X)<α/2}\{U(X)<p\}=\{p_p^-(X)<\alpha/2\}

となる。この事象が空でなければ、有限集合{x:pp−(x)<α/2}\{x:p_p^-(x)<\alpha/2\}上でpp−(x)p_p^-(x)の最大値a−a_-を取ることができ、a−<α/2a_-<\alpha/2である。したがって

Pp(U(X)<p)=Pp(pp−(X)≤a−)≤a−<α2P_p(U(X)<p)=P_p\bigl(p_p^-(X)\leq a_-\bigr)\leq a_-<\frac\alpha2

を得る。事象が空ならば、この確率は00である。二つの非被覆事象は互いに素であるから、

Pp(p∉[L(X),U(X)])=Pp(L(X)>p)+Pp(U(X)<p)<αP_p\bigl(p\notin[L(X),U(X)]\bigr)=P_p(L(X)>p)+P_p(U(X)<p)<\alpha

を得る。

p=0p=0ではX=0X=0がほとんど確実に成り立ち、L(0)=0<U(0)L(0)=0<U(0)である。p=1p=1ではX=nX=nがほとんど確実に成り立ち、L(n)<1=U(n)L(n)<1=U(n)である。したがって二つの端点でも被覆確率は11であり、主張は[0,1][0,1]全体で成り立つ。▨

例 5.2.n=10n=10回の試行で成功回数がX=0X=0であり、信頼水準を95%95\%、すなわちα=0.05\alpha=0.05とする。下端はL(0)=0L(0)=0である。上端を定める方程式は

PU(0)(X=0)=(1−U(0))10=0.025P_{U(0)}(X=0)=(1-U(0))^{10}=0.025

であるから、

[L(0),U(0)]=[0,1−0.0251/10]≈[0,0.3085][L(0),U(0)]=\left[0,1-0.025^{1/10}\right]\approx[0,0.3085]

となる。成功が一度も観測されなくても、成功確率が00であるとは確定しない。この区間は、標本数が1010のときに有限標本の被覆保証を保ちながら残すべき成功確率の候補を表す。

注意 5.3. Clopper–Pearson 区間は、二つの片側尾確率をそれぞれα/2\alpha/2未満に抑える検定を反転した区間である。二項分布では棄却確率が標本値ごとに跳ぶため、被覆確率は一般に1−α1-\alphaより大きい。したがって、この区間に対する「exact」は正規区間のように被覆確率がすべての母数で指定値に一致するという意味ではなく、漸近近似を用いない有限標本保証を表す慣用である。

前提記事