1 信頼集合と被覆確率
定義 1.1. 可測空間(X,A)上の確率測度族(Pθ)θ∈Θを統計モデルとする。各x∈Xに対して集合C(x)⊆Θが定まり、各θ∈Θに対して{x∈X:θ∈C(x)}∈Aが成り立つとする。0<α<1とする。
Cが水準1−αの信頼集合 (confidence set) であるとは、すべてのθ∈Θに対して
Pθ(θ∈C(X))≥1−αが成り立つことをいう。左辺をθにおける被覆確率 (coverage probability) といい、1−αを信頼係数 (confidence coefficient) または信頼水準 (confidence level) という。被覆確率がすべてのθ∈Θで1−αに等しいとき、Cを水準1−αの正確な信頼集合 (exact confidence set) という。
Θ⊆Rであり、各x∈Xに対してC(x)が空でない閉区間であるとき、Cを水準1−αの信頼区間 (confidence interval) という。正確な信頼集合でもある信頼区間を正確な信頼区間 (exact confidence interval) という。
2 枢軸量による構成
命題 2.1. 関数Q:X×Θ→Rについて、各θ∈Θに対する切片Q(⋅,θ)が可測であり、Pθの下で同じ分布Gに従うとする。B⊆Rを Borel 集合とし、G(B)=1−αとおく。このとき
C(x)={θ∈Θ:Q(x,θ)∈B}は水準1−αの正確な信頼集合である。
さらに、Θが区間、B=[a,b]であり、各x∈Xに対してθ↦Q(x,θ)が連続かつ狭義単調で、その値域が[a,b]を含むとする。このときC(x)は閉区間であり、その二つの端点は方程式Q(x,θ)=a,bの解で与えられる。
証明.θ∈Θを固定する。Q(⋅,θ)の可測性により{x:θ∈C(x)}={x:Q(x,θ)∈B}は可測であり、
Pθ(θ∈C(X))=Pθ(Q(X,θ)∈B)=G(B)=1−αが成り立つ。したがってCは正確な信頼集合である。
B=[a,b]とし、θ↦Q(x,θ)が狭義増加である場合を考える。連続性、狭義単調性および値域の仮定により、Q(x,θa)=aとQ(x,θb)=bを満たすθa,θb∈Θが一意に存在し、
a≤Q(x,θ)≤b⟺θa≤θ≤θbとなる。狭義減少の場合には二つの端点の順序を入れ替えれば同じ結論を得る。▨
3 検定との双対性
定理 3.1. 可測空間(X,A)上の統計モデル(Pθ)θ∈Θを取り、各θ0∈Θに対して単純帰無仮説H0:θ=θ0の水準αの検定φθ0:X→[0,1]が与えられているとする。標本Xと独立なU∼Unif(0,1)を取り、
C(x,u)={θ0∈Θ:u>φθ0(x)}と定める。このとき次が成り立つ。
- C(X,U)は水準1−αの信頼集合である。各θに対してEθ[φθ(X)]=αならば、被覆確率はすべてのθで1−αに等しい。
- θ0∈/C(x,u)であることと、補助変数の値がuであるときに検定φθ0がH0:θ=θ0を棄却することは同値である。
逆に、水準1−αの信頼集合C(X)が与えられたとき、φθ0(x)=1{θ0∈/C(x)}と定めると、φθ0はH0:θ=θ0の水準αの検定である。
証明.(1)を示す。θ∈Θを固定する。φθの可測性により{(x,u):u>φθ(x)}は積可測集合である。条件付き確率をUについて計算すると、
Pθ(θ∈C(X,U))=Pθ(U>φθ(X))=Eθ[1−φθ(X)]≥1−αとなる。最後の不等号はφθが単純帰無仮説H0:θ=θの水準αの検定であることによる。期待値がαに等しければ、表示した不等号も等号になる。
(2)を示す。Cの定義から
θ0∈/C(x,u)⟺u≤φθ0(x)であり、右辺は検定関数を補助変数で実現した棄却規則である。
逆向きでは、信頼集合の可測性によりφθ0は可測である。θ=θ0の下で
Eθ0[φθ0(X)]=Pθ0(θ0∈/C(X))≤αとなるため、φθ0は水準αの検定である。▨
4 正規母集団の区間
例 4.1.n≥2、0<α<1とし、X1,…,XnをN(μ,σ2)からの無作為標本とする。Xˉを標本平均、S2を不偏標本分散とする。Φを標準正規分布関数とし、自由度n−1のt分布の下側p分位点をqtn−1(p)と書く。
- σ2>0が既知ならば、
[Xˉ−Φ−1(1−α/2)nσ,Xˉ+Φ−1(1−α/2)nσ]
はμの水準1−αの正確な信頼区間である。
- σ2>0が未知ならば、
[Xˉ−qtn−1(1−α/2)nS,Xˉ+qtn−1(1−α/2)nS]
はμの水準1−αの正確な信頼区間である。
n=16、Xˉ=100、S=8のとき、95%の t 区間を求める。qt15(0.975)≈2.1314である。分位点を小数第4位まで丸めて計算すると、標準誤差はS/n=2であるから、区間端点の表示計算は
100±2.1314⋅2=[95.7372,104.2628]である。小数第3位まで丸めれば[95.737,104.263]となる。比較のためσ=8が既知ならば、Φ−1(0.975)≈1.9600から z 区間の表示計算は100±1.9600⋅2=[96.080,103.920]となる。
証明.(1)を示す。§E14.3 定理 4.1によりZ=n(Xˉ−μ)/σ∼N(0,1)であり、標準正規分布の対称性により
Pμ,σ2(−Φ−1(1−α/2)≤Z≤Φ−1(1−α/2))=1−αとなる。この事象をμについて解くと(1)の区間を得る。
(2)を示す。§E14.3 定理 4.3によりT=(Xˉ−μ)/(S/n)∼tn−1である。§E14.3 命題 2.4の分位点の対称性から
Pμ,σ2(−qtn−1(1−α/2)≤T≤qtn−1(1−α/2))=1−αであり、この事象をμについて解くと(2)の区間を得る。▨
命題 4.2.n≥2、0<α<1、σ2>0とし、X1,…,XnをN(μ,σ2)からの無作為標本とする。S2を不偏標本分散とし、qχn−12(p)を自由度n−1のカイ二乗分布の下側p分位点とする。このとき
C(X)=⎩⎨⎧[qχn−12(1−α/2)(n−1)S2,qχn−12(α/2)(n−1)S2],[1,1],S2>0,S2=0はσ2の水準1−αの正確な信頼区間である。
証明.§E14.3 定理 4.1によりW=(n−1)S2/σ2∼χn−12である。カイ二乗分布は0に質量をもたないため、Pμ,σ2(S2>0)=1である。したがってS2=0で指定した正の一点区間は被覆確率を変えず、すべての標本点でC(X)は母数空間(0,∞)の空でない閉区間になる。さらに、S2の可測性から、各σ2>0に対する包含事象{σ2∈C(X)}は可測である。
§E14.3 命題 2.4により
Pμ,σ2(qχn−12(α/2)≤W≤qχn−12(1−α/2))=1−αとなる。二つの分位点は正であり、表示した不等式をσ2について解くとσ2∈C(X)を得る。ゆえにPμ,σ2(σ2∈C(X))=1−αである。▨
5 二項モデルの区間
§E14.2 補題 2.1の二項尾確率の連続性と単調性を用いて、区間の両端を定める。
定理 5.1 (Clopper–Pearson 区間).n≥1、0<α<1とし、X∼Bin(n,p)、p∈[0,1]とする。各x∈{0,…,n}に対して、下端L(x)と上端U(x)を次のように定める。
- L(0)=0とする。1≤x≤nでは、L(x)∈(0,1)をPL(x)(X≥x)=α/2の一意な解とする。
- U(n)=1とする。0≤x≤n−1では、U(x)∈(0,1)をPU(x)(X≤x)=α/2の一意な解とする。
このときL(x)<U(x)がすべてのxで成り立ち、[L(X),U(X)]はpの水準1−αの信頼区間である。すなわち、すべてのp∈[0,1]に対して
Pp(L(X)≤p≤U(X))≥1−αが成り立つ。この区間を Clopper–Pearson 区間という。
証明.§E14.2 補題 2.1と中間値の定理により、1≤x≤nに対するL(x)と0≤x≤n−1に対するU(x)はそれぞれ存在して一意である。
1≤x<nでは、0<L(x)<1であるため
Tx+1(L(x))=Tx(L(x))−PL(x)(X=x)<2α=Tx+1(L(x+1)).Tx+1の狭義増加性によりL(x)<L(x+1)である。同様に、0≤x<n−1では
Hx+1(U(x))=Hx(U(x))+PU(x)(X=x+1)>2α=Hx+1(U(x+1)).Hx+1の狭義減少性によりU(x)<U(x+1)である。したがってLとUは標本値について非減少である。
1≤x≤n−1とする。PL(x)(X≥x)=α/2であるから
PL(x)(X≤x)=1−PL(x)(X≥x+1)>1−2α>2α.p↦Pp(X≤x)は狭義単調減少であり、U(x)ではα/2に等しいため、L(x)<U(x)である。x=0ではL(0)=0<U(0)、x=nではL(n)<1=U(n)となる。
p∈(0,1)を固定する。単純帰無仮説の下で成功確率をpとし、検定統計量をそれぞれXと−Xとすると、
pp+(x)=Pp(X≥x),pp−(x)=Pp(X≤x)は上側確率から定まる p 値である。したがって§E14.14 定義 3.1 (1)により、任意のa∈[0,1]に対して
Pp(pp+(X)≤a)≤a,Pp(pp−(X)≤a)≤aが成り立つ。
x≥1ではTx(L(x))=α/2であり、Txは狭義増加であるから、L(x)>pとpp+(x)<α/2は同値である。x=0でも両方とも偽であるため、
{L(X)>p}={pp+(X)<α/2}となる。この事象が空でなければ、有限集合{x:pp+(x)<α/2}上でpp+(x)の最大値a+を取ることができ、a+<α/2である。p 値の水準保証から
Pp(L(X)>p)=Pp(pp+(X)≤a+)≤a+<2αを得る。事象が空ならば、この確率は0である。
同様に、x≤n−1ではHx(U(x))=α/2であり、Hxは狭義減少であるから、U(x)<pとpp−(x)<α/2は同値である。x=nでも両方とも偽であるため、
{U(X)<p}={pp−(X)<α/2}となる。この事象が空でなければ、有限集合{x:pp−(x)<α/2}上でpp−(x)の最大値a−を取ることができ、a−<α/2である。したがって
Pp(U(X)<p)=Pp(pp−(X)≤a−)≤a−<2αを得る。事象が空ならば、この確率は0である。二つの非被覆事象は互いに素であるから、
Pp(p∈/[L(X),U(X)])=Pp(L(X)>p)+Pp(U(X)<p)<αを得る。
p=0ではX=0がほとんど確実に成り立ち、L(0)=0<U(0)である。p=1ではX=nがほとんど確実に成り立ち、L(n)<1=U(n)である。したがって二つの端点でも被覆確率は1であり、主張は[0,1]全体で成り立つ。▨
例 5.2.n=10回の試行で成功回数がX=0であり、信頼水準を95%、すなわちα=0.05とする。下端はL(0)=0である。上端を定める方程式は
PU(0)(X=0)=(1−U(0))10=0.025であるから、
[L(0),U(0)]=[0,1−0.0251/10]≈[0,0.3085]となる。成功が一度も観測されなくても、成功確率が0であるとは確定しない。この区間は、標本数が10のときに有限標本の被覆保証を保ちながら残すべき成功確率の候補を表す。