1 事前分布と事後分布
定義 1.1.(Θ,T,ν)と(X,A,μ)をシグマ有限測度空間とする。関数f:X×Θ→[0,∞)は共同可測であり、各θ∈Θについて
∫Xf(x∣θ)μ(dx)=1を満たすとする。また、π:Θ→[0,∞)は可測であり、∫Θπdν=1を満たすとする。
確率測度Π(dθ)=π(θ)ν(dθ)を母数θの 事前分布 (prior distribution) という。θを与えたときの観測Xの条件付き密度をf(x∣θ)とする。観測値xを固定した関数θ↦f(x∣θ)は§E14.4 定義 1.1の尤度である。X=xを観測した後のθの条件付き分布を 事後分布 (posterior distribution) という。
さらに、将来の観測Xがθを与えたもとでXと条件付き独立であるとする。X=xを観測した後のXの条件付き分布を 事後予測分布 (posterior predictive distribution) という。
この定式化は、μとνに計数測度を選べば離散モデルを含み、Lebesgue 測度を選べば通常の連続密度モデルを含む。事前分布を確率測度と仮定することにより、以下では improper prior を扱わない。
定理 1.2.定義 1.1の仮定のもとで
m(x)=∫Θf(x∣θ)π(θ)ν(dθ)とおく。このときmはXの周辺密度である。0<m(x)<∞を満たすxに対して、事後分布はνに関する密度
π(θ∣x)=m(x)f(x∣θ)π(θ)をもつ。m(x)=0またはm(x)=∞であるxではπ(θ∣x)=π(θ)と補完すると、x↦π(⋅∣x)νはすべてのxで定義された確率核となる。
さらに、任意のB∈AとC∈Tに対して
∫B{∫Cπ(θ∣x)ν(dθ)}m(x)μ(dx)=∫C{∫Bf(x∣θ)μ(dx)}π(θ)ν(dθ)が成り立つ。したがって、表示した確率核は事前予測分布に関してほとんどすべてのxでθの条件付き分布を与える。
証明. 共同可測な非負関数f(x∣θ)π(θ)に Tonelli の定理を適用すると、mは可測であり、
∫Xm(x)μ(dx)=∫Θ{∫Xf(x∣θ)μ(dx)}π(θ)ν(dθ)=1を満たす。したがってmは周辺密度であり、m(x)=∞となる集合はμ零集合である。また、m(x)=0またはm(x)=∞となる集合の事前予測確率は零である。
0<m(x)<∞ならば、π(θ∣x)は非負可測であり、そのν積分は1である。例外集合では proper な事前密度πで補完したので、すべてのxについて確率密度を得る。共同可測性から、この補完後の関数(x,θ)↦π(θ∣x)も共同可測である。
最後に、事前予測測度で零である例外集合を除けば
π(θ∣x)m(x)=f(x∣θ)π(θ)である。両辺をB×C上で積分し、Tonelli の定理を適用すると、主張した条件付き積分等式を得る。▨
観測値xを固定すると、分母m(x)はθに依存しない。したがって事後密度を母数の関数として比較するときには
π(θ∣x)∝f(x∣θ)π(θ)
と書くことができる。この比例式を確率密度として用いるためには、分母が正かつ有限であることを別に確認する必要がある。
2 事後予測分布
命題 2.1.定義 1.1の仮定に加え、(X,A,μ)をシグマ有限測度空間とし、将来値Xのθを与えた条件付き密度f(x∣θ)は共同可測であるとする。XとXがθを与えたもとで条件付き独立であるならば、X=xを観測した後のXの事後予測密度は、事前予測に関してほとんどすべてのxについて
p(x∣x)=∫Θf(x∣θ)π(θ∣x)ν(dθ)である。
証明. 右辺は非負かつxの可測関数である。Tonelli の定理により
∫Xp(x∣x)μ(dx)=∫Θ{∫Xf(x∣θ)μ(dx)}π(θ∣x)ν(dθ)=1である。条件付き独立性により、θを与えた(X,X)の同時密度はf(x∣θ)f(x∣θ)である。0<m(x)<∞ならば定理 1.2の事後密度の式から
m(x)p(x∣x)=∫Θf(x∣θ)f(x∣θ)π(θ)ν(dθ)を得る。両辺を観測値と将来値の可測集合上で積分し、Tonelli の定理を適用すると、右辺は(X,X)の同時確率を与える。例外集合の事前予測確率は零であるから、表示した混合密度は事前予測に関してほとんどすべてのxで条件付き密度を与える。▨
3 事後損失と Bayes 推定量
定義 3.1.定義 1.1の統計モデルを考え、(A,G)を可測な行動空間、τ:Θ→Aを可測な推定対象とする。L:Θ×A→[0,∞]を共同可測な損失関数とし、可測な推定量δ:X→Aの固定母数リスクを§E14.6 定義 1.2の意味でRθ(δ)とする。
決定則δの Bayes 平均リスク (Bayes risk) を
rΠ(δ)=∫ΘRθ(δ)Π(dθ)で定める。すべての可測な決定則の中で Bayes 平均リスクを最小にする決定則を Bayes 推定量 (Bayes estimator) という。また、観測値xにおける 事後平均損失 (posterior expected loss) を
rx(a)=∫ΘL(θ,a)π(θ∣x)ν(dθ)で定める。
定理 3.2.定義 3.1の仮定のもとで、任意の可測な決定則δに対して
rΠ(δ)=∫Xrx(δ(x))m(x)μ(dx)が成り立つ。可測な決定則δ∗が存在し、事前予測に関してほとんどすべてのxで
rx(δ∗(x))≤rx(a)(a∈A)を満たすならば、δ∗は Bayes 推定量である。
証明. 損失、密度および決定則の共同可測性により、以下の被積分関数は非負可測である。Tonelli の定理と定理 1.2を順に用いると
rΠ(δ)=∫Θ∫XL(θ,δ(x))f(x∣θ)μ(dx)π(θ)ν(dθ)=∫X∫ΘL(θ,δ(x))π(θ∣x)ν(dθ)m(x)μ(dx)=∫Xrx(δ(x))m(x)μ(dx)を得る。点ごとの最小性から、任意の可測な決定則δに対してrx(δ∗(x))≤rx(δ(x))が事前予測に関してほとんど確実に成り立つ。この不等式を積分するとrΠ(δ∗)≤rΠ(δ)を得る。▨
定理は、点ごとの最小化解から可測な決定則を選ぶことができるとは主張していない。Bayes 推定量をこの方法で構成するときには、最小化解の存在と選択の可測性を確認する必要がある。
命題 3.3.Θ⊆Rとし、行動空間をR、損失をL(θ,a)=(θ−a)2とする。固定した観測値xにおいて事後二次積率が有限であるならば、事後平均
μx=∫Θθπ(θ∣x)ν(dθ)は事後平均損失を一意に最小にし、任意のa∈Rに対して
rx(a)=rx(μx)+(a−μx)2が成り立つ。すべてのxで事後二次積率が有限であるならば、x↦μxは可測であり、定理 3.2によって Bayes 推定量を与える。
証明. 事後二次積率の有限性から事後平均も有限である。恒等式
θ−a=(θ−μx)+(μx−a)を二乗して事後分布について積分すると、交差項は
2(μx−a)∫Θ(θ−μx)π(θ∣x)ν(dθ)=0となる。したがって表示した分解を得る。(a−μx)2はa=μxのとき、かつそのときに限って零であるため、最小点は一意である。最後に、可測な確率核に対する非負関数の積分は可測であり、正負部分を用いれば有限な事後平均x↦μxも可測である。▨
例 3.4 (同じ事後分布に対する損失の比較). 未知の状態をθ∈{0,1}、観測後に選ぶ行動をa∈{0,1}とし、ある観測値xに対して
P(θ=1∣x)=53,P(θ=0∣x)=52を得たとする。将来の観測値を予測する問題ではなく、行動aを未知の状態θと比較する決定問題を考える。
誤った行動の損失をともに1とする、すなわちL(0,1)=L(1,0)=1、L(0,0)=L(1,1)=0とすると、事後平均損失は
rx(0)=53,rx(1)=52であるから、行動a=1を選ぶ。一方、偽陽性に相当するL(0,1)を2、偽陰性に相当するL(1,0)を1とすると、
rx(0)=53,rx(1)=2⋅52=54となるから、同じ事後分布に対して行動a=0を選ぶ。Bayes 決定は事後分布だけでなく、各行動の損失にも依存する。
4 共役事前分布
定義 4.1. 尤度の族に対し、事前分布の族Pが 共役 (conjugate prior) であるとは、Π∈Pならば、0<m(x)<∞を満たす各観測値xに対する事後分布も同じ族Pに属することをいう。
命題 4.2. 次の三つの事前分布族は共役であり、事後分布は以下のように更新される。
- n∈N≥0、X∣θ∼Bin(n,θ)、θ∼Beta(a,b)、a,b>0ならば、x∈{0,…,n}のもとで
θ∣x∼Beta(a+x,b+n−x),E[θ∣x]=a+b+na+x
である。
- n∈N≥1、X1,…,Xn∣μが独立にN(μ,σ2)に従い、σ2>0が既知であるとする。μ∼N(μ0,τ2)、τ2>0ならば、
μ∣x∼N(μn,vn),vn=(τ21+σ2n)−1,μn=vn(τ2μ0+σ2nx).
- n∈N≥1、X1,…,Xn∣λが独立にPois(λ)に従い、λ∼Gamma(a,b)、a,b>0とする。Gamma 分布の第二母数を rate とすると、
λ∣x∼Gamma(a+i=1∑nxi,b+n).
証明.(1)を示す。x∈{0,…,n}における二項尤度と Beta 事前密度の積は
(xn)θx(1−θ)n−xB(a,b)θa−1(1−θ)b−1=B(a,b)(xn)θa+x−1(1−θ)b+n−x−1である。a+x>0かつb+n−x>0であり、§E14.3 定義 1.2によって正規化するとBeta(a+x,b+n−x)の密度を得る。さらに、§E14.3 命題 1.4をq=1として適用すると、事後平均は(a+x)/(a+b+n)となる。
(2)を示す。μに依存しない正因子を除く事後密度の核の対数は
−2σ21i=1∑n(xi−μ)2−2τ2(μ−μ0)2.∑i(xi−μ)2=∑i(xi−x)2+n(μ−x)2を代入し、μについて平方完成すると、この式はμに依存しない項を除いて
−2vn1(μ−μn)2となる。vn>0であるから正規化することができ、表示した正規事後分布を得る。
(3)を示す。s=∑i=1nxiとおく。Poisson 尤度と shapea、ratebの Gamma 事前密度の積は、λに依存しない正因子を除いて
e−nλλsλa−1e−bλ=λa+s−1e−(b+n)λである。a+s>0かつb+n>0であり、§E14.3 定義 1.1によって正規化するとGamma(a+s,b+n)の密度を得る。▨
5 信用集合と信用区間
定義 5.1.0<α<1とする。観測値xを固定し、C∈Tが
P(θ∈C∣x)=∫Cπ(θ∣x)ν(dθ)≥1−αを満たすとき、Cを 水準1−αの信用集合 (credible set at level 1-alpha) という。Θ⊆Rであり、Cが区間であるとき、Cを 水準1−αの信用区間 (credible interval at level 1-alpha) という。
実数値の連続な事後分布では、下側確率と上側確率をそれぞれα/2とする等裾信用区間を選ぶことができる。事後密度の高い点を優先して集める最高事後密度集合も選択肢になるが、密度の平坦な部分や複数の峰がある場合には、最高事後密度集合が一意に定まるとは限らず、区間になるとも限らない。
信用集合の確率は、観測後の事後分布において計算する。母数を固定して標本を反復したときの被覆確率は別の量であり、信用集合の定義だけから頻度論的な被覆保証は従わない。
例 5.2 (信用区間の被覆確率が零になる場合).θ∼Beta(1,1)とし、θのもとで一回の観測X∼Bernoulli(θ)を行う。この分布はBin(1,θ)であるから、命題 4.2により、X=0のときの事後分布はBeta(1,2)である。その累積分布関数は1−(1−t)2であるため、等裾95%信用区間は
C0=[1−0.975,1−0.025]≈[0.012579,0.841886]となる。X=1のときの事後分布はBeta(2,1)であり、その累積分布関数はt2であるから、等裾95%信用区間は
C1=[0.025,0.975]≈[0.158114,0.987421]となる。
真の母数をθ∗=0.01に固定すると、θ∗はC0にもC1にも属さない。観測値は0または1のいずれかであるため、反復標本抽出における被覆確率は
Pθ∗(θ∗∈CX)=0である。この例では、各観測後の区間が事後確率0.95をもつ一方で、固定した真の母数に対する頻度論的被覆確率は0になる。
例 5.3 (コイン投げの事後更新). コインが表を出す確率をθとし、事前分布をBeta(2,2)とする。この事前分布の平均は1/2=0.5である。コインをn=10回投げて表をx=7回観測すると、命題 4.2により
θ∣x∼Beta(2+7,2+10−7)=Beta(9,5)となる。
事後平均は
E[θ∣x]=9+59=149≈0.6429であり、標本比率7/10=0.7と事前平均1/2の間にある。§E14.3 命題 1.4により、事後分散と標準偏差は
Var(θ∣x)=142⋅159⋅5=294045=0.015306…,sd(θ∣x)≈0.12372である。
次の一回の結果をX∈{0,1}とし、表を1と表す。命題 2.1により
P(X=1∣x)=∫01θπ(θ∣x)dθ=E[θ∣x]=149≈0.6429である。
Beta(9,5)分布の0.025分位点と0.975分位点を累積分布関数の数値的反転によって求めると、それぞれおよそ
0.385738338…,0.861420661…となる。したがって等裾95%信用区間は[0.385738338,0.861420661]であり、小数第3位まででは[0.386,0.861]である。
6 事後正規近似への展望