§E11.11条件付き期待値

最終更新

条件付き期待値は、部分シグマ加法族が表す情報の下で可積分確率変数を平均化したものである。本記事では定義だけで存在を仮定せず、Radon–Nikodym の定理から構成する。以下では、(Ω,F,P)(\Omega,\mathcal F,P)を確率空間とし、G⊆F\mathcal G\subseteq\mathcal Fを部分シグマ加法族とする。

1 定義と存在

定義 1.1.X∈L1(P)X\in L^1(P)とし、G⊂F\mathcal G\subset\mathcal Fを部分シグマ加法族とする。G\mathcal G可測な可積分確率変数YYが、すべてのA∈GA\in\mathcal Gに対して∫AY dP=∫AX dP\int_A Y\,dP=\int_A X\,dPを満たすとき、YYをG\mathcal Gに関するXXの 条件付き期待値 (conditional expectation) といい、E[X∣G]E[X\mid\mathcal G]と書く。

定理 1.2.X∈L1(P)X\in L^1(P)と部分シグマ加法族G⊂F\mathcal G\subset\mathcal Fに対して、E[X∣G]E[X\mid\mathcal G]は存在し、PPに関してほとんど至る所で一意である。

証明.X=X+−X−X=X^+-X^-とし、A∈GA\in\mathcal Gに対してν±(A)=∫AX±dP\nu_\pm(A)=\int_A X^\pm dPと置く。ν±\nu_\pmは(Ω,G)(\Omega,\mathcal G)上の有限正測度であり、P∣G(A)=0P|_{\mathcal G}(A)=0ならばν±(A)=0\nu_\pm(A)=0である。したがってν±≪P∣G\nu_\pm\ll P|_{\mathcal G}である。従属選択公理の下で有限測度版 Radon–Nikodym の定理§E9.15 定理 2.3を適用すると、非負G\mathcal G可測関数f±f_\pmが存在してν±(A)=∫Af±dP\nu_\pm(A)=\int_Af_\pm dPとなる。∫f±dP=ν±(Ω)<∞\int f_\pm dP=\nu_\pm(\Omega)<\inftyであるから、f±f_\pmは有限値かつ可積分になるよう零集合上で修正することができる。Y=f+−f−Y=f_+-f_-と置けばYYはG\mathcal G可測かつ可積分であり、定義の積分等式を満たす。

Y1,Y2Y_1,Y_2が二つの候補ならばZ=Y1−Y2Z=Y_1-Y_2はG\mathcal G可測かつ可積分で、すべてのA∈GA\in\mathcal Gに対して∫AZ dP=0\int_AZ\,dP=0である。An={Z≥1/n}A_n=\{Z\geq1/n\}とすると0=∫AnZ dP≥P(An)/n0=\int_{A_n}Z\,dP\geq P(A_n)/nであるからP(Z>0)=0P(Z>0)=0である。−Z-Zにも同じ議論を適用するとP(Z<0)=0P(Z<0)=0となる。したがってY1=Y2Y_1=Y_2がほとんど至る所で成り立つ。▨

注意 1.3 (存在証明に用いた測度). 存在証明では符号付き測度へ直接定理を適用せず、X+X^+とX−X^-が定める二つの有限正測度へ Radon–Nikodym の定理を適用した。したがって、得られる二つの密度が非負であることと可積分であることが構成の中で保証される。

2 基本性質と塔の性質

命題 2.1.X,Y∈L1(P)X,Y\in L^1(P)、a,b∈Ra,b\in\mathbb Rとする。

  1. E[aX+bY∣G]=aE[X∣G]+bE[Y∣G]E[aX+bY\mid\mathcal G]=aE[X\mid\mathcal G]+bE[Y\mid\mathcal G]がほとんど至る所で成り立つ。
  2. X≥0X\geq0がほとんど至る所で成り立つならば、E[X∣G]≥0E[X\mid\mathcal G]\geq0もほとんど至る所で成り立つ。
  3. XXがG\mathcal G可測ならばE[X∣G]=XE[X\mid\mathcal G]=Xがほとんど至る所で成り立つ。
  4. E[E[X∣G]]=E[X]E[E[X\mid\mathcal G]]=E[X]である。
  5. ∣E[X∣G]∣≤E[∣X∣∣G]|E[X\mid\mathcal G]|\leq E[|X|\mid\mathcal G]がほとんど至る所で成り立つ。

証明.(1)、(3)、(4)を示す。右辺が可積分かつG\mathcal G可測であることを確認し、定義の積分等式と一意性を適用すればよい。(2)を示す。W=E[X∣G]W=E[X\mid\mathcal G]と置き、An={W≤−1/n}A_n=\{W\leq-1/n\}とする。定義から0≤∫AnX dP=∫AnW dP≤−P(An)/n0\leq\int_{A_n}X\,dP=\int_{A_n}W\,dP\leq-P(A_n)/nであるため、P(An)=0P(A_n)=0である。{W<0}=⋃nAn\{W<0\}=\bigcup_nA_nなので正値性が従う。最後に−∣X∣≤X≤∣X∣-|X|\leq X\leq|X|へ線形性と正値性を適用すると(5)を得る。▨

定理 2.2 (塔の性質).X∈L1(P)X\in L^1(P)とし、H⊂G⊂F\mathcal H\subset\mathcal G\subset\mathcal Fを部分シグマ加法族とする。このときE[E[X∣G]∣H]=E[X∣H]E[E[X\mid\mathcal G]\mid\mathcal H]=E[X\mid\mathcal H]がほとんど至る所で成り立つ。

証明. 左辺はH\mathcal H可測かつ可積分である。A∈HA\in\mathcal HはG\mathcal Gにも属するため、条件付き期待値の定義を二度用いると∫AE[E[X∣G]∣H]dP=∫AE[X∣G]dP=∫AXdP.\int_AE[E[X\mid\mathcal G]\mid\mathcal H]dP=\int_AE[X\mid\mathcal G]dP=\int_AXdP.一意性により主張が従う。▨

定理 2.3.ZZを有限値の実数値G\mathcal G可測確率変数とする。以下の条件付き期待値の等式は、すべてPPに関してほとんど至る所での等式である。

  1. ZZが有界でX∈L1(P)X\in L^1(P)ならば、E[XZ∣G]=ZE[X∣G]E[XZ\mid\mathcal G]=ZE[X\mid\mathcal G]である。
  2. X∈L1(P)X\in L^1(P)かつXZ∈L1(P)XZ\in L^1(P)ならば、ZE[X∣G]ZE[X\mid\mathcal G]も可積分であり、同じ等式が成り立つ。

証明.(1)を示す。まずZ=1BZ=\mathbf1_B、B∈GB\in\mathcal Gの場合には、任意のA∈GA\in\mathcal Gに対して積分をA∩BA\cap Bへ移せば定義の等式が得られる。線形性によりG\mathcal G可測単関数へ拡張し、有界ZZを単関数で一様近似して積分の極限を取れば主張を得る。

(2)を示す。一般の場合、An={∣Z∣≤n}A_n=\{|Z|\leq n\}と置く。(1)と命題 2.1 (5)から

E[∣Z∣1An∣E[X∣G]∣]≤E[∣Z∣1AnE[∣X∣∣G]]=E[∣ZX∣1An].E[|Z|\mathbf1_{A_n}|E[X\mid\mathcal G]|] \leq E[|Z|\mathbf1_{A_n}E[|X|\mid\mathcal G]] =E[|ZX|\mathbf1_{A_n}].

単調収束定理§E9.7 定理 1.1によりZE[X∣G]ZE[X\mid\mathcal G]は可積分である。Z1AnZ\mathbf1_{A_n}に(1)を適用し、定義の積分等式を任意のA∈GA\in\mathcal G上で書く。両辺で優収束定理§E9.7 定理 3.2を用いてn→∞n\to\inftyとすれば(2)の等式を得る。▨

3 Jensen の不等式と独立性

補題 3.1. 区間II上の有限凸関数φ\varphiに対して、可算個のアフィン関数ℓk\ell_kが存在し、ℓk≤φ\ell_k\leq\varphiがII上で成り立ち、φ(x)=sup⁡k≥1ℓk(x)\varphi(x)=\sup_{k\geq1}\ell_k(x)がIIのすべての内点xxで成り立つ。

証明.I={a}I=\{a\}である場合には、定数アフィン関数ℓ(x)=φ(a)\ell(x)=\varphi(a)だけからなる族を取ればよい。以下ではIIの内部が空でない場合を考える。

DDをIIの内部の可算稠密部分集合とする。各q∈Dq\in Dについて、凸性から

sup⁡x<qφ(q)−φ(x)q−x≤inf⁡y>qφ(y)−φ(q)y−q\sup_{x<q}\frac{\varphi(q)-\varphi(x)}{q-x} \leq \inf_{y>q}\frac{\varphi(y)-\varphi(q)}{y-q}

であり、両辺はqqの両側に固定した点の割線勾配で挟まれるため有限である。両辺の間からsqs_qを選ぶと、ℓq(x)=φ(q)+sq(x−q)\ell_q(x)=\varphi(q)+s_q(x-q)はII上でφ\varphi以下になる。

内点z∈Iz\in Iを任意に取り、a<c<z<d<ba<c<z<d<bを満たすa,b,c,d∈Ia,b,c,d\in Iを選ぶ。凸性による割線勾配の単調性から、c≤u<v≤dc\leq u<v\leq dに対して

φ(c)−φ(a)c−a≤φ(v)−φ(u)v−u≤φ(b)−φ(d)b−d\frac{\varphi(c)-\varphi(a)}{c-a} \leq \frac{\varphi(v)-\varphi(u)}{v-u} \leq \frac{\varphi(b)-\varphi(d)}{b-d}

が成り立つ。両端の固定割線勾配の絶対値の大きい方をLLとすれば、∣φ(v)−φ(u)∣≤L∣v−u∣|\varphi(v)-\varphi(u)|\leq L|v-u|である。したがってφ\varphiは[c,d][c,d]上で Lipschitz 連続であり、特にzzで連続である。

qn∈D∩[c,d]q_n\in D\cap[c,d]かつqn→zq_n\to zとなる列を取る。sqns_{q_n}の選び方と割線勾配の単調性により

φ(c)−φ(a)c−a≤sqn≤φ(b)−φ(d)b−d\frac{\varphi(c)-\varphi(a)}{c-a} \leq s_{q_n}\leq \frac{\varphi(b)-\varphi(d)}{b-d}

であるから、(sqn)(s_{q_n})は有界である。φ(qn)→φ(z)\varphi(q_n)\to\varphi(z)とsqn(z−qn)→0s_{q_n}(z-q_n)\to0が成り立つため、ℓqn(z)→φ(z)\ell_{q_n}(z)\to\varphi(z)である。各ℓq\ell_qはφ\varphi以下であるから、可算族(ℓq)q∈D(\ell_q)_{q\in D}の上限はφ(z)\varphi(z)に等しい。▨

定理 3.2 (条件付き Jensen の不等式).φ:I→R\varphi:I\to\mathbb Rを凸関数とする。P(X∈I)=1P(X\in I)=1であり、XXとφ(X)\varphi(X)が可積分で、E[X∣G]∈IE[X\mid\mathcal G]\in Iがほとんど至る所で成り立つとする。このときφ(E[X∣G])≤E[φ(X)∣G]\varphi(E[X\mid\mathcal G])\leq E[\varphi(X)\mid\mathcal G]がほとんど至る所で成り立つ。

証明.M=E[X∣G]M=E[X\mid\mathcal G]と置く。補題 3.1の各ℓk(x)=akx+bk\ell_k(x)=a_kx+b_kについて、ℓk(X)≤φ(X)\ell_k(X)\leq\varphi(X)である。線形性と正値性によりℓk(E[X∣G])≤E[φ(X)∣G]\ell_k(E[X\mid\mathcal G])\leq E[\varphi(X)\mid\mathcal G]である。可算個の例外零集合の和を除き、すべてのkkについて同時に成立するため、MMがIIの内点である事象上では左辺の上限を取って主張を得る。

a=inf⁡Ia=\inf IがIIに属する場合にA={M=a}A=\{M=a\}と置く。A∈GA\in\mathcal Gであり、可測因子の取り出しと塔の性質からE[(X−a)1A]=E[(M−a)1A]=0.E[(X-a)\mathbf1_A]=E[(M-a)\mathbf1_A]=0.X−a≥0X-a\geq0なのでX=aX=aがAA上でほとんど至る所で成り立つ。したがって、可測因子の取り出しにより

1AE[φ(X)∣G]=E[1Aφ(X)∣G]=φ(a)1A\mathbf1_AE[\varphi(X)\mid\mathcal G] =E[\mathbf1_A\varphi(X)\mid\mathcal G] =\varphi(a)\mathbf1_A

であり、E[φ(X)∣G]=φ(a)=φ(M)E[\varphi(X)\mid\mathcal G]=\varphi(a)=\varphi(M)がAA上でほとんど至る所で成り立つ。IIに属する上端についてもb−X≥0b-X\geq0を用いる同じ議論が成り立つ。これらの事象と内部の事象が{M∈I}\{M\in I\}を覆うため、主張を得る。▨

命題 3.3.X∈L1(P)X\in L^1(P)とし、σ(X)\sigma(X)とG\mathcal Gが独立であるとする。このときE[X∣G]=E[X]E[X\mid\mathcal G]=E[X]がほとんど至る所で成り立つ。

証明. 独立性の定義§E11.7 定義 1.1により、B∈σ(X)B\in\sigma(X)とA∈GA\in\mathcal Gに対してP(A∩B)=P(A)P(B)P(A\cap B)=P(A)P(B)である。したがって、XXが非負単関数ならば線形性からE[X1A]=E[X]P(A)E[X\mathbf1_A]=E[X]P(A)が成り立つ。非負σ(X)\sigma(X)可測関数を非負単関数で下から近似し、単調収束定理§E9.7 定理 1.1を適用すると、同じ等式が非負XXに対して成り立つ。一般の可積分XXについてはX+X^+とX−X^-へ適用して差を取る。ゆえに∫AXdP=E[X]P(A)=∫AE[X]dP.\int_AXdP=E[X]P(A)=\int_AE[X]dP.定数E[X]E[X]はG\mathcal G可測かつ可積分であるから、一意性により主張が従う。▨

4 条件付き確率、分割、条件付き分散

定義 4.1. 事象B∈FB\in\mathcal Fに対して、P(B∣G)=E[1B∣G]P(B\mid\mathcal G)=E[\mathbf1_B\mid\mathcal G]と定める。条件付き確率 (conditional probability given a sigma-algebra)P(B∣G)P(B\mid\mathcal G)はG\mathcal G可測な確率変数であり、各A∈GA\in\mathcal G上でP(A∩B)P(A\cap B)を再現する。

例 4.2 (有限または可算分割).(Bk)k∈K(B_k)_{k\in K}を有限または可算な可測分割とし、G=σ(Bk:k∈K)\mathcal G=\sigma(B_k:k\in K)とする。X∈L1(P)X\in L^1(P)ならば

E[X∣G]=∑k:P(Bk)>0E[X1Bk]P(Bk)1BkE[X\mid\mathcal G] =\sum_{k:P(B_k)>0}\frac{E[X\mathbf1_{B_k}]}{P(B_k)}\mathbf1_{B_k}

がほとんど至る所で成り立つ。零確率の分割要素上の値は任意であり、表示では零とした。

実際、右辺はG\mathcal G可測であり、絶対値の期待値は∑k∣E[X1Bk]∣≤E[∣X∣]\sum_k|E[X\mathbf1_{B_k}]|\leq E[|X|]である。G\mathcal Gの各集合は分割要素の和であるから、各分割要素上の積分等式を加えると定義の等式を得る。

X∈L2(P)X\in L^2(P)とする。条件付き Jensen の不等式をx↦x2x\mapsto x^2に適用して期待値を取ると、E[E[X∣G]2]≤E[X2]<∞E[E[X\mid\mathcal G]^2]\leq E[X^2]<\inftyである。したがってE[X∣G]∈L2(P)E[X\mid\mathcal G]\in L^2(P)である。Cauchy–Schwarz の不等式§E11.4 定理 2.2によりXE[X∣G]X E[X\mid\mathcal G]は可積分であり、(X−E[X∣G])2(X-E[X\mid\mathcal G])^2を展開した各項も可積分である。

定義 4.3.X∈L2(P)X\in L^2(P)に対して、Var⁡(X∣G)=E[(X−E[X∣G])2∣G]\operatorname{Var}(X\mid\mathcal G)=E[(X-E[X\mid\mathcal G])^2\mid\mathcal G]と定める。

定理 4.4 (全分散公式).X∈L2(P)X\in L^2(P)ならば

Var⁡(X∣G)=E[X2∣G]−E[X∣G]2\operatorname{Var}(X\mid\mathcal G)=E[X^2\mid\mathcal G]-E[X\mid\mathcal G]^2

がほとんど至る所で成り立ち、

Var⁡(X)=E[Var⁡(X∣G)]+Var⁡(E[X∣G])\operatorname{Var}(X)=E[\operatorname{Var}(X\mid\mathcal G)]+\operatorname{Var}(E[X\mid\mathcal G])

が成り立つ。

証明. 前段で確認した可積分性の下で定義の平方を展開し、可測因子の取り出しを用いると第一式を得る。両辺の期待値を取り、塔の性質からE[E[X2∣G]]=E[X2]E[E[X^2\mid\mathcal G]]=E[X^2]を用いると、E[Var⁡(X∣G)]=E[X2]−E[E[X∣G]2].E[\operatorname{Var}(X\mid\mathcal G)]=E[X^2]-E[E[X\mid\mathcal G]^2].右辺へE[X]2E[X]^2を加減すれば全分散公式を得る。▨

5 演習

問題 5.1.

  1. H⊂G\mathcal H\subset\mathcal Gの下で塔の性質を定義だけから証明せよ。
  2. 可測因子の取り出しについて、指示関数の場合から有界単関数の場合への移行を詳しく証明せよ。
  3. X∈L2(P)X\in L^2(P)に対してE[(X−E[X∣G])Z]=0E[(X-E[X\mid\mathcal G])Z]=0がすべての有界G\mathcal G可測確率変数ZZについて成り立つことを証明せよ。

6 扱った範囲と境界

本記事では、条件付き期待値を Radon–Nikodym の定理から構成し、基本性質、塔の性質、可測因子の取り出し、条件付き Jensen の不等式、独立な情報による条件付け、分割上の計算、および全分散公式を証明した。正則条件付き分布と確率核は扱っていない。

参考文献

  1. David Williams, Probability with Martingales, Cambridge University Press, 1991.
  2. Olav Kallenberg, Foundations of Modern Probability, 3rd ed., Probability Theory and Stochastic Modelling, Springer, Cham, 2021.

前提記事