§E11.9畳み込みと母関数

最終更新

独立な確率変数X,YX,Yの和S=X+YS=X+Yの分布は、同時分布μX⊗μY\mu_X\otimes\mu_Yを加法写像(x,y)↦x+y(x,y)\mapsto x+yで移した像測度である。離散分布では同じ和を与える点の確率を足し、絶対連続分布では同じ和を与える直線に沿って密度を積分する。この二つの計算が畳み込みである。

母関数は、非負整数値分布の確率または実数値分布の積率を一つの関数へまとめる。独立な和では指数の加法が積へ移るため、母関数も積に分解する。本記事は、各積分交換に必要な非負性または絶対可積分性を明記して、畳み込みと母関数の公式を証明する。

1 離散分布の畳み込み

定義 1.1.p,q:R→[0,1]p,q:\mathbb{R}\to[0,1]を離散確率分布の確率質量関数とし、正の質量をもつ点の集合を

Dp={x∈R:p(x)>0},Dq={y∈R:q(y)>0}D_p=\{x\in\mathbb{R}:p(x)>0\}, \qquad D_q=\{y\in\mathbb{R}:q(y)>0\}

とおく。Dp,DqD_p,D_qは高々可算である。ppとqqの畳み込み (discrete convolution) を

(p∗q)(z)=∑x∈Dpp(x)q(z−x)(p*q)(z)=\sum_{x\in D_p}p(x)q(z-x)

によって定める。各項が非負であるため、和はDpD_pの列挙の順序に依存しない。

1.1 証明方針

和がzzになる事象を、XXの正質量点x∈DpXx\in D_{p_X}ごとの事象{X=x,Y=z−x}\{X=x,Y=z-x\}の非交和へ分解する。確率の可算加法性を適用した後、独立性によって各項を二つの確率質量の積へ分解する。

定理 1.2.X,YX,Yを独立な離散確率変数とし、確率質量関数をそれぞれpX,pYp_X,p_Yとする。このときS=X+YS=X+Yの確率質量関数は

pS(z)=(pX∗pY)(z)=∑x∈DpXpX(x)pY(z−x)p_S(z)=(p_X*p_Y)(z) =\sum_{x\in D_{p_X}}p_X(x)p_Y(z-x)

である。

証明.DX=DpXD_X=D_{p_X}およびN={X∉DX}N=\{X\notin D_X\}とおく。DXD_XはXXの正の質量をもつ点をすべて含み、確率質量関数の総和は11であるから、

P(N)=1−P(X∈DX)=1−∑x∈DXpX(x)=0P(N)=1-P(X\in D_X)=1-\sum_{x\in D_X}p_X(x)=0

である。事象の完全な等式は

{X+Y=z}∖N=⨆x∈DX{X=x,Y=z−x}\{X+Y=z\}\setminus N =\bigsqcup_{x\in D_X}\{X=x,Y=z-x\}

であり、右辺は互いに交わらない事象の高々可算な和である。P(N)=0P(N)=0、確率の可算加法性および独立性から、

P(X+Y=z)=∑x∈DXP(X=x,Y=z−x)=∑x∈DXpX(x)pY(z−x)\begin{aligned} P(X+Y=z) &=\sum_{x\in D_X}P(X=x,Y=z-x)\\ &=\sum_{x\in D_X}p_X(x)p_Y(z-x) \end{aligned}

を得る。各項は非負であるため、二重和を用いて全質量を確認するときにも数え上げ測度に対する Tonelli の定理を適用することができる。▨

例 1.3 (独立な Bernoulli 確率変数の和).X,YX,Yを独立とし、XXは母数pp、YYは母数qqの Bernoulli 分布に従うとする。畳み込みを各値で計算すると、

P(X+Y=0)=(1−p)(1−q),P(X+Y=1)=p(1−q)+(1−p)q,P(X+Y=2)=pq.\begin{aligned} P(X+Y=0)&=(1-p)(1-q),\\ P(X+Y=1)&=p(1-q)+(1-p)q,\\ P(X+Y=2)&=pq. \end{aligned}

三つの値の和は11である。p=qp=qの場合には、母数pp、試行回数22の二項分布に一致する。

2 密度の畳み込み

定義 2.1. 非負 Borel 可測関数f,g:R→[0,∞]f,g:\mathbb{R}\to[0,\infty]に対して、畳み込み (convolution of densities) を

(f∗g)(z)=∫Rf(x)g(z−x) dx(f*g)(z)=\int_{\mathbb{R}}f(x)g(z-x)\,dx

によって定める。値+∞+\inftyを許す。f,gf,gが確率密度である場合には、後の定理によりf∗gf*gはほとんど至る所で有限な確率密度になる。

2.1 証明方針

独立性によって(X,Y)(X,Y)の同時分布を積分布へ置き換え、積測度の密度がfX(x)fY(y)f_X(x)f_Y(y)であることを Tonelli の定理で確認する。加法写像の逆像を表す非負関数1B(x+y)fX(x)fY(y)\mathbf{1}_B(x+y)f_X(x)f_Y(y)へ Tonelli の定理を適用し、z=x+yz=x+yと置換してzzを外側の変数にする。内側に残る積分を畳み込み密度として同定する。

定理 2.2.X,YX,Yを独立な実数値確率変数とし、それぞれ Lebesgue 密度fX,fYf_X,f_Yをもつとする。このときS=X+YS=X+Yは Lebesgue 密度

fS(z)=(fX∗fY)(z)=∫RfX(x)fY(z−x) dxf_S(z)=(f_X*f_Y)(z) =\int_{\mathbb{R}}f_X(x)f_Y(z-x)\,dx

をもつ。

証明. 独立性の積分布による特徴づけ§E11.7 定理 2.1から、(X,Y)(X,Y)の同時分布はμX⊗μY\mu_X\otimes\mu_Yである。この積測度の密度が(x,y)↦fX(x)fY(y)(x,y)\mapsto f_X(x)f_Y(y)であることは、非負関数に対する§E9.11 定理 2.3を Borel 集合E⊂R2E\subset\mathbb{R}^2の指示関数へ適用して

∫EfX(x)fY(y) d(x,y)=∫RfX(x)(∫ExfY(y) dy)dx=(μX⊗μY)(E)\int_Ef_X(x)f_Y(y)\,d(x,y) =\int_{\mathbb{R}}f_X(x) \left(\int_{E_x}f_Y(y)\,dy\right)dx =(\mu_X\otimes\mu_Y)(E)

と確認することができる。Borel 集合B⊂RB\subset\mathbb{R}に対して、

P(S∈B)=∫R21B(x+y)fX(x)fY(y) d(x,y).P(S\in B) =\int_{\mathbb{R}^2}\mathbf{1}_B(x+y)f_X(x)f_Y(y)\,d(x,y).

被積分関数は非負であるため、積分値の有限性を先に仮定せず§E9.11 定理 2.3を適用することができる。固定したxxについてz=x+yz=x+yと置換し、再び Tonelli の定理を用いると、

P(S∈B)=∫R∫R1B(x+y)fX(x)fY(y) dy dx=∫R∫R1B(z)fX(x)fY(z−x) dz dx=∫B(∫RfX(x)fY(z−x) dx)dz.\begin{aligned} P(S\in B) &=\int_{\mathbb{R}}\int_{\mathbb{R}} \mathbf{1}_B(x+y)f_X(x)f_Y(y)\,dy\,dx\\ &=\int_{\mathbb{R}}\int_{\mathbb{R}} \mathbf{1}_B(z)f_X(x)f_Y(z-x)\,dz\,dx\\ &=\int_B\left(\int_{\mathbb{R}}f_X(x)f_Y(z-x)\,dx\right)dz. \end{aligned}

したがって、括弧内の関数がSSの密度である。特にB=RB=\mathbb{R}とするとその積分は11であるため、畳み込みはほとんど至る所で有限である。▨

注意 2.3 (Tonelli の定理と Fubini の定理の使い分け).定理 2.2の被積分関数は非負であるため、Tonelli の定理を用いた。一方、符号をもつ Borel 可測関数φ\varphiに対して

E[φ(X+Y)]=∫R2φ(x+y)fX(x)fY(y) d(x,y)E[\varphi(X+Y)] =\int_{\mathbb{R}^2}\varphi(x+y)f_X(x)f_Y(y)\,d(x,y)

の積分順序を交換する場合には、

∫R2∣φ(x+y)∣fX(x)fY(y) d(x,y)<∞\int_{\mathbb{R}^2}|\varphi(x+y)|f_X(x)f_Y(y)\,d(x,y)<\infty

を先に確認して§E9.11 定理 3.2を適用する必要がある。条件付き収束だけでは積分順序を交換することができない。

例 2.4 (二つの一様分布の畳み込み).X,YX,Yを独立とし、ともに区間(0,1)(0,1)上の一様分布に従うとする。fX=fY=1(0,1)f_X=f_Y=\mathbf{1}_{(0,1)}であるから、

fX+Y(z)=∫R1(0,1)(x)1(0,1)(z−x) dxf_{X+Y}(z) =\int_{\mathbb{R}}\mathbf{1}_{(0,1)}(x) \mathbf{1}_{(0,1)}(z-x)\,dx

は区間(0,1)∩(z−1,z)(0,1)\cap(z-1,z)の長さに等しい。したがって、

fX+Y(z)={z,0<z≤1,2−z,1<z<2,0,otherwisef_{X+Y}(z)= \begin{cases} z,&0<z\leq1,\\ 2-z,&1<z<2,\\ 0,&\text{otherwise} \end{cases}

である。規格化は

∫01z dz+∫12(2−z) dz=12+12=1\int_0^1z\,dz+\int_1^2(2-z)\,dz =\frac12+\frac12=1

と再計算することができる。

3 確率母関数

定義 3.1.NNを非負整数値確率変数とする。∣s∣<1|s|<1に対する

GN(s)=E[sN]=∑n=0∞P(N=n)snG_N(s)=E[s^N] =\sum_{n=0}^{\infty}P(N=n)s^n

をNNの確率母関数 (probability generating function) という。さらにGN(1)=1G_N(1)=1と定める。s=0,n=0s=0,n=0では00=10^0=1と定める。

∣s∣<1|s|<1では∣sN∣≤1|s^N|\leq1であるため級数は絶対収束し、s=0s=0は定義域の内点である。s=1s=1では確率の総和からGN(1)=1G_N(1)=1である。

3.1 証明方針

閉区間[−r,r]⊂(−1,1)[-r,r]\subset(-1,1)を固定する。0≤j≤k0\leq j\leq kの各導関数級数について、指数減衰rn−jr^{n-j}が多項式増大njn^jを抑えることを用い、各項を総和可能なCj,rP(N=n)C_{j,r}P(N=n)で一様に支配する。Weierstrass の判定法を各階へ適用して項別微分を反復する。最後にs↑1s\uparrow1では非負項へ単調収束定理を適用する。

定理 3.2.NNを非負整数値確率変数とする。任意の整数k≥1k\geq1と∣s∣<1|s|<1に対して、

GN(k)(s)=E[(N)ksN−k1{N≥k}]=∑n=k∞(n)kP(N=n)sn−k,G_N^{(k)}(s) =E[(N)_k s^{N-k}\mathbf{1}_{\{N\geq k\}}] =\sum_{n=k}^{\infty}(n)_kP(N=n)s^{n-k},

ただし(n)k=n(n−1)⋯(n−k+1)(n)_k=n(n-1)\cdots(n-k+1)とする。また、拡張実数値の等式として

GN(k)(1−)=lim⁡s↑1GN(k)(s)=E[(N)k]G_N^{(k)}(1-) =\lim_{s\uparrow1}G_N^{(k)}(s) =E[(N)_k]

が成り立つ。特に、対応する積率が有限ならば

E[N]=GN′(1−),E[N2]=GN′′(1−)+GN′(1−)E[N]=G_N'(1-), \qquad E[N^2]=G_N''(1-)+G_N'(1-)

である。

証明.0<r<10<r<1を固定する。n≥kn\geq kに対して(n)k≤nk(n)_k\leq n^kであり、0≤j≤k0\leq j\leq kとn≥jn\geq jに対して

(n)j≤nj,njrn−j≤Cj,r(n)_j\leq n^j, \qquad n^jr^{n-j}\leq C_{j,r}

を満たす有限な定数Cj,r=sup⁡n≥jnjrn−jC_{j,r}=\sup_{n\geq j}n^jr^{n-j}をとることができる。ただしj=n=0j=n=0ではnj=1n^j=1とする。∣s∣≤r|s|\leq rならば

∣(n)jP(N=n)sn−j∣≤Cj,rP(N=n),\left|(n)_jP(N=n)s^{n-j}\right| \leq C_{j,r}P(N=n),

右辺のnnに関する総和はCj,rC_{j,r}である。したがって、Weierstrass の判定法§D1.22 定理 5.2により、0≤j≤k0\leq j\leq kのすべての導関数候補級数が[−r,r][-r,r]上で一様収束する。元の級数がs=0s=0で収束することを出発点とし、項別微分定理§D1.22 定理 4.2をj=1,…,kj=1,\ldots,kの順に反復すると、kk階までの微分公式を得る。任意のs∈(−1,1)s\in(-1,1)はある区間[−r,r][-r,r]に含まれるため、結論は(−1,1)(-1,1)全体で成り立つ。

各n≥kn\geq kについて(n)ksn−k(n)_ks^{n-k}は0≤s<10\leq s<1を通ってs↑1s\uparrow1とすると(n)k(n)_kへ単調に増加する。数え上げ測度に対する単調収束定理から

lim⁡s↑1∑n=k∞(n)kP(N=n)sn−k=∑n=k∞(n)kP(N=n)\lim_{s\uparrow1}\sum_{n=k}^{\infty}(n)_kP(N=n)s^{n-k} =\sum_{n=k}^{\infty}(n)_kP(N=n)

を得る。最後の二式は(N)1=N(N)_1=Nと(N)2=N2−N(N)_2=N^2-Nから従う。▨

4 積率母関数

定義 4.1.XXを実数値確率変数とする。あるδ>0\delta>0が存在し、すべてのt∈(−δ,δ)t\in(-\delta,\delta)で

MX(t)=E[etX]<∞M_X(t)=E[e^{tX}]<\infty

となるとき、MXM_XをXXの積率母関数 (moment generating function) という。

零の片側だけで有限であるという条件では、正側または負側の裾を同時に制御することができない。零の開近傍での有限性が、すべての積率と微分のための両側の優関数を与える。

4.1 証明方針

固定したttの両側に閉区間[t−a,t+a]⊂(−δ,δ)[t-a,t+a]\subset(-\delta,\delta)をとる。正の裾はe(t+a)Xe^{(t+a)X}、負の裾はe(t−a)Xe^{(t-a)X}で支配する。kk階微分候補の差分商を平均値の定理で評価し、∣h∣<a/2|h|<a/2に共通な可積分優関数を構成する。各階で Lebesgue の優収束定理を適用し、帰納的に微分と期待値を交換する。

定理 4.2.MXM_Xが開区間(−δ,δ)(-\delta,\delta)で有限であるとする。このときMXM_Xは同区間で無限回微分可能であり、任意の整数k≥0k\geq0とt∈(−δ,δ)t\in(-\delta,\delta)に対して

MX(k)(t)=E[XketX]M_X^{(k)}(t)=E[X^ke^{tX}]

が成り立つ。特に、すべての絶対積率が有限であり、

MX(k)(0)=E[Xk]M_X^{(k)}(0)=E[X^k]

である。

証明.t∈(−δ,δ)t\in(-\delta,\delta)を固定し、[t−a,t+a]⊂(−δ,δ)[t-a,t+a]\subset(-\delta,\delta)を満たすa>0a>0を選ぶ。任意の整数k≥0k\geq0に対して、指数関数の級数からuk≤k!euu^k\leq k!e^uがu≥0u\geq0で成り立つ。したがって、u=a∣x∣/2u=a|x|/2と置くことにより、ある定数Ck,a>0C_{k,a}>0が存在して

∣x∣ketx≤Ck,a(e(t+a)x+e(t−a)x)|x|^ke^{tx} \leq C_{k,a}\bigl(e^{(t+a)x}+e^{(t-a)x}\bigr)

がすべてのx∈Rx\in\mathbb{R}で成り立つ。x≥0x\geq0では第一項、x<0x<0では第二項を用いればよい。右辺の期待値はMX(t+a)+MX(t−a)<∞M_X(t+a)+M_X(t-a)<\inftyであるため、左辺は可積分である。

Fk(t)=E[XketX]F_k(t)=E[X^ke^{tX}]とおく。上の評価によりFk(t)F_k(t)はすべてのk≥0k\geq0について絶対収束する。∣h∣<a/2|h|<a/2とすると、平均値の定理から

∣xke(t+h)x−xketxh∣≤∣x∣k+1etx+∣h∣∣x∣\left|\frac{x^ke^{(t+h)x}-x^ke^{tx}}{h}\right| \leq |x|^{k+1}e^{tx+|h||x|}

である。右辺がhhに依存しない可積分関数で支配されることを、正負の裾に分けて確認する。実際、

∣x∣k+1etx+∣h∣∣x∣≤Ck,a′(e(t+a)x1[0,∞)(x)+e(t−a)x1(−∞,0)(x))|x|^{k+1}e^{tx+|h||x|} \leq C'_{k,a} \left( e^{(t+a)x}\mathbf{1}_{[0,\infty)}(x) +e^{(t-a)x}\mathbf{1}_{(-\infty,0)}(x) \right)

である。x≥0x\geq0では∣h∣≤a/2|h|\leq a/2の残りのa/2a/2で多項式を吸収し、x<0x<0ではe(t−a)xe^{(t-a)x}までの残りのa/2a/2で同様に吸収した。右辺の期待値はMX(t+a)+MX(t−a)<∞M_X(t+a)+M_X(t-a)<\infty以下であり、hhに依存しない。

したがって、Lebesgue の優収束定理により

Fk′(t)=E[Xk+1etX]=Fk+1(t)F_k'(t)=E[X^{k+1}e^{tX}]=F_{k+1}(t)

である。F0=MXF_0=M_Xから帰納すると、任意のkkに対する微分公式を得る。

t=0t=0の評価はE[∣X∣k]<∞E[|X|^k]<\inftyを与え、微分公式へt=0t=0を代入すると積率の式を得る。▨

5 独立な和に対する積公式

5.1 証明方針

独立な確率変数へ別々に Borel 可測関数を合成しても独立性が保たれることを逆像から確認する。確率母関数では有界なsX,sYs^X,s^Y、積率母関数では仮定により可積分なetX,etYe^{tX},e^{tY}へ期待値の積への分解を適用し、指数法則で和を積へ移す。

定理 5.1.X,YX,Yを独立な確率変数とする。

  1. X,YX,Yが非負整数値ならば、任意の0≤s≤10\leq s\leq1に対して GX+Y(s)=GX(s)GY(s)G_{X+Y}(s)=G_X(s)G_Y(s) が成り立つ。
  2. MX(t)M_X(t)とMY(t)M_Y(t)が有限である実数ttに対して MX+Y(t)=MX(t)MY(t)M_{X+Y}(t)=M_X(t)M_Y(t) が成り立つ。特に二つの積率母関数が共通の零の近傍で有限ならば、X+YX+Yの積率母関数もその近傍で有限である。

証明. 独立な確率変数へそれぞれ Borel 可測関数を合成して得られる確率変数も独立である。実際、合成後の Borel 集合の逆像は、それぞれσ(X)\sigma(X)とσ(Y)\sigma(Y)に属する。

0≤s≤10\leq s\leq1ではsX,sYs^X,s^Yは有界であり、したがって可積分である。§E11.7 定理 3.1を用いると、

GX+Y(s)=E[sX+Y]=E[sXsY]=E[sX]E[sY]G_{X+Y}(s) =E[s^{X+Y}] =E[s^Xs^Y] =E[s^X]E[s^Y]

を得る。

MX(t),MY(t)<∞M_X(t),M_Y(t)<\inftyならば、非負確率変数etX,etYe^{tX},e^{tY}は可積分である。同じ期待値の分解を適用すると、

MX+Y(t)=E[et(X+Y)]=E[etXetY]=MX(t)MY(t)M_{X+Y}(t) =E[e^{t(X+Y)}] =E[e^{tX}e^{tY}] =M_X(t)M_Y(t)

となる。右辺は有限である。▨

例 5.2 (独立な Poisson 分布の和).XXが母数λ>0\lambda>0、YYが母数μ>0\mu>0の Poisson 分布に従い、二つが独立であるとする。指数関数の級数から

GX(s)=e−λ∑n=0∞(λs)nn!=eλ(s−1)G_X(s) =e^{-\lambda}\sum_{n=0}^{\infty}\frac{(\lambda s)^n}{n!} =e^{\lambda(s-1)}

であり、同様にGY(s)=eμ(s−1)G_Y(s)=e^{\mu(s-1)}である。したがって、

GX+Y(s)=e(λ+μ)(s−1).G_{X+Y}(s)=e^{(\lambda+\mu)(s-1)}.

右辺を冪級数へ戻すと

GX+Y(s)=e−(λ+μ)∑n=0∞(λ+μ)nn!snG_{X+Y}(s) =e^{-(\lambda+\mu)} \sum_{n=0}^{\infty}\frac{(\lambda+\mu)^n}{n!}s^n

である。係数を比較すると、X+YX+Yは母数λ+μ\lambda+\muの Poisson 分布に従う。

6 積率母関数による分布の一意性

次の一意性定理は実 Laplace 変換の一意性に基づく。本記事では主張として用意し、証明は参照文献に委ねる。また、この定理を本記事の他の定理または例の証明には用いない。

定理 6.1.X,YX,Yを実数値確率変数とする。あるδ>0\delta>0に対してMX,MYM_X,M_Yが(−δ,δ)(-\delta,\delta)で有限であり、

MX(t)=MY(t)(−δ<t<δ)M_X(t)=M_Y(t) \qquad(-\delta<t<\delta)

が成り立つならば、XXとYYの分布は等しい。

零の近傍での有限性は本質的な仮定である。すべての積率が一致するという条件だけでは、一般には分布を一意に定めることができない。

7 演習

問題 7.1 (Poisson 分布の階乗積率).NNが母数λ>0\lambda>0の Poisson 分布に従うとする。確率母関数を微分してE[N]E[N]とVar⁡(N)\operatorname{Var}(N)を求めよ。

解答.

GN(s)=eλ(s−1)G_N(s)=e^{\lambda(s-1)}であるから、

GN′(1−)=λ,GN′′(1−)=λ2.G_N'(1-)=\lambda, \qquad G_N''(1-)=\lambda^2.

定理 3.2によりE[N]=λE[N]=\lambdaおよびE[N2]=λ2+λE[N^2]=\lambda^2+\lambdaである。したがって、

Var⁡(N)=E[N2]−E[N]2=λ.\operatorname{Var}(N) =E[N^2]-E[N]^2 =\lambda.

▨

問題 7.2.

  1. 例 2.4の畳み込みを、yyを先に積分する計算とxxを先に積分する計算の二通りで導き、Tonelli の定理のどの仮定が満たされるかを述べよ。
  2. X,YX,Yを独立な非負整数値確率変数とする。畳み込み公式を確率母関数へ代入し、非負二重級数に対する Tonelli の定理によって定理 5.1の第一の公式を別に証明せよ。
  3. 定理 4.2の証明で用いた優関数をk=2k=2について具体的に書き、MX(t−a)M_X(t-a)とMX(t+a)M_X(t+a)の有限性が二つの裾をそれぞれどのように支配するかを示せ。
  4. 独立な確率変数の密度がfX(x)=e−x1(0,∞)(x)f_X(x)=e^{-x}\mathbf{1}_{(0,\infty)}(x)とfY(y)=e−y1(0,∞)(y)f_Y(y)=e^{-y}\mathbf{1}_{(0,\infty)}(y)であるとする。畳み込みからX+YX+Yの密度を求め、積率母関数の積公式と積率の計算が整合することを確認せよ。

8 扱う範囲の境界と次の記事

積率母関数が零の近傍で有限でない分布には、本記事の微分公式と一意性定理を適用することができない。すべての確率分布について定義される特性関数、その反転公式、および Lévy の連続性定理は、本単元後半の「特性関数と Lévy の連続性定理」で扱う。積率不定問題は、本記事では扱わない。後続の記事では、多変量正規分布のアフィン変換と独立性を扱い、本記事の密度変換と独立な和の公式を具体的な分布族へ適用する。

参考文献

  1. Patrick Billingsley, Probability and Measure, Anniversary Edition, Wiley, 2012, originally published 1995.畳み込み、母関数の微分および積率母関数の一意性を参考にした。
  2. Achim Klenke, Probability Theory, 3rd ed., Universitext, Springer, 2020.独立な和の分布と母関数の積公式を参考にした。

前提記事