1 線形回帰モデルと Gauss–Markov 仮定
定義 1.1.n,pを正の整数とする。観測ベクトルy=(y1,…,yn)⊤∈Rnが、既知の固定計画行列X∈Rn×p、未知の係数β∈Rp、誤差ε∈Rnにより
y=Xβ+εと表されるモデルを 線形回帰モデル (linear regression model) という。次の条件を Gauss–Markov 仮定 (Gauss-Markov assumptions) という。
- 平均が零であること:E[ε]=0。
- 等分散かつ無相関であること:ある未知のσ2>0に対してCov(ε)=σ2In。
「線形」は係数βに関する線形性を表す。したがって、Xの列には説明変数の二乗や対数を配置することができる。Xが1=(1,…,1)⊤を列として含むモデルを切片つきモデルという。
2 一般階数の最小二乗法
定理 2.1 (最小二乗解と当てはめの一意性).X∈Rn×pの階数をrとする。任意のy∈Rnに対して、∥y−Xb∥2を最小にするb∈Rpが存在する。一つの最小二乗解をb0とすれば、最小二乗解の全体は
b0+kerXである。最小二乗解はr=pのとき、かつそのときに限って一意である。一方、r<pの場合を含めて、当てはめ値Xb0は一意であり、yのcol(X)への直交射影に等しい。
証明.§D3.17 定理 2.2をA=X、b=yに適用すると、最小二乗解は存在し、その全体はb0+kerXである。同じ定理により、その一意性はXの列の一次独立性、すなわちr=pと同値である。
二つの最小二乗解b1,b2の差はkerXに属するため、Xb1=Xb2となる。また、正規方程式
X⊤(y−Xb0)=0から、Xb0∈col(X)かつy−Xb0⊥col(X)である。§D3.14 命題 3.2により、Xb0は所要の直交射影である。▨
階数が不足すると、平均Xβを変えない方向z∈kerXに沿って係数をβ+zへ動かすことができる。係数表示が一意でない場合にも、当てはめと残差は一意に定まる。
系 2.2 (列が一次独立な場合の最小二乗推定量).Xの列が一次独立であるとする。このとき最小二乗解は一意であり、
β^=(X⊤X)−1X⊤yと表される。
証明.v⊤X⊤Xv=∥Xv∥2であるから、X⊤Xは正則である。定理 2.1の正規方程式X⊤Xb=X⊤yを解くと表示式を得る。▨
系 2.3 (射影行列による表示).Xの列が一次独立であるとする。このとき
H=X(X⊤X)−1X⊤とおけば、当てはめ値と残差はそれぞれy^=Hy、e=(In−H)yである。行列Hはcol(X)への直交射影を表し、H⊤=H、H2=H、HX=Xが成り立つ。
証明.系 2.2を左からX倍するとy^=Hyを得る。行列積からH⊤=H、H2=H、HX=Xが従う。また、Hの像はcol(X)に含まれ、HX=Xから逆の包含も成り立つ。したがって、Hはcol(X)への直交射影である。▨
3 推定可能な線形量
定義 3.1 (推定可能な線形量). 固定計画の線形回帰モデルにE[ε]=0を仮定し、c∈Rpとする。すべてのβ∈Rpに対して
Eβ[a⊤y]=c⊤βを満たすa∈Rnが存在するとき、c⊤βを 推定可能な線形量 (estimable linear function) という。
命題 3.2 (推定可能性の特徴づけ).c∈Rpに対して、次の条件は同値である。
- c⊤βは推定可能である。
- あるa∈Rnが存在してX⊤a=cとなる。
- c∈row(X):=Im(X⊤)である。
- すべてのz∈kerXに対してc⊤z=0である。
証明.Eβ[y]=Xβであるから、(1)は
a⊤Xβ=c⊤β(β∈Rp)と同値であり、さらにX⊤a=cと同値である。したがって、最初の三条件は同値である。c=X⊤aならば、z∈kerXに対してc⊤z=a⊤Xz=0となる。
逆に(4)を仮定し、X⊤とcに§D3.17 定理 2.2を適用する。最小二乗解a0はX(c−X⊤a0)=0を満たす。d=c−X⊤a0とおくと、d∈kerXである。また、仮定と既に示した包含によりd⊥kerXでもある。ゆえにd=0となり、X⊤a0=cを得る。▨
条件4は、同じ平均ベクトルを与えるβとβ+zに対して推定対象の値が一致する条件である。階数不足のモデルでは個々の係数が推定可能とは限らないが、特定の係数の組合せは推定可能になりうる。
例 3.3.n=1、p=2とし、計画行列をX=(1,1)とする。観測値y∈Rに対する残差平方和は
(y−b1−b2)2であるから、最小二乗解の全体は
{(b1,b2)⊤∈R2∣b1+b2=y}であり、kerX={(t,−t)⊤∣t∈R}である。したがって個々の係数β1とβ2は推定可能でない。一方、c=(1,1)⊤はすべてのz∈kerXに対してc⊤z=0を満たすため、命題 3.2により係数和β1+β2は推定可能である。どの最小二乗解を選んでも、その係数和は観測値yに等しい。
定理 3.4 (推定可能量に対する Gauss–Markov 定理).定義 1.1の Gauss–Markov 仮定を置き、c⊤βが推定可能であるとする。このときX⊤a0=cを満たすa0∈col(X)がただ一つ存在する。推定量a0⊤yはc⊤βの線形不偏推定量であり、別の線形不偏推定量a⊤yに対して
Var(a⊤y)−Var(a0⊤y)=σ2∥a−a0∥2≥0が成り立つ。等号はa=a0のとき、かつそのときに限って成り立つ。
証明.命題 3.2によりX⊤a=cを満たすaが存在する。a=a0+dをcol(X)とその直交補への直交分解とする。X⊤d=0であるからX⊤a0=cとなる。二つのベクトルa0,a1∈col(X)がこの方程式を満たすならば、a0−a1∈col(X)かつa0−a1⊥col(X)なのでa0=a1となる。
Gauss–Markov 仮定から
Var(a⊤y)=a⊤(σ2In)a=σ2∥a∥2である。a=a0+(a−a0)は直交分解であるから、ノルムの平方の差を取ると主張する式を得る。▨
Pをcol(X)への直交射影とし、bを任意の最小二乗解とする。定理 2.1によりXb=Pyであり、a0∈col(X)なのでa0⊤P=a0⊤である。したがって
c⊤b=a0⊤Xb=a0⊤Py=a0⊤y
が成り立つ。ゆえに推定可能量の最良線形不偏推定値は、最小二乗解の選択に依存しない。
4 列が一次独立な場合の係数推定
系 4.1.定義 1.1の Gauss–Markov 仮定を置き、Xの列が一次独立であるとする。このとき系 2.2のβ^は不偏であり、
Cov(β^)=σ2(X⊤X)−1が成り立つ。
証明.A=(X⊤X)−1X⊤とおくとAX=Ipであるから、β^=Ay=β+Aεとなる。期待値と共分散を計算すると
E[β^]=β,Cov(β^)=A(σ2In)A⊤=σ2(X⊤X)−1を得る。▨
系 4.2 (Gauss–Markov:最小二乗推定量は BLUE).系 4.1と同じ仮定を置く。β=Cyがすべてのβ∈Rpに対してβの線形不偏推定量であるならば、あるD∈Rp×nに対して
Cov(β)−Cov(β^)=σ2DD⊤⪰0が成り立つ。等号はβ=β^のとき、かつそのときに限って成り立つ。
証明. 不偏性はCX=Ipと同値である。A=(X⊤X)−1X⊤、D=C−AとおくとDX=0となる。交差項が消えるため、
CC⊤=(A+D)(A+D)⊤=(X⊤X)−1+DD⊤である。したがって、主張する共分散差を得る。任意のv∈Rpに対してv⊤DD⊤v=∥D⊤v∥2≥0であり、共分散差が零であることはD=0と同値である。▨
Gauss–Markov 定理は誤差の正規性を仮定しない。正規性は、係数の検定や区間を有限標本で構成するときに別途用いる。
5 誤差分散の推定
階数rの行列Xに対し、Pをcol(X)への直交射影行列とする。定理 2.1により、最小二乗残差はe=(In−P)yと一意に表される。
命題 5.1.定義 1.1の Gauss–Markov 仮定を置き、r=rank(X)<nとする。RSS=∥e∥2とおくと、
s2=n−rRSSはσ2の不偏推定量である。
証明.PX=Xであるからe=(In−P)εである。Pは対称かつべき等なので
RSS=ε⊤(In−P)εとなる。E[εε⊤]=σ2Inから
E[RSS]=tr((In−P)E[εε⊤])=σ2tr(In−P)を得る。
§D3.15 定理 3.1によりPを直交対角化することができる。P2=Pなので固有値は0または1であり、像の次元がrなのでtr(P)=rである。したがって、E[RSS]=σ2(n−r)となる。r<nであるから、両辺をn−rで割ることができる。▨
正規誤差の下での係数と残差の分布は§E14.20 定理 3.1で扱う。係数、平均応答、新しい観測に対する区間は§E14.20 命題 3.2で扱う。新しい観測の予測誤差には将来の誤差による分散成分も含まれる。
6 平方和と決定係数
定義 6.1. 切片つきモデルにおいて、yˉ=n−1∑i=1nyiとし、
TSS=i=1∑n(yi−yˉ)2,ESS=i=1∑n(y^i−yˉ)2,RSS=i=1∑n(yi−y^i)2と定める。TSS>0のとき、決定係数 (coefficient of determination) を
R2=TSSESS=1−TSSRSSで定義する。さらに、r=rank(X)<nかつn>1のとき、自由度調整済み決定係数 (adjusted coefficient of determination) を
Radj2=1−TSS/(n−1)RSS/(n−r)で定義する。
命題 6.2. 切片を含む最小二乗当てはめでは、TSS=0の場合も含めて
TSS=ESS+RSSが成り立つ。TSS>0ならば0≤R2≤1である。
証明.y−yˉ1=e+(y^−yˉ1)である。残差eはcol(X)に直交し、切片つきモデルではy^−yˉ1∈col(X)である。Pythagoras の定理により
∥y−yˉ1∥2=∥e∥2+∥y^−yˉ1∥2となる。各平方和は非負であるから、TSS>0の場合には0≤R2≤1となる。▨
命題 6.3 (説明変数を加えたときの決定係数). 同じ応答yに二つの切片つきモデルを当てはめ、その計画行列の列空間をW1⊆W2とする。TSS>0ならば、二つの決定係数はR12≤R22を満たす。等号が成り立つ場合もある。
証明.W1上の当てはめはW2における最小二乗の候補でもある。したがって、W2に対する最小 RSS はW1に対する最小 RSS 以下である。R2=1−RSS/TSSから結論を得る。▨
R2は標本内の平方和分解に基づく指標である。説明変数を加えても減少しないため、変数数が異なるモデルをR2だけで比較することはできない。自由度調整済み決定係数も、モデルの妥当性や標本外予測を単独で保証しない。
7 数値例
例 7.1 (単回帰の最小二乗当てはめ).n=5、x=(1,2,3,4,5)⊤、y=(2,3,5,4,6)⊤とし、切片つき単回帰yi=β1+β2xi+εiを当てはめる。このときr=p=2、xˉ=3、yˉ=4である。
Sxx=i=1∑5(xi−xˉ)2=4+1+0+1+4=10,Sxy=i=1∑5(xi−xˉ)(yi−yˉ)=4+1+0+0+4=9.したがって、
β^2=SxxSxy=109=0.9,β^1=yˉ−β^2xˉ=4−2.7=1.3を得る。当てはめ値と残差は
y^=(2.2,3.1,4.0,4.9,5.8)⊤,e=(−0.2,−0.1,1.0,−0.9,0.2)⊤であり、∑i=15ei=0となる。
RSS=0.04+0.01+1.00+0.81+0.04=1.90,s2=5−21.90=3019≈0.6333,s=3019≈0.7958.また、
TSS=4+1+1+0+4=10,ESS=10−1.90=8.10=β^22Sxx=0.81⋅10である。よって、
R2=108.10=0.81,10/41.90/3=7519≈0.2533,Radj2=1−7519=7556≈0.7467となる。
単回帰では、cjk=[(X⊤X)−1]jkとおくと
c22=Sxx1,c11=n1+Sxxxˉ2である。同じ標本を用いた係数検定、F検定、平均応答の信頼区間、新しい観測の予測区間は§E14.20 例 5.1で計算する。
8 多重共線性
証明.Zをxj以外の列からなる行列とし、xjのcol(Z)への射影残差をzjとする。zj⊥col(Z)かつxj−zj∈col(Z)であるから、
zj⊤xj=∥zj∥2となる。bj=zj/∥zj∥2とおけば、X⊤bjは第j成分だけが1の標準基底ベクトルである。またbj∈col(X)なので、定理 3.4の一意性により
bj=X(X⊤X)−1ejである。したがって、
[(X⊤X)−1]jj=∥X(X⊤X)−1ej∥2=∥bj∥2=∥zj∥21.Zは切片列を含むため、平方和分解から∥zj∥2=(1−Rj2)Sjjである。これとSjj=(n−1)sxj2を代入する。▨