1 統計モデル
定義 1.1. 可測空間(X,A)と空でない集合Θをとる。各θ∈Θに対して(X,A)上の確率測度Pθが与えられているとき、族
P=(Pθ)θ∈Θを母数表示された統計モデル (statistical model) という。Θを母数空間 (parameter space)、θを母数 (parameter) という。真の母数がθであるとき、Pθを一観測の母集団分布という。
母数上に事前分布を定めるときにはΘに可測構造を加える。尤度を密度として表すときには、共通の支配測度と各Pθの密度を加える。一般の統計モデルには、これらの追加構造を仮定しない。
2 無作為標本と統計量
定義 2.1. 統計モデル(Pθ)θ∈Θと正の整数nに対して、積可測空間(Xn,A⊗n)上の確率測度Pθ⊗nを大きさnの標本の法則とする。座標写像
Xi(x1,…,xn)=xi(1≤i≤n)からなる組(X1,…,Xn)を、Pθからの大きさnの無作為標本 (random sample) という。すなわち、X1,…,Xnは独立で、いずれもPθに従う。
可測空間(S,G)への可測写像
T:(Xn,A⊗n)⟶(S,G)で、未知の母数θに依存しないものを統計量 (statistic) という。標本から得られる確率要素T(X1,…,Xn)の法則は、像測度T#(Pθ⊗n)である。
Pμ=N(μ,1)、μ∈Rからなる正規位置モデルでは、標本平均Xˉは統計量である。一方、各固定したμに対してXˉ−μは確率変数であるが、この式は未知の母数μに依存するため、一つの統計量ではない。
X=Rの場合、標本平均Xˉ=n−1∑i=1nXiは実数値統計量である。n≥2の場合、不偏標本分散(n−1)−1∑i=1n(Xi−Xˉ)2も実数値統計量である。これらの有限標本での性質は「標本分布」で扱う。
3 推定対象と識別可能性
定義 3.1. 統計モデル(Pθ)θ∈Θに対し、集合Dへの写像τ:Θ⟶Dを推定対象 (estimand) という。統計量は標本の値から定まる写像であり、推定対象は母数から定まる写像である。
定義 3.2. 統計モデル(Pθ)θ∈Θが識別可能 (identifiable) であるとは、任意のθ,η∈Θに対して
Pθ=Pη⟹θ=ηが成り立つことをいう。推定対象τ:Θ→Dが識別可能であるとは、任意のθ,η∈Θに対して
Pθ=Pη⟹τ(θ)=τ(η)が成り立つことをいう。
モデルの識別可能性は、異なる母数が異なる観測法則を与えるという性質である。一回の観測値から真の母数を確定することを意味しない。
命題 3.3. 統計モデル(Pθ)θ∈Θの母数θ,η∈ΘがPθ=Pηを満たすとする。このとき、任意の正の整数nと任意の統計量T:(Xn,A⊗n)→(S,G)に対して
T#(Pθ⊗n)=T#(Pη⊗n)が成り立つ。したがって、τ(θ)=τ(η)ならば、推定対象τは任意サイズの標本からも識別することができない。
証明.n=1ではPθ=Pηが仮定である。n≥2では、この等号と積測度の一意性§E9.10 定理 5.1を帰納的に用いる。したがって、任意のn≥1に対して
Pθ⊗n=Pη⊗nを得る。同じ可測写像Tによる像測度を取ると、像測度の定義§E9.6 定義 5.1から
T#(Pθ⊗n)=T#(Pη⊗n)となる。τ(θ)=τ(η)であっても、任意の統計量の法則が二つの母数の下で等しいため、標本の法則から二つの推定対象値を区別することはできない。▨
例 3.4 (Bernoulli モデル).X={0,1}、Θ=[0,1]とし、Pp({1})=pと定める。Pp=Pqならばp=Pp({1})=Pq({1})=qであるから、この統計モデルは識別可能である。推定対象τ(p)=pは母集団における成功確率であり、無作為標本の和∑i=1nXiはその推定に用いる統計量である。
例 3.5 (冗長な母数表示).Θ=Rとし、Pθ=N(θ2,1)と定める。Pθ=P−θであるから、この母数表示は識別可能ではない。一方、Pθ=Pηならば正規分布の期待値が等しいのでθ2=η2である。したがって、推定対象τ(θ)=θ2は識別可能である。この例では、符号を含む母数θと観測法則が決める推定対象θ2を区別する必要がある。