§B4.8標本調査とデータの偏り

最終更新

標本調査とデータの偏りでは、一部の回答から母集団について判断するとき、標本数だけで十分でしょうか。本記事では母集団とそこから選ぶ標本を最初の数学的対象とし、無作為抽出、標本誤差、偏りを区別します。本文の条件を満たす標本平均が母平均から一定以上離れる確率と、抽出や回答の仕組みを変えなければ残る偏りとを区別する基準を示します。

1 母集団と標本

定義 1.1 (母集団・標本・統計量). 調べたい対象の全体を母集団、母集団から実際に観測する一部を標本という。標本から計算する平均値や比率などの量を統計量という。

定義 1.2 (無作為抽出). 母集団から定めた確率的手順によって標本を選ぶことを無作為抽出という。無作為抽出のうち、同じ大きさの標本がすべて同じ確率で選ばれる方法を単純無作為抽出という。

標本の代表性を判断するときは、標本数だけでなく、母集団をどの名簿や範囲で捉え、各対象をどの手順で選んだかを確認します。

2 標本誤差と偏り

定義 2.1 (標本誤差と偏り). 同じ抽出方法で標本を繰り返し選んだときに、統計量が標本ごとに変動することを標本誤差という。抽出、回答、測定または公表の仕組みによって、統計量が母集団の値から一方向へずれることを偏りという。

例 2.2 (有限母集団からの大きさ1の標本). 値が00の対象と値が11の対象からなる有限母集団を考える。この母集団の母平均は

0+12=12\frac{0+1}{2}=\frac12

である。二つの対象から一つを単純無作為抽出すると、標本平均は確率1/21/2ずつで00または11となる。したがって、どちらが選ばれても標本平均と母平均との差の絶対値は

∣0−12∣=∣1−12∣=12\left|0-\frac12\right|=\left|1-\frac12\right|=\frac12

であり、無作為に選んでも有限標本には標本誤差が残る。一方、この抽出を同じ条件で繰り返したときの標本平均の期待値は

0×12+1×12=120\times\frac12+1\times\frac12=\frac12

であり、母平均と一致する。この変動自体は一方向への偏りではない。

定理 2.3 (大数の法則の使用形).X1,X2,…X_1,X_2,\ldotsを独立同分布な実確率変数列とし、E[∣X1∣]<∞E[|X_1|]<\inftyと仮定する。μ=E[X1]\mu=E[X_1]とし、標本平均を

X‾n=X1+⋯+Xnn\overline X_n=\frac{X_1+\cdots+X_n}{n}

とする。このとき、任意のε>0\varepsilon>0に対して

P(∣X‾n−μ∣>ε)⟶0(n→∞)P(|\overline X_n-\mu|>\varepsilon)\longrightarrow0 \qquad(n\to\infty)

が成り立つ。

この使用形は§E11.15 定理 2.1を標本平均の記号で書き直したものです。

注意 2.4 (大数の法則の適用条件).§E11.15 定理 2.1の証明は引用先が担う。観測値の独立性、同じ分布から得られること、E[∣X1∣]<∞E[|X_1|]<\inftyのいずれかを確認することができない場合、この使用形を適用することはできない。

注意 2.5 (標本を増やしても消えない偏り). 回答しない人が特定の傾向をもつ場合、特定の場所や時間にいる人だけを選ぶ場合、質問が回答を誘導する場合には、同じ仕組みのまま標本数を増やしても偏りは解消しない。本文の弱大数が保証するのは、X1,X2,…X_1,X_2,\ldotsが独立同分布でE[∣X1∣]<∞E[|X_1|]<\inftyを満たすとき、固定したε>0\varepsilon>0に対するP(∣X‾n−μ∣>ε)P(|\overline X_n-\mu|>\varepsilon)がn→∞n\to\inftyで00へ近づくことだけである。この結論は、抽出や回答の仕組みによる偏りが解消することを意味しない。

例 2.6 (昼休みの調査). 全校生徒を母集団として、昼休みに校内にいる生徒だけへ学校生活の満足度を尋ねる。この便宜的な抽出では、欠席者、校外で活動している生徒、回答しない生徒が標本から漏れる。回答数を増やしても同じ集団が漏れるため、得られた統計量が全校生徒の意見を表すとは限らない。

3 演習

問題 3.1. 動画配信サービスの満足度を、公式SNSを閲覧している利用者だけに尋ねた。想定される偏りと、その偏りを抑えるための改善案を述べよ。

解答.

公式SNSを閲覧する利用者には、利用頻度が高い人や公式情報を積極的に追う人が多く含まれる可能性がある。そのため、全利用者を表す名簿から確率的に抽出し、回答しない人の割合や特徴も確認する必要がある。▨

問題 3.2.X1,X2,…X_1,X_2,\ldotsを独立同分布な実確率変数列とし、E[∣X1∣]<∞E[|X_1|]<\infty、μ=E[X1]\mu=E[X_1]、X‾n=n−1∑i=1nXi\overline X_n=n^{-1}\sum_{i=1}^nX_iとする。標本数を増やしたときのX‾n\overline X_nに関する結論と、抽出の対象となる名簿から特定の集団が漏れている場合に残るものを区別せよ。

解答.

任意の固定したε>0\varepsilon>0に対して、

P(∣X‾n−μ∣>ε)⟶0(n→∞)P(|\overline X_n-\mu|>\varepsilon)\longrightarrow0 \qquad(n\to\infty)

が成り立つ。一方、抽出の対象となる名簿から特定の集団が漏れていれば、標本数を増やしても抽出の偏りは残る。▨

問題 3.3. 「一万人が回答したので偏りはない」という主張が成り立たない理由を説明せよ。

解答.

回答数の多さは標本誤差の大きさに関係するが、抽出の対象となる名簿の漏れ、回答者による自己選択、無回答、質問文の誘導による偏りがないことを保証しない。回答数だけでは抽出・回答・測定の仕組みを確認することができないため、この主張は成り立たない。▨

前提記事