データの分析では、観測された値の集まりから何を読み取り、何を結論してよいのでしょうか。本記事では数値データを最初の数学的対象とし、平均値・中央値・最頻値で中心を、分散・標準偏差で散らばりを要約します。相関係数と集計による割合の反転も調べ、数値だけでは因果を結論することができない理由を明らかにします。
1 分布の中心
定義 1.1 (平均値・中央値・最頻値).とし、データをとする。平均値は
と定める。データを小さい順に並べたとき、が奇数ならば中央の値を中央値とし、が偶数ならば中央の二つの値の平均を中央値とする。最大の度数をもつ値を最頻値とする。最大の度数をもつ値が複数ならば、それらをすべて最頻値とし、すべての値の度数が等しい場合には最頻値なしとする。
例 1.2 (外れた値による違い). データの平均値はであり、中央値と最頻値はともにである。値18はほかの値から離れているため、平均値は中央値より大きい。このデータの中心を要約するときは、平均値だけでなく、中央値とデータの並びも確認する必要がある。
注意 1.3 (外れ値と代表値). データの平均値は4、中央値は2である。12が入力誤りであると確認したうえで除くと、平均値と中央値はともに2になる。外れ値を残すか除くかは代表値の変化だけでは決めず、入力と測定の過程を調べて判断する。
2 散らばり
定義 2.1 (分散と標準偏差).とし、データの平均値をとする。分散と標準偏差を
と定義する。
計算では次の公式も用います。
公式 2.2 (分散の計算公式).個のデータの平均値を、分散をとする。このとき
が成り立つ。
証明.についてと展開する。この等式の総和を取ると
となる。とを代入すると
を得る。▨
3 相関係数
定義 3.1 (相関係数).とし、組になったデータを()とする。との平均値を、とし、共分散を
と定義する。との標準偏差がともに正であるとき、相関係数を
と定義する。
相関係数は直線的な関係の向きと強さを測ります。が0に近いことは、関係がないことを意味しません。
例 3.2 (相関係数が0でも関係がある例).に対してとする。の平均値は0であり、の平均値は2である。したがって、共分散は
となる。とはどちらもすべて同じ値ではないためであり、相関係数はである。一方、二つの量の間にはという非線形な関係がある。
相関から因果を結論することもできません。共通の原因、対象の選び方による偏り、逆向きの因果などを区別するには、データが生じた過程を調べる必要があります。
注意 3.3 (仮説のもとでの起こりにくさ). ある仮説が観測値の確率分布を定める場合には、実際のデータと同程度以上に仮説から離れた結果が、その分布のもとでどの程度起こりにくいかを調べることができる。起こりにくい結果は仮説を再検討する材料になるが、その確率を仮説が正しい確率と読むことはできない。検定の定式化は「統計的推測」が扱う。
4 集計による関係の反転
集団をまとめる前後で割合の大小が逆転することがあります。
例 4.1 (Simpson のパラドックス). 次の仮想データについて、治療AとBの回復数を軽症と重症に分けて考える。
| 群 | 治療A | 治療B |
|---|---|---|
| 軽症 | 81/87 | 234/270 |
| 重症 | 192/263 | 55/80 |
軽症では、治療Aの回復率は、治療Bはである。重症では、治療Aは、治療Bはである。したがって、どちらの群でも治療Aの回復率が高い。一方、全体では治療Aが、治療Bがとなり、大小が逆転する。治療Aでは重症者が、治療Bではを占めるため、回復率が低い重症者の構成比の違いが全体の割合を反転させる。
この例だけから治療効果を結論することはできません。重症度の定義、割り付け方法、測定条件なども必要です。
5 演習
問題 5.1. データの平均値、中央値、最頻値、分散を求めよ。
解答.
平均値はであり、中央値と最頻値はともに2である。分散は
である。▨
問題 5.2. 相関係数が0に近いことから結論することができる内容と、結論することができない内容を説明せよ。
解答.
相関係数が0に近ければ、二つの量の直線的な関係は弱いと判断することができる。ただし、非線形な関係が存在しないことや、二つの量の間に因果関係が存在しないことは結論することができない。▨
問題 5.3.例 4.1の表について、集計前後の割合を再計算し、大小が反転する理由を人数の配分から説明せよ。
解答.
軽症では、重症ではであり、どちらも治療Aの割合が高い。全体では治療Aが、治療Bがであり、治療Bの割合が高い。治療Aには重症者が263人、治療Bには80人含まれ、回復率が低い重症者の構成比が異なるため、集計すると大小が反転する。▨