多変量解析, Multivariate Analysis. 🎓統計学の一分野.
複数の変数を同時に扱い, 変数間の関係を分析する統計手法の総称. 1変数ずつ見るのではなく, 変数の間にある構造を丸ごと扱う.
出自は統計学で, 🔍データマイニングや🤖機械学習(ML)より古い. 1930年代の Fisher の判別分析, Hotelling の主成分分析が起点.
体系: 外的基準の有無による分類
日本の教科書では 外的基準 (説明したい目的変数) があるかないか で二分するのが定番.
外的基準あり: 予測・説明が目的
- 📈重回帰分析: 複数の説明変数から数値を予測する
- 判別分析: どのグループに属するかを判別する. 機械学習の LDA (Linear Discriminant Analysis) に相当
- 📈ロジスティック回帰(LR): 確率を予測する
- 正準相関分析: 変数群と変数群の関係を見る
- 数量化I類/II類: 上記の説明変数が質的データの場合
外的基準なし: 要約・構造の把握が目的
- 主成分分析(PCA): 変数を少数の合成変数に圧縮する
- 因子分析: 観測変数の背後にある潜在因子を推定する
- クラスター分析: 似たもの同士をグループ化する
- 多次元尺度構成法(MDS): 類似度から布置を2次元に描く
- 対応分析(コレスポンデンス分析): クロス集計表を布置図にする
- 数量化III類/IV類: 上記の質的データ版
Basics
bivariate data: 二変量データ
Contingency Tables: 分割表
2 つ以上の変数 (名義尺度が一般的) の間の関係を記録し分析するためのもの.
A contingency table or two-way table is used to organize data from multiple categories of two variables so that various assessments may be made.
多重共線性(multicollinearity)
説明変数同士に強い相関があると, 係数の推定が不安定になり解釈が壊れる. 多変量解析では深刻な問題として扱う.
機械学習では予測精度が落ちなければ許容されることも多く, ここに両分野の態度の差が出る.
機械学習との違い
手法の中身はかなり重なる. 同じものが分野ごとに別名で呼ばれている.
- 重回帰分析 = 線形回帰
- 主成分分析 = PCA
- 判別分析 ≒ LDA
- クラスター分析 = クラスタリング
違いは目的と作法の側にある.
- 目的: 多変量解析は「係数を読んで現象を理解する」. 機械学習は「テストデータで当てる」
- 仮説の有無: 多変量解析は仮説駆動で, 何を投入するか理由をつけて決める. 機械学習は変数を全部投げ込んで性能で選ぶことを厭わない
- 統計的前提: 正規性・線形性・等分散性を前提に置き検定する. 機械学習は前提を置かず交差検証で評価する
- データサイズ観: サンプル数 n が変数数 p より十分多い状況を想定する (n ≫ p). 機械学習は p > n の高次元も扱う