多変量解析, Multivariate Analysis. 🎓統計学の一分野.

複数の変数を同時に扱い, 変数間の関係を分析する統計手法の総称. 1変数ずつ見るのではなく, 変数の間にある構造を丸ごと扱う.

出自は統計学で, 🔍データマイニング🤖機械学習(ML)より古い. 1930年代の Fisher の判別分析, Hotelling の主成分分析が起点.

体系: 外的基準の有無による分類

日本の教科書では 外的基準 (説明したい目的変数) があるかないか で二分するのが定番.

外的基準あり: 予測・説明が目的

  • 📈重回帰分析: 複数の説明変数から数値を予測する
  • 判別分析: どのグループに属するかを判別する. 機械学習の LDA (Linear Discriminant Analysis) に相当
  • 📈ロジスティック回帰(LR): 確率を予測する
  • 正準相関分析: 変数群と変数群の関係を見る
  • 数量化I類/II類: 上記の説明変数が質的データの場合

外的基準なし: 要約・構造の把握が目的

  • 主成分分析(PCA): 変数を少数の合成変数に圧縮する
  • 因子分析: 観測変数の背後にある潜在因子を推定する
  • クラスター分析: 似たもの同士をグループ化する
  • 多次元尺度構成法(MDS): 類似度から布置を2次元に描く
  • 対応分析(コレスポンデンス分析): クロス集計表を布置図にする
  • 数量化III類/IV類: 上記の質的データ版

Basics

bivariate data: 二変量データ

Contingency Tables: 分割表

2 つ以上の変数 (名義尺度が一般的) の間の関係を記録し分析するためのもの.

A contingency table or two-way table is used to organize data from multiple categories of two variables so that various assessments may be made.

多重共線性(multicollinearity)

説明変数同士に強い相関があると, 係数の推定が不安定になり解釈が壊れる. 多変量解析では深刻な問題として扱う.

機械学習では予測精度が落ちなければ許容されることも多く, ここに両分野の態度の差が出る.

機械学習との違い

手法の中身はかなり重なる. 同じものが分野ごとに別名で呼ばれている.

  • 重回帰分析 = 線形回帰
  • 主成分分析 = PCA
  • 判別分析 ≒ LDA
  • クラスター分析 = クラスタリング

違いは目的と作法の側にある.

  • 目的: 多変量解析は「係数を読んで現象を理解する」. 機械学習は「テストデータで当てる」
  • 仮説の有無: 多変量解析は仮説駆動で, 何を投入するか理由をつけて決める. 機械学習は変数を全部投げ込んで性能で選ぶことを厭わない
  • 統計的前提: 正規性・線形性・等分散性を前提に置き検定する. 機械学習は前提を置かず交差検証で評価する
  • データサイズ観: サンプル数 n が変数数 p より十分多い状況を想定する (n ≫ p). 機械学習は p > n の高次元も扱う

🔗References