多変量解析の基礎
目的で選ぶ手法マップ
アンケート分析や顧客データ分析の現場では、重回帰分析・主成分分析・因子分析・クラスター分析……と、よく似た響きの手法名が次々と登場します。1つずつ調べると、それぞれが孤立した知識になってしまい、「結局どれを、いつ使えばいいのか」が見えてきません。本記事では、これらをまとめて 「多変量解析」 という1つの上位概念で捉え直し、手法を選ぶための地図を示します。
データ分析でよく使う「指標(ものさし)」を整理した データ分析でよく使うアルゴリズム・指標まとめ が「ものさし」の地図だとすれば、本記事は「手法そのもの」の地図です。整理する軸が違うので、両方を持っておくと分析の設計で迷いにくくなります。
多変量解析とは、3つ以上の変数を同時に分析する統計手法の総称です。個々の手法は多彩ですが、選ぶときに見るのは2つの軸だけ。(1) 予測・説明したい「目的変数」があるか、(2) 扱うデータが量的か質的か。この2軸で、重回帰分析・判別分析・主成分分析・因子分析・クラスター分析などが自然に整理できます。
複数の変数(データの列)を同時に扱って、変数どうしの関係や、サンプル(行)どうしの関係を分析する統計手法の総称です。1つの変数を要約する記述統計、2つの変数の関係を見る相関分析の「次の段」にあたります。
01.まず結論:多変量解析は「複数の変数を同時に扱う」手法群
多変量解析は、特定の1つの手法ではなく、手法のグループ(手法群)の名前です。「広告費・記事数・季節・流入経路が同時に動くなかで、何が売上を動かしているのか」「数十問のアンケートを、いくつかの意味のある軸に要約したい」——こうした「複数の変数が絡む問い」に答えるための道具箱が、まとめて多変量解析と呼ばれています。
道具箱の中身は多いものの、選ぶときの判断は単純です。まず 「予測・説明したい結果の列(目的変数)があるか」 を決め、次に 「扱うデータが数値(量的)か、カテゴリ(質的)か」 を確認する。この2つが決まれば、候補は数個に絞れます。本記事は、その2軸と手法選択マップ、そして実務で最も混同されやすい主成分分析と因子分析の違いを中心に整理します。
02.多変量解析とは|記述統計・相関分析との違い
多変量解析の位置づけは、「扱う変数の数」で考えると分かりやすくなります。変数が 1つ なら、平均・分散・ヒストグラムで分布を要約する記述統計。変数が 2つ なら、相関係数や散布図で「一緒に動くか」を見る相関分析。そして変数が 3つ以上 になると、1つずつ・2つずつ見る方法では追いつかなくなり、多変量解析の出番になります。
図:変数の数で分析の枠組みは変わる
扱う変数が増えると、1つずつ・2つずつ見る方法では関係を捉えきれません。3変数以上を同時に扱う段が多変量解析です。
STEP 01
1変数・記述統計
1つの変数の分布を要約する
平均・中央値・分散・ヒストグラム
STEP 02
2変数・相関分析
2つの変数が一緒に動くかを見る
相関係数・散布図
STEP 03
3変数以上・多変量解析
複数の変数を同時に扱う
重回帰・主成分分析・クラスター分析…
「変数が3つ以上ある」「複数の要因が同時に動く」と感じたら多変量解析の出番です
なぜ「同時に」扱う必要があるのでしょうか。複数の要因が絡むとき、2変数ずつの相関だけを見ると判断を誤るからです。たとえば「広告費と売上の相関が強い」と分かっても、実は広告を増やした月は記事公開も多かった、という具合に別の要因が背後で動いていることがあります。多変量解析は、こうした要因を同時にモデルに入れて、互いの影響を取り除いたうえで関係を読むことを可能にします。本記事は、1変数・2変数の分析の「次の段」にあたる手法群を、選び方の地図として整理します。
03.手法選択の2軸|目的変数の有無 × データ型
多変量解析の手法は数多くありますが、選ぶときに見る軸は2つです。まず用語を整理します。目的変数とは「予測・説明したい結果の列」(売上、解約の有無など)で、外的基準とも呼ばれます。説明変数はその要因となる列(広告費、利用日数など)です。
- 軸1:目的変数があるか —— ある場合は「要因から結果を予測・説明する」手法、ない場合は「データそのものの構造を要約・分類する」手法になります。
- 軸2:データ型が量的か質的か —— 量的データは売上・年齢のような数値、質的データは性別・職業・購入カテゴリのようなカテゴリです。手法は扱えるデータ型が決まっています。
この2軸を掛け合わせると、多変量解析の手法は次の4つの区画に分かれます。自分の分析がどの区画にあるかを決めるのが、手法選びの出発点です。
上の図はおおまかな地図です。実際には、目的変数のデータ型と説明変数のデータ型を別々に見ます。たとえば重回帰分析は目的変数も説明変数も量的、判別分析は目的変数が質的(グループ)で説明変数が量的、というように分かれます。細かな分岐は本記事後半の手法選択マップで確認できます。
04.目的変数がある手法|予測・説明
目的変数がある手法は、「予測・説明したい結果の列」が先に決まっているのが特徴です。機械学習でいう教師あり学習に近い考え方で、複数の説明変数から目的変数への関係を式にします。
図:目的変数がある手法のかたち(予測・説明)
「予測・説明したい結果の列(目的変数)」が決まっていて、その要因(説明変数)から関係を式にします。
説明変数(要因)
X₁・X₂・X₃ …
広告費・滞在時間・年代・流入経路 など
手法
重回帰・判別分析 など
要因 → 結果の関係を式にする
目的変数(結果)
Y
売上・CV・解約 など予測したい結果
代表的な手法は次のとおりです。どれを使うかは、目的変数が量的か質的か、説明変数が量的かカテゴリかで決まります。
| 手法 | 目的変数 | 説明変数 | 1行でいうと |
|---|---|---|---|
| 重回帰分析 | 量的 | 量的 | 複数の要因から、売上やCVのような量的な結果を予測・説明する |
| ロジスティック回帰 | 質的(2値) | 量的が中心 | 「CVする/しない」のような2択の起こりやすさを確率で予測する |
| 判別分析 | 質的(グループ) | 量的 | 数値の特徴から、どのグループ(優良/離反など)に入るかを判別する |
| 数量化I類 | 量的 | 質的(カテゴリ) | カテゴリ型の要因から量的な結果を予測する(重回帰のカテゴリ版) |
| 数量化II類 | 質的(グループ) | 質的(カテゴリ) | カテゴリ型の要因から、どのグループに入るかを判別する(判別分析のカテゴリ版) |
このうち、量的な結果を予測・説明する 重回帰分析 と、2択の確率を予測する ロジスティック回帰 は実務での登場頻度が高く、 回帰分析の基礎 で係数の読み方や注意点を詳しく扱っています。判別分析は「どのグループに入るか」を予測する点でロジスティック回帰と目的が近く、実務ではロジスティック回帰で代替されることも多い手法です。数量化I類・II類は、説明変数がカテゴリ(性別・職業・居住エリアなど)のときの選択肢で、後述する数量化理論の一部です。
05.目的変数がない手法|要約・分類
目的変数がない手法は、「予測したい結果の列」を持ちません。機械学習でいう教師なし学習に近く、データそのものの構造を、少数の軸(要約)やいくつかのグループ(分類)に整理することが目的です。
図:目的変数がない手法のかたち(要約・分類)
予測したい結果の列はありません。データそのものの構造を、少数の軸やグループに整理します。
手元のデータ
多数の変数・多数のサンプル
正解ラベル(目的変数)はない
手法
主成分分析・クラスター分析 など
データの構造を見つける
アウトプット
少数の軸 / いくつかのグループ
要約された主成分・顧客セグメント など
代表的な手法は次のとおりです。「変数を要約したいのか」「サンプル(顧客・商品)をグループに分けたいのか」で大きく分かれます。
| 手法 | 主な対象データ | 何をするか | 1行でいうと |
|---|---|---|---|
| 主成分分析(PCA) | 量的変数 | 次元削減・要約 | 多数の量的変数を、情報をできるだけ保った少数の合成変数にまとめる |
| 因子分析 | 量的変数 | 潜在構造の発見 | 観測した変数の背後にある共通の「因子」を推定する |
| クラスター分析 | 量的が中心 | サンプルの分類 | 似たサンプル(顧客・商品)同士を自動でグループに分ける |
| コレスポンデンス分析 | 質的(クロス集計) | 対応関係の可視化 | クロス集計表の行と列の関係を、1枚の散布図に配置する |
このうちクラスター分析は、 クラスタリング・顧客セグメンテーションの基礎 で深掘りしています。主成分分析(PCA)・因子分析・コレスポンデンス分析は本記事では概要にとどめますが、主成分分析は変数の要約や可視化の前処理に、因子分析はアンケートの潜在構造を読み解くのに、コレスポンデンス分析はブランドイメージ調査のように「商品 × イメージ語」のクロス集計を可視化するのによく使われます。
06.主成分分析と因子分析の違い
多変量解析でもっとも混同されやすいのが、主成分分析(PCA)と因子分析です。どちらも「多くの変数を少数にまとめる」点が似ているため同じ手法のように扱われがちですが、考え方の向きが逆です。
図:主成分分析と因子分析は「考え方の向き」が逆
PCA は観測変数から主成分を「作る」、因子分析は背後の共通因子が観測変数を「生む」と考えます。観測変数(白)がフローのどちら側に来るかが違いです。
主成分分析(PCA)
観測変数(アンケート項目など)
重み付きで合成する
主成分は観測変数の重み付き合計。変数を要約して減らすのが目的です。
因子分析
共通因子(背後にある潜在変数)
各変数に影響を与える
観測変数は「共通因子+独自因子」で生まれると考える。背後の構造を解釈するのが目的です。
ポイントは「観測した変数(アンケートの各項目など)」と「まとめた変数」の関係の向きです。PCA は、観測変数を重み付きで足し合わせて主成分を作ります(変数 → 主成分)。主成分は計算上の合成変数で、目的は情報の圧縮・次元削減です。一方 因子分析は、背後に共通因子という潜在変数があり、それが各観測変数に影響を与えて値を生んでいる、というモデルを置きます(共通因子 → 観測変数)。目的は、観測変数の背後にある構造(因子)を解釈することです。
| 観点 | 主成分分析(PCA) | 因子分析 |
|---|---|---|
| 考え方の向き | 観測変数 → 主成分(変数を合成する) | 共通因子 → 観測変数(因子が変数を生むと考える) |
| 主な目的 | 次元削減・情報の圧縮 | 背後にある潜在構造(因子)の解釈 |
| 何を説明するか | データ全体の分散 | 変数間で共通する分散(独自・誤差は分離する) |
| 結果の呼び名 | 主成分(第1主成分・第2主成分…) | 共通因子と因子負荷量 |
| 向いている場面 | クラスタリングや可視化の前処理、多重共線性の回避 | アンケートから「満足度」「期待感」などの軸を取り出す |
実務では、変数が多すぎるので分析や可視化の前に数を減らしたいときは主成分分析、アンケート項目の背後にある「顧客が本当は何を評価しているのか」を解釈したいときは因子分析、と考えると選びやすくなります。どちらも標準化(変数のスケールを揃える前処理)が前提になる点は共通です。
07.手法選択マップ|2軸と早見表で選ぶ
ここまでの2軸を、実際に手を動かす順番に並べ替えたのが次の手法選択マップです。上から順に質問に答えていくと、候補の手法にたどり着きます。
- ある目的変数は量的か、質的か?
- 量的(売上・CV数 など)重回帰分析説明変数がカテゴリ中心なら数量化I類
- 質的(する/しない・グループ)ロジスティック回帰・判別分析説明変数がカテゴリ中心なら数量化II類
- ない変数を要約したいか、サンプルを分類したいか?列をまとめたいのか、行をまとめたいのか
- 変数(列)を要約・次元削減目的は情報の圧縮か、背後の因子の解釈か?
- 情報を圧縮・前処理したい主成分分析(PCA)
- 潜在因子を解釈したい因子分析
- サンプル(行)をグループ化クラスター分析質的なクロス集計が中心ならコレスポンデンス分析
「やりたいこと」から逆引きしたいときは、次の早見表が使えます。
| やりたいこと | 向いている手法 |
|---|---|
| 複数の要因のうち、何が売上やCVを動かしているか知りたい | 重回帰分析 |
| 解約しそう・離反しそうな顧客を見分けたい | ロジスティック回帰・判別分析 |
| カテゴリ型の要因(職業・エリアなど)で結果を予測したい | 数量化I類・数量化II類 |
| 変数が多すぎるので、情報を保ったまま数を減らしたい | 主成分分析(PCA) |
| アンケート項目の背後にある評価軸を取り出したい | 因子分析 |
| 顧客や商品を、似たもの同士のグループに分けたい | クラスター分析 |
| 「商品 × イメージ語」のような対応関係を1枚で見たい | コレスポンデンス分析 |
数量化理論は、性別・職業・購入カテゴリのような質的データ(カテゴリ)を数値に置き換えて多変量解析を行うための手法群で、林知己夫が体系化しました。おおまかに、I類は重回帰、II類は判別分析、III類はコレスポンデンス分析に対応する質的データ版と考えると整理できます。アンケートのように回答がカテゴリで集まる調査と相性が良い枠組みです。
08.実務での使い方|マーケティングリサーチ・アンケート分析
多変量解析は、マーケティングリサーチやアンケート分析、顧客理解の文脈で定番の道具になっています。「複数の質問・複数の属性が同時に絡む」というアンケートの性質が、まさに多変量解析の得意分野だからです。代表的な実務シーンを、手法と得たいアウトプットで整理します。
| 実務シーン | よく使う手法 | 得たいアウトプット |
|---|---|---|
| 顧客満足度アンケートの構造を知りたい | 因子分析 | 「価格満足」「品質満足」など、満足度を構成する評価軸 |
| 顧客を似たタイプに分けて施策を変えたい | クラスター分析 | 「優良層」「離反しかけ」などの顧客セグメント |
| 何が売上・CVを動かしているか要因を分解したい | 重回帰分析 | 各要因の寄与の大きさ(係数) |
| 解約しそうな顧客を事前に見分けたい | ロジスティック回帰・判別分析 | 解約確率・離反スコア |
| ブランドのイメージ語と商品の関係を見たい | コレスポンデンス分析 | 商品とイメージ語の位置関係マップ |
| 変数が多く、分析や可視化の前に整理したい | 主成分分析(PCA) | 情報を保った少数の合成変数 |
実務では、手法を1つだけ使うより組み合わせて使うことが多くなります。たとえば、数十問のアンケートをまず主成分分析や因子分析で少数の軸に要約し、その軸を使ってクラスター分析で顧客をセグメントに分ける、という流れは定番です。要因の寄与を知りたいときは重回帰分析、というように、「まず構造を要約 → 次に予測・説明」と段階を分けると、分析が安定します。
多変量解析でつまずく典型は、データを前にしていきなり手法名から考え始めることです。最初にやるべきは、「自分はいま、当てに行きたい結果の列があるのか、それともデータの構造を知りたいのか」を言葉にすること。ここが曖昧なまま主成分分析とクラスター分析を混同したり、目的変数があるのに要約だけして終わったりします。手法選択マップの最初の質問に立ち返るのが、遠回りのようで近道です。
09.よくある質問(FAQ)
多変量解析と機械学習・AIは何が違うのですか?
扱う手法の中身は大きく重なります。重回帰分析は線形回帰、クラスター分析はクラスタリング、主成分分析(PCA)はそのまま機械学習でも使われます。
違いは重心の置き方です。多変量解析は統計学の流れをくみ、係数や因子をどう解釈するかを重視します。機械学習は未知データへの予測精度を重視する傾向があります。同じ手法を、目的に応じて呼び分けていると考えると混乱しません。
主成分分析と因子分析はどちらを使えばいいですか?
目的で決めます。変数が多すぎるので、分析や可視化の前に数を減らしたいなら主成分分析(PCA)、アンケート項目の背後にある評価軸(潜在因子)を解釈したいなら因子分析です。主成分分析は観測変数から主成分を作る、因子分析は共通因子が観測変数を生むと考える、という考え方の向きの違いがあります。詳細は本文の主成分分析と因子分析の違いの章で扱っています。
どの手法を使うか、最初に何を決めればいいですか?
最初に決めるのは 「予測・説明したい目的変数(結果の列)があるか」 です。あれば重回帰分析・判別分析・ロジスティック回帰などの予測・説明の手法、なければ主成分分析・因子分析・クラスター分析などの要約・分類の手法になります。次に、扱うデータが量的(数値)か質的(カテゴリ)かを確認すると、候補は数個に絞れます。本文の手法選択マップを上から順にたどってみてください。
多変量解析にはどれくらいのデータ件数が必要ですか?
手法と変数の数によりますが、変数の数に対して十分なサンプル数(行数)が必要です。目安として、説明変数1つあたり10〜20件以上を確保するという経験則が広く使われます。件数が少ないと、結果が偶然のばらつきに左右されて安定しません。まず変数を絞り込み、必要なら計測期間を延ばしてデータを集めるのが現実的です。
Excelでも多変量解析はできますか?
重回帰分析は、Excelの分析ツール(データ分析アドイン)で一通り実行できます。主成分分析・因子分析・クラスター分析は、専用アドインや統計ソフト、またはPython・Rを使うのが一般的です。100〜1,000件規模の重回帰ならExcelで十分なことも多く、本格的に回すならPythonのscikit-learnやstatsmodelsに移行すると拡張しやすくなります。
数量化理論とは何ですか?
数量化理論は、性別・職業・購入カテゴリのような質的データ(カテゴリ)を数値に置き換えて多変量解析を行うための手法群で、林知己夫が体系化しました。数量化I類は重回帰、II類は判別分析、III類はコレスポンデンス分析に対応する質的データ版と考えると整理できます。アンケートのように回答がカテゴリで集まる調査と相性が良い枠組みです。
10.まとめ
多変量解析は単一の手法ではなく、複数の変数を同時に扱う手法群の総称です。手法は多くても、選ぶときに見る軸は 「目的変数があるか」 と 「データ型が量的か質的か」 の2つだけ。目的変数があれば重回帰分析・判別分析・ロジスティック回帰など予測・説明の手法、なければ主成分分析・因子分析・クラスター分析など要約・分類の手法、というように候補が絞れます。
実務で混同しやすい主成分分析と因子分析は、「観測変数 → 主成分」と「共通因子 → 観測変数」という考え方の向きで区別できます。アンケート分析や顧客理解では、まず要約してから予測・説明へ、と段階を分けるのが安定したやり方です。個別の手法は、回帰分析やクラスタリングの各記事で深掘りできます。
回帰分析の基礎
重回帰・ロジスティック回帰の係数の読み方、多重共線性、正則化までを整理しています。
クラスタリング・顧客セグメンテーションの基礎
k-means・階層クラスタリング・RFM分析で顧客をグループに分ける方法を整理しています。
データ分析でよく使うアルゴリズム・指標まとめ
類似度・一致度・モデル評価という別軸で、データ分析の指標を整理した総合解説です。
予測モデルの評価指標とは
重回帰やロジスティック回帰の精度を測る、分類・回帰の評価指標を整理しています。
アンケート・顧客データの多変量解析を社内で使えるよう伴走します
どの手法を選ぶべきかの設計、アンケート分析や顧客セグメンテーション、要因分解の進め方を、実データで伴走しながら整えています。お気軽にお問い合わせください。
データ分析・アルゴリズム 基礎知識集
一覧に戻る →全体像とカテゴリ早見
データの可視化
個別指標カテゴリ
統計的推測の基礎
実務分析の手法
多変量解析
- ›多変量解析の基礎|目的で選ぶ手法マップ(この記事)
- ›回帰分析の基礎|施策の 1 単位あたりの効きを数字で出す
- ›ロジスティック回帰分析|確率で出すから優先順位に使える
- ›クラスタリング・顧客セグメンテーション
- ›構造方程式モデリングの基礎|パス解析でKPI波及を可視化

