AI × データ分析基礎知識集 / 相関分析

相関分析の基礎|ピアソン・スピアマン相関係数と『相関≠因果』の見抜き方


「広告費とCVが一緒に伸びている」「滞在時間が長いページほど順位が高い」――データ分析でいちばんよく出てくるのが、2つの数字が一緒に動くかを測る相関分析です。同時に、いちばん誤読されやすい手法でもあります。本記事では、直線関係を測るピアソン相関係数と順位で単調関係を測るスピアマン相関係数の使い分け、外れ値・非線形・範囲制限という相関係数の落とし穴、必ず散布図で確かめる習慣(アンスコムの数値例)、そして相関は因果ではない――交絡・擬似相関・逆因果を見抜く考え方までを、初学者向けに整理します。

公開2026.05.18
最終更新2026.06.11
読了 17 分 / 約7,600字
この記事をシェアポスト
AI × データ分析相関分析はいちばん使われ、いちばん誤読される

相関分析の基礎
ピアソン・スピアマンと相関≠因果

「広告費とCV(コンバージョン)が一緒に伸びている」「滞在時間が長いページほど検索順位が高い」「メルマガ開封率と解約率に関係がありそうだ」――データを2つ並べて関係を見るとき、私たちは無意識に相関分析をしています。ExcelのCORREL関数やBI(ビジネスインテリジェンス)ツールの相関マトリクスで数字を出すだけなら数秒です。だからこそ、相関分析はもっとも頻繁に使われ、もっとも誤読されやすい手法になっています。

C
本記事の結論を先に
相関は『一緒に動くか』を測るだけで、『一方が他方を起こすか』は測れない

相関分析は、2つの変数が一緒に動く傾向を −1〜+1 の数字(相関係数)に要約します。直線的な関係を測るのがピアソン相関係数、順位に直して単調な関係を測るのがスピアマン相関係数です。ただし相関係数は1つの数字に圧縮された要約なので、外れ値・非線形・範囲制限で簡単に誤読されます。だから相関係数を出したら必ず散布図を描いて形を確認します。そして最大の注意点が「相関≠因果」――相関が出ても、その裏には交絡(共通の第3要因)・逆因果・偶然の一致が潜んでいることがあり、因果を主張するには実験か因果推論の手法が要ります。

01.まず結論:相関は『2つの数字が一緒に動くか』を測るだけ

相関とは、一方の変数が大きいとき、もう一方も大きい(または小さい)傾向があるかという関係のことです。気温が高い日はアイスがよく売れる、ページの表示速度が遅いほど離脱率が高い――こうした「片方が動くともう片方も動く」傾向を、相関分析は1つの数字に要約します。

その数字が相関係数で、記号は r、値は必ず −1 から +1 の間に収まります。符号が関係の向きを、絶対値が関係の強さを表します。

  • r が正(0〜+1):一方が増えると他方も増える(正の相関)。広告費とインプレッション数など。
  • r が負(−1〜0):一方が増えると他方は減る(負の相関)。表示速度の遅さと回遊ページ数など。
  • r が 0 付近:一緒に動く傾向がない(無相関)。一方の値から他方は予測しにくい。

図:相関係数 r は −1 から +1 の範囲で関係の向きと強さを表す

符号が関係の向き(+なら一方が増えると他方も増える、−なら逆)、絶対値が関係の強さ。0 に近いほど「一緒に動く傾向がない」ことを意味します。

-1.0完全な負の相関-0.5中程度の負0ほぼ無相関+0.5中程度の正+1.0完全な正の相関絶対値 0.7 以上なら強い相関、0.4〜0.7 で中程度、というのは目安にすぎない

「強い/弱い」の境界は分野や文脈で変わります。社会調査では r=0.3 でも意味がある関係とされる一方、精密な物理測定では r=0.9 でも弱いと見なされます。数値の大小だけで判断せず、必ず散布図と合わせて読みます。

ここで最初に強調しておきたいのが、相関係数が答える問いはたった1つだけだということです。それは「2つの数字が一緒に動く傾向があるか、あるならどのくらい強いか」です。「なぜ動くのか」「どちらが原因か」「片方を変えれば他方も変わるのか」には、相関係数は何も答えません。この線引きを曖昧にしたまま相関を使うと、データ分析の結論は簡単に的を外します。本記事は前半で相関係数の正しい計算と読み方を扱い、後半で相関と因果の決定的な違いを整理します。

02.ピアソン相関係数|直線的な関係の強さを測る

単に「相関係数」と言ったとき、ほとんどの場合はピアソンの積率相関係数を指します。ExcelのCORREL、Google スプレッドシートのCORREL、多くのBIツールの「相関」がこれです。ピアソン相関係数が測っているのは、2つの変数がどれだけ直線(一次関数)に近い形で並んでいるかです。

計算の考え方はシンプルです。各データ点について「x が平均からどれだけ離れているか」と「y が平均からどれだけ離れているか」を掛け合わせ、その平均(共分散)を、それぞれのばらつき(標準偏差)で割って −1〜+1 に正規化します。x が平均より上のとき y も上、x が下のとき y も下、という点が多ければ r は +1 に近づきます。

# ピアソン相関係数を計算する(pandas / scipy)
import pandas as pd
from scipy.stats import pearsonr

df = pd.DataFrame({
    "page_speed_ms": [800, 1200, 1500, 2200, 3000, 3600],
    "bounce_rate":   [0.32, 0.36, 0.41, 0.48, 0.55, 0.61],
})

# 相関行列だけならこれで十分
print(df.corr(method="pearson"))

# 相関係数と p値(偶然この相関が出る確率)をセットで
r, p = pearsonr(df["page_speed_ms"], df["bounce_rate"])
print(f"ピアソン r = {r:.3f}, p = {p:.4f}")

ピアソン相関係数を使うときに前提となるのが、次の3つです。これを外れたデータにそのまま当てはめると、本文で扱う落とし穴に直結します。

前提意味外れるとどうなるか
関係が直線的であるx と y の関係が一次関数で近似できる曲線関係だと r が小さく出て「関係なし」と誤読する
外れ値が少ない極端に離れた点が結果を支配していない1点の外れ値で r が大きくも小さくもなる
両方が量的データ間隔・比率が意味を持つ数値(売上、時間、回数など)順位やカテゴリには別の係数(スピアマン等)が要る

ピアソン相関係数には、相関係数本体とは別にp値がセットで出てきます。これは「本当は無相関(r=0)なのに、偶然この大きさの r が出てしまう確率」で、帰無仮説を「相関は0」とした統計的仮説検定の結果です。p値が小さければ「相関が0ではないとは言える」ものの、サンプルが大きいと、ごく弱い相関でも p値は小さくなります。「有意な相関」と「強い相関」は別物で、見るべきは r の大きさと散布図の形です。

03.スピアマン相関係数|順位で単調関係を測る

ピアソンが「直線か」を測るのに対し、スピアマンの順位相関係数は「単調か」を測ります。単調とは「x が増えれば y は必ず増える(または必ず減る)」という関係で、増え方が一定(直線)である必要はありません。曲線でも、右肩上がりでありさえすれば単調です。

計算の仕組みは「値そのものではなく順位に直してから、ピアソン相関係数を計算する」というものです。データを小さい順に並べて1位・2位・3位…と順位をつけ、その順位どうしの相関を取ります。順位に変換するため、値の絶対的な大きさや分布の形は無視され、大小の並び順だけが反映されます。

図:右肩上がりだが直線ではない関係――2つの相関係数で答えが分かれる

x が増えれば y も必ず増える(単調増加)が、増え方は加速していく曲線です。ピアソンは「直線か」を測るため 1 に届かず、スピアマンは「順位が揃っているか」を測るため 1.00 になります。

x(順位 1→8)yスピアマン = 1.00ピアソン ≈ 0.93

「関係があるか」を知りたいだけならスピアマンの 1.00 が正しい答えです。ピアソンの 0.93 を見て「関係はやや弱い」と読むのは誤りで、実際には「直線ではないだけで、関係は完璧」です。何を測りたいかで使う係数が変わります。

上の図のように、x が3乗で増えるような曲線では、x が増えれば y は必ず増えるので順位は完全に一致し、スピアマンは 1.00 になります。一方ピアソンは「直線からのズレ」を減点するため 0.93 程度にとどまります。ここで「ピアソンが 0.93 だから関係はやや弱い」と読むのは誤りです。関係そのものは完璧で、ただ直線ではないだけです。

順位に直すことから、スピアマン相関係数には実務上うれしい性質がいくつも生まれます。

  • 外れ値に強い:値を順位に変換するため、極端な1点も「いちばん大きい1つ」としか扱われず、結果を支配しにくくなります。
  • 曲線関係を捉えられる:右肩上がり・右肩下がりでありさえすれば、形が曲がっていても強い相関として検出できます。
  • 順位データに使える:満足度の5段階評価、検索順位、ランキングなど、間隔が等しいとは限らない順序データにそのまま使えます。
# スピアマン相関係数を計算する(pandas / scipy)
from scipy.stats import spearmanr

# 検索順位(1位が最良)とクリック率の関係を見る例
search_rank = [1, 2, 3, 4, 5, 8, 12, 20]
click_rate  = [0.31, 0.18, 0.11, 0.08, 0.06, 0.03, 0.02, 0.01]

rho, p = spearmanr(search_rank, click_rate)
print(f"スピアマン rho = {rho:.3f}, p = {p:.4f}")
# 順位が下がるほどCTRも下がる強い単調関係 → rho は -1 に近い

04.ピアソンとスピアマンの使い分け

どちらを使うかは、データの性質と知りたいことで決まります。迷ったときの基本方針は「まず散布図を見て、関係が直線的でなければスピアマン、外れ値が気になってもスピアマン」です。

観点ピアソン相関係数スピアマン相関係数
測るもの直線的な関係の強さ単調な関係の強さ(曲線でも可)
入力データ量的データ(売上・時間・回数)量的データ+順序データ(順位・5段階評価)
外れ値の影響受けやすい(1点で大きく動く)受けにくい(順位に変換するため)
非線形な関係捉えられない(過小評価する)単調なら捉えられる
向いている場面関係が直線的だと分かっている/予測式に使いたい形が不明・外れ値あり・順位データ・探索段階

実務では「まずスピアマンも一緒に出しておく」のが安全です。ピアソンとスピアマンの値が大きく食い違ったら、それは『散布図を見ろ』というサインです。たとえばピアソンが 0.4 でスピアマンが 0.9 なら、関係はあるのに直線ではない(曲線か、外れ値が直線評価を崩している)可能性が高い。逆にピアソンが 0.8 でスピアマンが 0.3 なら、少数の外れ値がピアソンの値を吊り上げている疑いがあります。

下のツールに、SEO記事の指標を模したサンプルデータ(文字数・滞在時間・被リンク数・検索順位)を読み込んであります。試しに「文字数」と「被リンク数」を選ぶと、ピアソンは約 0.21 と弱いのに、スピアマンは約 0.78 と強く出ます。これは被リンクが突出して多いバズ記事が1本(外れ値)混じってピアソンを押し下げているためで、順位に直すスピアマンはその影響を受けにくい――まさに本章で見た食い違いをその場で確認できます。3列以上あるので、全組み合わせの相関行列(ヒートマップ)も表示されます。

相関係数計算ツール
ツール単体ページで開く

2列以上の数値データを貼り付けると、ピアソン・スピアマンの相関係数と散布図、3列以上なら相関行列をその場で計算します(ブラウザ内で計算、サーバー送信なし)。

入力フォーマットの例を見る

Excel・Googleスプレッドシートで範囲をコピーしてそのまま貼り付け(タブ区切り)できるほか、CSV(カンマ区切り)・スペース区切りにも対応しています。1行目が見出しの場合は自動で判定します。日付や文字列など数値でないセルは自動的に除外されるので、きれいに整形してから貼り付ける必要はありません。

文字数,滞在時間,被リンク数
1800,95,6
2400,60,3
i
3つ目の選択肢
ケンドールのタウ(順位相関)も覚えておくと良い

順位相関にはスピアマンのほかにケンドールの順位相関係数(タウ)もあります。考え方は「すべてのペアを取り出し、順位の大小が一致するペアの数から一致しないペアの数を引き、総ペア数で割る」もので、スピアマンと同じく −1〜+1 の値をとります。スピアマンよりサンプルが小さいときや同順位(タイ)が多いときに安定するとされます。実務ではスピアマンとほぼ同じ用途で、結論が大きく変わることは多くありません。まずはピアソンとスピアマンの2つを押さえ、順位データを厳密に扱う場面でタウを思い出せれば十分です。

05.相関係数の3つの落とし穴|外れ値・非線形・範囲制限

相関係数は、何百何千ものデータ点をたった1つの数字に圧縮します。圧縮である以上、必ず情報が落ちます。落ちた情報のせいで誤読が生まれる典型が、次の3つです。

落とし穴1:外れ値が相関を作る・消す

ピアソン相関係数は外れ値に弱く、たった1点で値が大きく変わります。本当は無相関のデータでも、遠くにポツンと1点あるだけで相関が「ある」ように見えることがあります。逆に、きれいな相関があるデータに外れ値が1つ混じると、相関が「弱まった」ように見えることもあります。原因は、外れ値が平均から極端に離れているため、共分散の計算で他の全データを足し合わせたよりも大きな影響を持ってしまうことです。

落とし穴2:非線形な関係を見逃す

ピアソン相関係数は直線しか測れません。U字型や山型(逆U字)のように、途中で向きが変わる関係は、ピアソンでは r ≈ 0 と出ます。たとえば「メール配信頻度」と「エンゲージメント」は、少なすぎても多すぎても下がり、ほどよい頻度で最大になる山型の関係になりがちです。これをピアソンで測ると「無相関」と出て、本当は強い関係があるのに『関係なし』と切り捨ててしまいます。

落とし穴3:範囲制限(データの幅を狭めると相関が弱まる)

分析対象の範囲を狭めると、相関は実際より弱く見えます。これを範囲制限といいます。たとえば「広告予算」と「成果」の相関を見るとき、すでに予算を絞り込んだ少数のキャンペーンだけで計算すると、予算の幅が狭いため相関は小さく出ます。全予算帯を含めれば見えるはずの関係が、一部だけ切り出したことで隠れてしまうのです。「優良顧客だけ」「上位ページだけ」のようにフィルタした後のデータで相関を見るときは、この効果を必ず意識します。

落とし穴起きること対処
外れ値1点で相関が生まれる/消える散布図で確認。スピアマンも併用。外れ値の原因を調べる
非線形曲線・山型の関係が r≈0 になり見逃される散布図で形を確認。スピアマンや回帰で曲線を扱う
範囲制限一部だけ切り出すと相関が弱く出るフィルタ前後で比較。全範囲のデータでも確認する
見せかけの精度小数3桁の r を本物の精度と思い込むr は要約値。散布図とサンプル数と必ずセットで読む
!
数字だけ見ない
r = 0.78 のような数字は、散布図を見るまで信用しない

相関マトリクスやヒートマップは便利ですが、数字だけが並ぶため上の3つの落とし穴がすべて見えなくなります。「r = 0.78」という数字は、直線関係でも、外れ値1点が作った見せかけでも、曲線関係の一部でも、同じように 0.78 と表示されます。相関係数は散布図とセットで初めて意味を持つ要約値だと考えてください。次の章で、この「散布図を必ず見る」習慣がなぜ決定的なのかを、有名な数値例で確認します。

06.散布図を必ず見る|アンスコムの数値例

相関係数を計算したら必ず散布図を描く――この習慣の重要性を、これ以上ないほど鮮やかに示すのが、統計学者フランク・アンスコムが1973年に作ったアンスコムの数値例(Anscombe's quartet)です。これは4組のデータセットで、平均・分散・相関係数・回帰直線のすべてがほぼ一致します。数字の上では「同じデータ」に見えます。

図:4つのデータはすべてピアソン r ≈ 0.82。それでも形はまったく違う

統計学者アンスコムが作った有名な例(アンスコムの数値例)。4組のデータは平均・分散・相関係数・回帰直線がほぼ一致しますが、散布図を描くと別物だと一目で分かります。相関係数という1つの数字だけ見ると、②〜④はすべて見誤ります。

① 素直な直線関係

相関係数の通りに読んでよい

② 本当は曲線(放物線)

直線の指標 r では形を捉えられない

③ 1点の外れ値が相関を崩す

外れ値を除くと r はほぼ 1.0 に戻る

④ 1点の外れ値だけで相関が決まる

その1点が無ければ相関は計算すらできない

オレンジの破線はどのデータでもほぼ同じ回帰直線です。①だけが「相関係数 0.82」を素直に信じてよいデータで、②は非線形、③は外れ値が本来の強い相関を崩し、④は外れ値1点だけで相関が決まっています。相関係数を計算したら、まず散布図を描く――これが相関分析の鉄則です。

ところが散布図を描くと、4組はまったくの別物だと一目で分かります。

  • ①だけが、相関係数 0.82 を素直に信じてよい、ふつうの直線関係です。
  • ②はきれいな曲線(放物線)で、本当は完全な関係がありますが、直線の指標であるピアソンでは 0.82 としか出ません。
  • ③は直線上にほぼ全点が並んでいるのに、たった1点の外れ値が直線評価を崩し、r を 0.82 まで下げています。外れ値を除けば r はほぼ 1.0 です。
  • ④に至っては、x が1点を除いてすべて同じ値です。相関係数 0.82 は右上の1点だけで決まっており、その点が無ければ相関は計算すらできません。

アンスコムの数値例が突きつけるのは、相関係数という1つの数字は、データの形について驚くほど何も語らないという事実です。同じ「0.82」が、信頼してよい関係にも、見逃された曲線にも、外れ値が作った幻にも対応します。だから順序は逆ではいけません。先に散布図を見て形を把握し、その上で相関係数を要約として読む――これが相関分析の正しい手順です。

下のツールには①のデータを読み込んであります。②〜④は②・③・④のリンクからツール単体ページで開けます。どれも r ≈ 0.82・ほぼ同じ回帰直線が出るのに、散布図だけが別物であることをその場で確認できます。

単回帰分析ツール
ツール単体ページで開く

2列の数値データを貼り付けると、散布図と回帰直線・回帰式・相関係数・決定係数をその場で計算します(ブラウザ内で計算、サーバー送信なし)。

入力フォーマットの例を見る

Excel・Googleスプレッドシートで範囲をコピーしてそのまま貼り付け(タブ区切り)できるほか、CSV(カンマ区切り)・スペース区切りにも対応しています。1行目が見出しの場合は自動で判定します。日付や文字列など数値でないセルは自動的に除外されるので、きれいに整形してから貼り付ける必要はありません。

広告費,売上
10,182
12,210
15,250
i
現代版アンスコム
数字が同じでも形は自由――Datasaurus が示すこと

アンスコムの発展版にDatasaurus dozenという有名な例があります。平均・分散・相関係数をすべて同じに保ったまま、散布図が恐竜の形になったり、星形や円形になったりするデータ群です。要約統計量がいくら一致していても、分布の形はまったく自由に変えられる――つまり要約値だけ見て分布を想像してはいけないことを、視覚的に証明しています。BIツールで相関だけを大量に出す前に、まず散布図を描く理由がここにあります。

07.相関≠因果|交絡・擬似相関・逆因果

ここからが相関分析の最大の注意点です。仮に散布図もきれいで、外れ値もなく、強い相関 r = 0.85 が確かに存在したとします。それでもなお、「だから X が Y の原因だ」と結論することはできません。相関は「一緒に動く」という事実を示すだけで、「片方がもう片方を起こしている」という因果関係は、まったく別の証拠を必要とします。

「X と Y に相関がある」とき、その裏で起きていることには、少なくとも次の4つの可能性があります。

  1. X → Y:X が本当に Y の原因(私たちが期待している関係)。
  2. Y → X(逆因果):実は因果の向きが逆で、Y が X を起こしている。
  3. Z → X かつ Z → Y(交絡):第3の要因 Z が両方を動かしていて、X と Y の間に直接の因果はない。
  4. 偶然の一致:因果も共通要因もなく、たまたま似た動きをしただけ。

相関係数が教えてくれるのは「相関がある」という事実だけで、それが上のどれなのかは区別できません。因果を主張するには、残りの2・3・4の可能性を1つずつ潰す必要があります。

図:「相関があるのに因果ではない」3つの典型パターン

X と Y に相関が出たとき、「X が Y の原因」と結論する前に、この3つの可能性を必ず疑います。実線は実際の因果、破線は観測される見かけの相関です。

交絡(第3の要因)

ZXY見かけの相関

X と Y はどちらも Z が原因。X と Y の間に直接の因果はない。

例:気温(Z)が上がるとアイス売上(X)も水難事故(Y)も増える。

逆因果(向きが逆)

XY実際の因果(Y→X)X→Y と誤読される

X が Y を起こしているように見えて、実は Y が X を起こしている。

例:広告費が多い月は売上が高い→実は売上好調月に予算を増やしている。

偶然の一致

XYつながりなしたまたま似た動き

因果も共通要因もなく、たまたま同じように動いただけ。

例:無関係な2つの時系列が、長期トレンドのせいで似た動きに見える。

相関が出たときに「だから X をやれば Y が増える」と即断すると、効かない施策に投資したり、原因と結果を取り違えたりします。因果を主張したいなら、A/Bテスト(2パターン比較の実験)か、観察データなら交絡を調整する因果推論の手法が必要です。

交絡:いちばん多い誤読の原因

実務でもっとも頻繁に相関を因果と取り違えさせるのが交絡です。X と Y の両方に影響する第3の要因 Z が存在すると、X と Y は Z を通じて連動し、見かけ上の相関が生まれます。古典的な例が「アイスの売上」と「水難事故」の相関です。両者は確かに相関しますが、アイスが事故を起こすわけではありません。気温という共通要因が、夏に両方を押し上げているだけです。

マーケティングの現場でも交絡は至るところにあります。「メルマガを開封した人ほど継続率が高い」――しかし開封する人はもともと製品への関心が高い熱量の高い顧客かもしれません。その場合、メルマガ自体に継続効果がなくても相関は出ます。「熱量」という交絡要因を無視して「メルマガを送れば継続率が上がる」と結論すると、施策の効果を過大評価します。

逆因果:原因と結果が逆を向いている

因果の向きを取り違えるのが逆因果です。「広告費が多い月ほど売上が高い」というデータから「広告を増やせば売上が増える」と読みたくなりますが、実際には売上が好調な月ほど、来月の広告予算を増やしているのかもしれません。この場合、因果は「売上 → 広告費」で、データから読み取った向きとは逆です。「カスタマーサポートへの問い合わせが多い顧客ほど解約率が高い」も同様で、解約を考えている顧客ほど問い合わせる、という逆向きの可能性があります。

擬似相関と偶然の一致

交絡や逆因果のように説明のつく構造すらなく、まったくの偶然で相関が出ることもあります。とくに時系列データは危険です。長期的に増え続けている2つの指標(たとえば「スマホ普及率」と「ある病気の患者数」)は、互いに無関係でも、どちらも右肩上がりというだけで高い相関を示します。「年々増えているもの」どうしは、何でも相関してしまうのです。データ点が少なく、変数の候補が多いほど、こうした偶然の相関は拾われやすくなります。

!
相関から因果へ進むには
因果を言いたいなら、実験するか、交絡を調整する

相関を見つけた後で「X が Y の原因だ」と主張したいなら、方法は大きく2つです。1つは実験――対象をランダムに2群に分けて X だけを変えるA/Bテストなら、ランダム化によって交絡要因が両群で打ち消され、出た差を X の効果と見なせます。もう1つは、実験できない観察データに対して交絡要因を統計的に調整する方法です。差分の差分法や傾向スコアといった因果推論の手法がこれにあたります。相関分析は、こうした検証に進む前の入り口――「ここに関係がありそうだ」という仮説を見つける段階の道具だと位置づけてください。

08.実務での使い方|SEO・マーケのデータを例に

ここまでの内容を、よくある場面に当てはめてみます。SEO担当者が、自社サイトの数百ページについて「記事の文字数」と「検索順位」のデータを集め、相関を計算したとします。出た数字は r = −0.42 でした。検索順位は1位を最良とする順位数なので、この負の相関は「文字数が多い記事ほど順位の数値が小さい=上位にある」という意味です。「記事を長くすれば順位が上がる」――この結論には、本記事で見た落とし穴がほぼ全部詰まっています。順を追って点検します。

手順1:散布図を描いて形を確認する

まずアンスコムの教訓どおり、散布図を描きます。点検する観点は3つです。

  • 外れ値:極端に長い数本の記事が、見かけの相関を強めていないか。あれば除いて再計算します。
  • 非線形:ある文字数まではプラスに効き、長すぎると逆効果になる――途中で向きが変わる関係ではないか。そうならピアソンは関係を大きく過小評価します。
  • 範囲制限:そもそも上位表示されているページだけを集めていないか。順位の幅を狭く切り出すと、相関は弱く出ます。

手順2:順位データなのでスピアマンも見る

検索順位は「1位・2位・3位」という順序データで、1位と2位の差と、50位と51位の差が同じ価値とは限りません。こういうデータにはスピアマン相関係数が向いています。ピアソンとスピアマンの両方を出し、値が食い違えば散布図を見直すサインと考えます。

手順3:交絡を疑う――いちばん重要な点検

最大の問題は交絡です。文字数の多い記事は、たまたま網羅性が高く、検索意図に深く応えている記事である傾向があります。さらに、力を入れて長く書いた記事は内部リンクや被リンクも集まりやすい。つまり「コンテンツの質」や「リンク評価」という第3の要因が、文字数の多さと上位表示の両方をもたらしている可能性が高いのです。

読み取れる相関短絡的な結論疑うべき交絡・逆因果
文字数 × 検索順位(負)記事を長くすれば順位が上がるコンテンツの質・網羅性が、文字数と上位表示の両方をもたらす(交絡)
被リンク数 × 検索順位(負)リンクを増やせば順位が上がる良い記事だから順位が高く、結果リンクも集まる(逆因果の可能性)
滞在時間 × 検索順位(負)滞在時間を延ばせば順位が上がる上位表示で流入の質が変わり滞在時間が延びる(逆因果)

もし交絡が真相なら、内容の薄い記事をただ文字数だけ水増ししても順位は上がりません。むしろ冗長な記事は検索意図から外れ、評価を下げかねません。相関 r = −0.42 が教えてくれたのは「文字数と検索順位には関係がありそうだ」という仮説までで、「長くすれば上がる」という施策の根拠にはならないのです。

手順4:因果を確かめたいなら実験する

「記事を長くすると順位が上がるのか」を本当に知りたいなら、相関を眺めるのをやめて実験します。質の条件をそろえた記事群をランダムに2群に分け、片方だけ加筆して、数週間後の順位変化を比較します。ランダムに分けることで「もともとの質」のような交絡要因が両群で打ち消され、出た差を加筆の効果と見なせます。相関分析はどこを実験するかの当たりをつける段階の道具であり、施策の意思決定はその先の検証で行います。

C
相関分析の正しい立ち位置
相関は『仮説を見つける』道具、因果は『実験で確かめる』もの

相関分析の役割は、大量の指標の中から「ここに関係がありそうだ」という仮説の候補を素早く洗い出すことです。これは探索として非常に価値があります。一方で、相関はそのまま施策の根拠にはなりません。「相関が出た → だからこの施策をやる」と直結させると、交絡や逆因果のせいで効かない施策に投資します。正しい流れは「相関で仮説を見つける → 散布図と交絡で筋の良し悪しを吟味する → A/Bテストや因果推論で因果を確かめる → 確かめたものだけ施策にする」です。相関分析は、この一連の流れの出発点として使ってこそ力を発揮します。

相関分析で最低限おさえること
  • ✓ 相関係数を出したら、必ず散布図を描いて形を確認する
  • ✓ 外れ値・非線形・範囲制限の3つを散布図で点検する
  • ✓ 順位データや外れ値が気になる場合はスピアマンも併用する
  • ✓ ピアソンとスピアマンが食い違ったら散布図を見直すサイン
  • ✓ 相関が出ても「X→Y」と即断せず、逆因果・交絡・偶然を疑う
  • ✓ 因果を主張したいときはA/Bテストか因果推論の手法で確かめる

09.よくある質問(FAQ)

相関係数はどのくらいの値なら『相関がある』と言えますか?

よく「絶対値0.7以上で強い相関、0.4〜0.7で中程度、0.4未満で弱い」と言われますが、これは絶対の基準ではなく目安です。社会調査や行動データでは r=0.3 でも十分に意味のある関係とされる一方、精密な物理測定では r=0.9 でも弱いと見なされます。さらに、サンプルが大きければ実務的に無意味なほど弱い相関でも「統計的に有意」になります。数値の大小だけで機械的に判断せず、散布図の形、サンプル数、そして「その関係が実務的に意味を持つか」と合わせて読んでください。

ピアソンとスピアマン、どちらを使えばよいですか?

関係が直線的だと分かっていて、予測式などに使いたいならピアソン相関係数が向きます。一方、関係の形が分からない、外れ値が気になる、検索順位や5段階評価のような順序データを扱う、という場合はスピアマン相関係数が向きます。実務では両方を出しておくのが安全です。ピアソンが小さくスピアマンが大きければ「関係はあるが直線ではない(曲線か外れ値の影響)」、ピアソンが大きくスピアマンが小さければ「少数の外れ値がピアソンを吊り上げている」可能性が高く、どちらも散布図を見直すサインになります。

相関係数が0なら、2つの変数は無関係と言えますか?

いいえ、言えません。ピアソン相関係数が0に近いのは「直線的な関係がない」という意味であって、「どんな関係もない」という意味ではありません。U字型や山型(逆U字)のように途中で向きが変わる関係は、ピアソンでは r≈0 と出ます。たとえばメール配信頻度とエンゲージメントは、少なすぎても多すぎても下がる山型になりがちで、これをピアソンで測ると「無相関」と誤読します。相関係数が0でも、散布図を描けば明らかな関係が見えることがあります。だからこそ、相関係数は散布図とセットで読む必要があります。

「相関≠因果」と言いますが、相関は施策の判断に使えないのですか?

相関分析は施策判断の役に立ちます。ただし使いどころが決まっています。相関は、大量の指標の中から「ここに関係がありそうだ」という仮説の候補を素早く洗い出す探索の道具として非常に有用です。一方で、相関をそのまま施策の根拠にすると、交絡(共通の第3要因)や逆因果のせいで、効かない施策に投資したり原因と結果を取り違えたりします。正しい流れは「相関で仮説を見つける → 散布図と交絡で筋を吟味する → A/Bテストや因果推論で因果を確かめる → 確かめたものを施策にする」です。相関は出発点として使ってください。

AIにデータを渡せば相関分析と因果の判断は任せられますか?

相関係数やp値の計算、可視化コードの生成は AI(ChatGPT、Claude、Geminiなど)に任せられます。一方で、散布図を見て外れ値や非線形を判断する、ドメイン知識から交絡要因の候補を洗い出す、出た相関を因果と取り違えていないかを点検する、といった解釈の判断は人が担う領域です。AIは「AとBには相関があり、Aを増やすとBが増えます」のように、相関を因果のように説明してしまうことがあります。AIの出力する相関の解釈はそのまま鵜呑みにせず、交絡や逆因果の可能性を人が検証する運用にしてください。

10.まとめ

相関分析は、2つの変数が一緒に動く傾向を −1〜+1 の相関係数に要約する手法です。直線関係を測るのがピアソン相関係数、順位に直して単調関係を測るのがスピアマン相関係数で、データが曲線的だったり外れ値があったり順位データだったりするときはスピアマンが向きます。両者の値が食い違ったら、それは散布図を見直すサインです。

実務で押さえる要点は、次の3つです。

  • 相関係数は1つの数字への圧縮です。外れ値・非線形・範囲制限で簡単に誤読されるため、アンスコムの数値例が示すとおり、必ず散布図を描いて形を確認します。
  • 相関は因果ではありません。強い相関が出ても、その裏には交絡・逆因果・偶然の一致が潜んでいて、相関係数だけではどれか区別できません。
  • 相関は仮説を見つける道具であって、施策の根拠ではありません。因果を主張したいなら、A/Bテストか因果推論の手法で確かめる必要があります。

この3点を守るだけで、「相関が出たから施策をやる」という、もっとよくあるデータ分析の事故を大きく減らせます。

お問い合わせ

データ分析と効果検証の体制づくりをご相談ください

相関の発見から、交絡を踏まえた因果の検証、A/Bテスト設計まで、データを施策の意思決定につなげる分析の伴走支援を行っています。お気軽にお問い合わせください。

お問い合わせはこちら

データ分析・アルゴリズム 基礎知識集

一覧に戻る →
07

モデル構築の自動化

この記事をシェア
澤田 翔太(Shota Sawada)
この記事を書いた人

澤田 翔太

株式会社クリプタル 代表取締役

1988年生まれ、慶應義塾大学卒。創業メンバーとして関わった株式会社セールスサポートを株式会社ネオマーケティング(東証STD 4196)に売却。株式会社クリプタルでも複数の事業立ち上げと売却を経験し、2022年9月には婚活・恋愛メディア「シッテク」「婚活会議」を株式会社ベビーカレンダー(東証GRT 7363)へ売却。現在はAI業務支援事業、TANTOU事業、グロースハック支援事業、メディア事業、SEOコンサルティング事業を手がける。