目安時間: 約210分 読了目安: 18分

この章で学ぶこと

ここまでの3つの章は、データを扱う体制・品質・基盤という「土台」でした。この章はコース唯一の計算例題つきの章です。用語や考え方を知っていても、実際の数式・算出でつまずくケースが多い分野のため、標準偏差・相関係数・回帰係数を最低1問ずつ、ステップバイステップで実際に計算します。同じ「ある店舗の5か月間の売上データ」を通して、代表値・ばらつき(標準偏差)→相関→回帰という流れで理解を積み上げるのが本章の構成です。電卓を片手に、実際に手を動かしながら読み進めてください。

確率・代表値・標準偏差の基礎

データ分析の土台になるのが確率の考え方です。起こりうる順序の総数を数える順列、順序を問わず組み合わせの総数を数える組合せ、それぞれの結果が起こる確率の分布を表す確率分布、自然現象や測定誤差など多くのデータが従う釣鐘型の分布である正規分布を押さえます。

データ全体の特徴を1つの値で表す指標が代表値で、平均値・中央値・最頻値が代表例です。そのうえで、データが代表値からどれだけばらついているかを表す指標が分散標準偏差です。分散はばらつきの二乗の平均、標準偏差は分散の平方根で、元のデータと同じ単位に戻したものと理解すると混同しません。

扱う用語(精選・4語)

  • 確率(順列・組合せ・確率分布・正規分布)
  • 代表値
  • 分散/標準偏差

深掘り: 平均・分散・確率・サンプリングの基礎とは?

計算例題1: 標準偏差を実際に求める

ある店舗の5か月間の月間売上(万円)が次のとおりだったとします。

120, 140, 180, 200, 260120,\ 140,\ 180,\ 200,\ 260

ステップ1: 平均値を求める

xˉ=120+140+180+200+2605=9005=180\bar{x} = \frac{120+140+180+200+260}{5} = \frac{900}{5} = 180

ステップ2: 各データの偏差(データ − 平均)を求める

60, 40, 0, 20, 80-60,\ -40,\ 0,\ 20,\ 80

ステップ3: 偏差を2乗して合計する

(60)2+(40)2+02+202+802=3600+1600+0+400+6400=12000(-60)^2+(-40)^2+0^2+20^2+80^2 = 3600+1600+0+400+6400 = 12000

ステップ4: 2乗和をデータ数で割って分散を求める

分散=120005=2400分散 = \frac{12000}{5} = 2400

ステップ5: 分散の平方根を取って標準偏差を求める

標準偏差=240048.99 (万円)標準偏差 = \sqrt{2400} \approx 48.99\ (万円)

平均180万円に対して標準偏差が約49万円というのは、月ごとの売上が平均から±49万円程度ばらついていることを意味します。この「平均だけでなくばらつきも見る」視点が、次の相関分析につながります。

相関分析と回帰分析

2つの変数がどれだけ連動して動くかを調べる手法が相関分析です。連動の強さを−1〜+1の数値で表す相関係数を使い、値が1に近いほど強い正の相関、−1に近いほど強い負の相関、0に近いほど無相関と判断します。ここで注意すべきなのが相関と因果の違いです。2つの変数が同時に変化する(相関がある)ことは、一方がもう一方の原因になっている(因果がある)ことを意味しません。第三の要因が両方に影響している場合(見せかけの相関)もあるため、相関が見つかっても因果関係があると即断しないことが重要です。

相関が「関係の強さ」を測るのに対し、その関係を数式として表し、一方の値からもう一方の値を予測できるようにする手法が回帰分析です。最も基本的な単回帰分析では、y=ax+by = ax + b という直線の式(aa: 回帰係数、bb: 切片)でデータの関係を近似します。

扱う用語(精選・3語)

  • 相関分析/相関と因果
  • 回帰分析

深掘り: QC七つ道具・ABC分析・特性要因図・散布図とは?

計算例題2: 相関係数と回帰係数を実際に求める

先ほどの店舗の売上データに、対応する月の広告費(万円)を加えます。

12345
広告費 xx(万円)1020304050
売上 yy(万円)120140180200260

広告費を増やすと売上は伸びているように見えますが、実際にどれだけ強い関係があるのか、相関係数と回帰係数で確かめます。

ステップ1: それぞれの平均を求める

xˉ=10+20+30+40+505=30,yˉ=120+140+180+200+2605=180\bar{x} = \frac{10+20+30+40+50}{5} = 30, \quad \bar{y} = \frac{120+140+180+200+260}{5} = 180

ステップ2: 偏差の積の合計(SxyS_{xy})を求める

広告費の偏差は 20,10,0,10,20-20, -10, 0, 10, 20、売上の偏差は 60,40,0,20,80-60, -40, 0, 20, 80 です(売上の偏差は計算例題1のステップ2と同じ値)。

Sxy=(20)(60)+(10)(40)+0×0+10×20+20×80=1200+400+0+200+1600=3400S_{xy} = (-20)(-60)+(-10)(-40)+0\times0+10\times20+20\times80 = 1200+400+0+200+1600 = 3400

ステップ3: それぞれの偏差の2乗和(SxxS_{xx}SyyS_{yy})を求める

Sxx=(20)2+(10)2+02+102+202=400+100+0+100+400=1000S_{xx} = (-20)^2+(-10)^2+0^2+10^2+20^2 = 400+100+0+100+400 = 1000 Syy=3600+1600+0+400+6400=12000 (計算例題1のステップ3と同じ)S_{yy} = 3600+1600+0+400+6400 = 12000\ \text{(計算例題1のステップ3と同じ)}

ステップ4: 相関係数 rr を求める

r=SxySxx×Syy=34001000×12000=340012,000,00034003464.10.98r = \frac{S_{xy}}{\sqrt{S_{xx}\times S_{yy}}} = \frac{3400}{\sqrt{1000\times12000}} = \frac{3400}{\sqrt{12{,}000{,}000}} \approx \frac{3400}{3464.1} \approx 0.98

相関係数が約0.98と1に非常に近いため、広告費と売上には強い正の相関があると判断できます。

ステップ5: 回帰係数(傾き)aa と切片 bb を求める

単回帰分析の回帰係数(傾き)は、SxyS_{xy}SxxS_{xx} で割ることで求められます。

a=SxySxx=34001000=3.4a = \frac{S_{xy}}{S_{xx}} = \frac{3400}{1000} = 3.4 b=yˉaxˉ=1803.4×30=180102=78b = \bar{y} - a\bar{x} = 180 - 3.4\times30 = 180-102 = 78

したがって回帰式は y=3.4x+78y = 3.4x + 78 となり、「広告費を1万円増やすごとに、売上はおよそ3.4万円増える」と読み取れます。ただし、これはあくまで相関に基づく予測式であり、広告費が売上増加の直接の原因であると証明するものではない点に注意してください(相関と因果の違いを思い出しましょう)。

推定と仮説検定

手元のデータ(標本)から、その背後にある全体(母集団)の性質を推し量る統計的手法が推定です。標本のデータから母集団の平均や比率を予測する場面で使われます。

「新しい施策に効果があるのか、それとも偶然のばらつきの範囲内なのか」を統計的に判断する手続きが仮説検定です。たとえば「広告費を増やしても売上に差はない」という仮説を立て、実際のデータがその仮説のもとでどれだけ起こりにくいかを確率的に評価し、仮説を棄却できるかどうかを判断します。第8章のケーススタディで「このデータの違いは意味のある差なのか、それともただのばらつきなのか」を判断する場面につながる考え方です。

扱う用語(精選・2語)

  • 推定
  • 仮説検定

統計的バイアスと認知バイアス

分析結果を誤って解釈させる要因として、データの偏りと人間の思考の偏りの2種類を区別して押さえます。データの集め方や扱い方に起因する統計的バイアスには、特定の性質を持つ対象ばかりを集めてしまう選択バイアス、質問の仕方や測定方法によってデータが歪む情報バイアス、本来の原因以外の要因が結果に影響してしまう交絡バイアスがあります。

一方、人間の判断そのものに起因する認知バイアスには、1つの良い(悪い)印象に引きずられて他の評価まで歪めてしまうハロー効果、自分の考えを支持する情報ばかりを集めてしまう確証バイアスなどがあります。計算例題2で見た「広告費と売上の相関」も、確証バイアスにとらわれると「広告が効いているはずだ」という結論ありきでデータを見てしまう危険があります。分析結果を報告する際は、どちらのバイアスも意識して、データそのものと自分の解釈を切り分けることが重要です。

扱う用語(精選・2語)

  • 統計的バイアス(選択バイアス・情報バイアス・交絡バイアス)
  • 認知バイアス(ハロー効果・確証バイアス)

データ可視化のツール

分析結果を伝える・理解するための可視化手法を押さえます。データのばらつきと外れ値を1つの図で表す箱ひげ図、数値の大小を色の濃淡で表すヒートマップ、複数の評価軸を放射状に表示するレーダーチャート、2つの項目を行と列に配置して件数や集計値を示すクロス集計表、地理情報を扱う際に使われるデータ形式であるシェープファイルを押さえます。

度数(データの個数)の分布を棒グラフで表すヒストグラム、項目を件数の多い順に並べた棒グラフと累積比率の折れ線を組み合わせたパレート図(「全体の大部分は一部の要因から生じる」という考え方の可視化)、2つの変数の関係を点の集まりで表す散布図(計算例題2の広告費と売上の関係を目で見て確認するときに使う図)を押さえます。データを似た性質のグループに自動的に分ける分析手法であるクラスタ分析法も、可視化と組み合わせてよく使われます。

扱う用語(精選・9語)

  • 箱ひげ図/ヒートマップ/レーダーチャート/クロス集計表/シェープファイル
  • ヒストグラム/パレート図/散布図
  • クラスタ分析法

分析・企画の思考法

分析結果を意思決定や企画に活かすための思考の枠組みも押さえます。分析結果をストーリーとして伝え、相手の納得や行動につなげるデータストーリーテリング、原因や課題を階層的に分解して整理するロジックツリー、概念同士の関係性を図にして整理するコンセプトマップを押さえます。

限られた資源(人員・予算・時間など)を制約条件のもとで最適に配分する数理的な手法が線形計画法、将来の需要を過去のデータから予測する需要予測(回帰分析が使われる代表的な応用場面)です。自由な発想でアイデアを出し合うブレーンストーミング、現実の事象を数式や図で単純化して表現するモデル化も、分析の企画段階で使われる基本的な手法として押さえておきます。

扱う用語(精選・6語)

  • データストーリーテリング/ロジックツリー/コンセプトマップ
  • 線形計画法/需要予測
  • ブレーンストーミング/モデル化

AIで学ぶ

計算問題は、生成AIに解き方を検算させたり、別の数値パターンで練習問題を作らせたりするのに向いています。以下のプロンプトを使ってみましょう。

あなたはデータマネジメント試験の講師です。標準偏差・相関係数・回帰係数の計算方法を復習しています。この章の例題(売上データ:120, 140, 180, 200, 260万円、広告費データ:10, 20, 30, 40, 50万円)とは**異なる数値**で、同じ形式の練習問題を1問作ってください。

出力形式:
1. データ(表形式)
2. 標準偏差の計算をステップバイステップで
3. 相関係数の計算をステップバイステップで
4. 回帰係数・切片の計算をステップバイステップで
5. 最後に、相関係数の値から「相関の強さ」をどう解釈すべきかコメントしてください

このプロンプトのポイントは、「本文の例題と同じ形式で、数値だけ変えた練習問題」を要求していることです。計算手順そのものはAIに教えてもらうのではなく、本文で理解した手順を「別の数字で本当に再現できるか」を確認する使い方をすると、計算力が定着しやすくなります。

章末チェック

最後に、この章で学んだ知識をアウトプットして定着させましょう。全問に答えたら「答え合わせ」を押してください。

問1. あるデータの分散が36であるとき、標準偏差として正しいものはどれか。

問2. 2つの変数が同時に変化する関係が見られたとしても、一方がもう一方の原因であるとは限らないという考え方を表す組み合わせはどれか。

問3. 単回帰分析における回帰式 $y = ax + b$ について、$a$ が表すものはどれか。

問4. 1つの良い(悪い)印象に引きずられて、他の評価まで歪めてしまう認知バイアスはどれか。

問5. 項目を件数の多い順に並べた棒グラフと、累積比率の折れ線を組み合わせた図はどれか。

この章のまとめ

この章では、標準偏差・相関係数・回帰係数を実際の数値でステップバイステップに計算しました。「平均だけでなくばらつきも見る」(標準偏差)、「関係の強さを数値化する」(相関係数)、「関係を数式にして予測に使う」(回帰係数)、そして「相関があっても因果があるとは限らない」という注意点まで、実務でデータを扱う上で欠かせない視点です。

次章では、統計という「数字を読む力」から離れ、シラバスで新しく重視されているAI利活用と、それに伴うデータ・AI倫理を学びます。→ 第5章 AI利活用とデータ・AI倫理