この章で学ぶこと
第1〜2章では、データを扱う体制(ガバナンス)と中身の正しさ(品質・メタデータ)という「守り」の側面を学びました。この章からは、実際にデータを蓄積し分析に使う「攻め」の側面に入ります。データを貯めるデータ基盤の種類、分析を支えるツール、そして分析対象になるデータの多様な種類を整理します。第4章の統計手法を学ぶ前段として、「どんなデータを、どこに、どう置いておくか」という土台を押さえる章です。
データ基盤の役割と構造
データ基盤が担う役割は、データを集めて貯めるデータ蓄積、使いやすい形に整えるデータ加工、傾向や関係性を見出すデータ分析、その結果を業務に使うデータ活用の4段階です。第1章のデータライフサイクル(生成・保管・処理・活用・廃棄)と対応させると理解しやすくなります。
貯め方には目的に応じて複数の選択肢があります。あらゆる形式の生データをそのまま蓄積するデータレイク、あらかじめ形式を整えたデータを目的別に構造化して蓄積するデータウェアハウス(DWH)、DWHの中からさらに特定の部門・用途向けにデータを切り出したデータマートという3層で覚えるのが基本です。「レイクは何でも入る貯水池、DWHは整理された倉庫、データマートは部署ごとの棚」というイメージで捉えると違いが定着します。
データを移動・加工する処理方式には、抽出(Extract)→変換(Transform)→格納(Load)の順で処理するETLと、先に格納してから変換するELTがあります。データレイクのように大容量の生データをまず貯めてから加工する場合はELT、DWHのように整形してから格納する場合はETLが向いています。データを物理的に移動させずに、あたかも1つのデータソースであるかのように横断的にアクセスできるようにするデータ仮想化、異なるシステム間でデータを連携させる接続部品であるデータコネクタ、これらを組み合わせて組織全体に分散するデータを統合的に扱えるようにする仕組みであるデータファブリックもあわせて押さえます。
扱う用語(精選・8語)
- データ基盤の役割(データ蓄積・データ加工・データ分析・データ活用)
- データレイク/データウェアハウス(DWH)/データマート
- ELT/ETL
- データ仮想化/データコネクタ/データファブリック
分析・活用ツール
蓄積したデータを実際に見て分析するための代表的なツールがBIツール(Business Intelligence Tool)です。データを可視化し、経営層や現場担当者がグラフやダッシュボードで状況を把握できるようにします。
用語や概念の意味・関係性を体系的に定義したものをオントロジー、業務用語とデータ項目を対応づけて、専門知識がなくても分析ツール上で業務用語のまま扱えるようにする中間層をセマンティックレイヤーと呼びます。専門のデータ部門に依頼せず、現場担当者自身がBIツールなどを使って分析を行う進め方がセルフサービス分析です。第1章で学んだデータマネジメントの組織構造(分散型・連邦型)が進むほど、このセルフサービス分析の重要性が増します。
複数のデータソースを組み合わせて1つの分析用データセットを作る作業をデータブレンディング、分析しやすい形にデータを整形・加工する作業全般をデータプレパレーションと呼びます。データプレパレーションは第2章のデータクレンジングと重なる部分もありますが、クレンジングが「品質を直す」目的であるのに対し、プレパレーションは「分析用に形を整える」目的である点で使い分けます。
扱う用語(精選・6語)
- BIツール
- オントロジー/セマンティックレイヤー
- セルフサービス分析
- データブレンディング/データプレパレーション
データの種類と性質
分析対象になるデータは、集め方や性質によっていくつもの軸で分類できます。まず収集目的による分類として、アンケートなど能動的に集める調査データ、条件を制御して得る実験データ、Webサイトの閲覧履歴などの人の行動ログデータ、センサーなどが記録する機械の稼働ログデータ、SNS上の投稿などのソーシャルメディアデータ、位置情報や地理情報を含むGISデータがあります。
データの性質による分類としては、数値で表せる量的データと、数値化しにくい性質を表す質的データ、自らが直接収集した1次データと他者が収集したものを利用する2次データ、あらかじめ形式が決まっている構造化データと形式が決まっていない非構造化データ、時間の経過に沿って記録される時系列データ、従来のツールでは処理しきれない量・速度・多様性を持つビッグデータ、誰でも自由に利用できるよう公開されたオープンデータ、個人を特定しうる情報を含むパーソナルデータがあります。試験では「量的/質的」「1次/2次」「構造化/非構造化」のような対になる分類の組み合わせがよく問われるため、対で覚えておくと効率的です。
扱う用語(精選・16語)
- 調査データ/実験データ/人の行動ログデータ/機械の稼働ログデータ/ソーシャルメディアデータ/GISデータ
- 量的データ/質的データ
- 1次データ/2次データ
- 構造化データ/非構造化データ
- 時系列データ/ビッグデータ/オープンデータ/パーソナルデータ
データの収集・加工手法
データを実際に集める方法には、Web上の情報を自動的に巡回して収集するクローリング、一定期間分をまとめて処理するバッチ方式、対象に定期的に問い合わせて変化を確認するポーリングなど複数のデータの収集方法があります。取得後は、複数のデータソースをキーとなる項目でつなぎ合わせるデータ結合、単位や表記形式をそろえる標準化(第2章の表記ゆれ修正と関連)、データに正解ラベルや分類タグを付与するアノテーション(機械学習の教師データ作成で重要)、Webページから特定の情報を自動的に抽出するスクレイピング(クローリングが「巡回して集める」のに対し、スクレイピングは「該当ページから必要な情報だけ抜き出す」工程という違いがあります)が代表的な加工手法です。
扱う用語(精選・5語)
- データの収集方法(クローリング・バッチ・ポーリング)
- データ結合/標準化/アノテーション/スクレイピング
仕組みを理解する: クローリングとスクレイピングはなぜセットで語られるのか
Webからデータを集める場面では、「クローリング」と「スクレイピング」が混同されがちですが、役割が異なります。クローリングは、リンクをたどって多数のWebページを自動的に巡回し、ページの存在そのものを収集する工程です。検索エンジンがWeb全体を把握するために行う処理が代表例です。
一方スクレイピングは、すでに特定されたページの中から、価格や見出しといった必要な情報だけを抽出・構造化する工程です。つまり、クローリングで「どこに情報があるか」を見つけ、スクレイピングで「そこから何を取り出すか」を実行する、という前後関係にあります。実務では2つを組み合わせて使うため、試験でもセットで問われやすい用語です。
データマイニングとデータ活用の応用
蓄積・整形したデータから実際に価値を引き出す応用技術を扱います。時系列データの短期的なブレをならして傾向をつかむ移動平均は、最も基本的な分析手法の1つです。大量のデータから統計的手法やアルゴリズムを用いて、人手では気づきにくい規則性やパターンを発見するデータマイニング、その対象を文章データに絞ったテキストマイニング(アンケートの自由記述やSNS投稿の分析などに利用)を押さえます。
データマイニングの代表的な指標が、ある商品を買った人が別の商品も買う確率が、全体の購買確率と比べてどれだけ高いかを示すリフト値です(「おむつを買う人はビールも買う」という有名なバスケット分析の例で使われる指標です)。近年は機械学習を用いたデータ分析によって、人手では扱いきれない規模・複雑さのパターン発見が可能になっています。こうした分析結果を実際のマーケティング施策に反映する進め方をデータドリブンマーケティングと呼びます。
扱う用語(精選・6語)
- 移動平均
- データマイニング/テキストマイニング
- リフト値
- 機械学習を用いたデータ分析
- データドリブンマーケティング
AIで学ぶ
ここまでの用語は、ChatGPTやClaudeなどの生成AIに以下のプロンプトを投げかけると、比較表つきでさらに深く掘り下げて学習できます。コピーして使ってみましょう。
あなたはデータマネジメント試験の講師です。「データ基盤とデータ活用の仕組み」の範囲について、以下の用語を初学者向けに**関連づけながら**説明してください(単体の丸暗記より、用語同士のつながりを理解したほうが記憶に定着しやすく、試験本番で紛らわしい選択肢を見分ける力もつくためです)。用語同士の違いが分かる**比較表**を最後に付けてください。
【データ基盤の役割と構造】データ基盤の役割(蓄積・加工・分析・活用)、データレイク、データウェアハウス(DWH)、データマート、ETL、ELT、データ仮想化、データコネクタ、データファブリック
【分析・活用ツール】BIツール、オントロジー、セマンティックレイヤー、セルフサービス分析、データブレンディング、データプレパレーション
【データの種類】調査データ、実験データ、行動ログデータ、稼働ログデータ、ソーシャルメディアデータ、GISデータ、量的データ、質的データ、1次データ、2次データ、構造化データ、非構造化データ、時系列データ、ビッグデータ、オープンデータ、パーソナルデータ
【収集・加工手法】クローリング、バッチ、ポーリング、データ結合、標準化、アノテーション、スクレイピング
【分析の応用】移動平均、データマイニング、テキストマイニング、リフト値、機械学習を用いたデータ分析、データドリブンマーケティングこの章は他の章より用語数が多く分類軸も複雑なため、AIに「比較表」だけでなく「対になる用語をペアで示して」と追加指定すると、量的/質的・1次/2次・構造化/非構造化といった対比構造が整理されて頭に入りやすくなります。
章末チェック
最後に、この章で学んだ知識をアウトプットして定着させましょう。全問に答えたら「答え合わせ」を押してください。
問1. あらゆる形式の生データをそのまま蓄積する仕組みと、あらかじめ形式を整えたデータを目的別に構造化して蓄積する仕組みの組み合わせとして正しいものはどれか。
問2. 抽出(Extract)・変換(Transform)・格納(Load)のうち、変換より先に格納を行う処理方式はどれか。
問3. 自らが直接収集したデータと、他者が収集したものを利用するデータの組み合わせとして正しいものはどれか。
問4. リンクをたどって多数のWebページを自動的に巡回し、ページの存在そのものを収集する工程と、特定されたページから必要な情報だけを抽出する工程の組み合わせとして正しいものはどれか。
問5. ある商品を買った人が別の商品も買う確率が、全体の購買確率と比べてどれだけ高いかを示すデータマイニングの指標はどれか。
この章のまとめ
この章では、データレイク・DWH・データマートという貯め方の違い、BIツールやセマンティックレイヤーといった活用ツール、量的/質的・構造化/非構造化などデータの分類軸、そしてデータマイニングによる価値の引き出し方を学びました。「データをどこに置き、どう活かすか」という土台が整ったところで、次章はいよいよ数値そのものを扱います。
次章では、確率分布・標準偏差・相関分析・回帰分析・仮説検定といった統計手法を、実際に手を動かす計算例題つきで学びます。→ 第4章 統計手法とデータ分析