この章で学ぶこと
前章では「誰が何に責任を持つか」というデータガバナンスの体制を学びました。この章では、その体制を使って実際に何を管理するのか——データ品質とメタデータという2つの中身に踏み込みます。データ品質は「データそのものの正しさ」、メタデータは「データについてのデータ」であり、この2つを区別して理解することが本章のゴールです。前章と同じく中分類8の続きに位置し、既存の学習コンテンツがない完全新規領域のため、コース本文がそのまま唯一の解説になります。
データ品質の基本概念
データ品質とは、データが業務目的にどれだけ適合しているかを表す度合いです。「間違っていないか」だけでなく「業務で使える状態か」まで含む点が、単なる「正確さ」との違いです。この品質を評価する物差しがデータ品質特性で、事実と一致しているかを表す正確性、必要な項目が欠けていないかを表す完全性、複数のシステム間でデータが矛盾していないかを表す一貫性、出所や作成経緯が信頼できるかを表す信憑性、アクセス権限が適切に制御されているかを表す機密性などが代表例です。
これらの特性を実際にどれだけ満たしているかを数値で表す指標がデータ品質測定量(例: 欠損率、重複率)、品質特性・測定量・評価基準を体系的にまとめた枠組みがデータ品質モデルです。また、測定した数値が意味を持つかどうかを判断する視点として、実際に測定できるかを表す測定可能性、業務上どれだけ重要かを表す業務関連性、現場が測定結果を受け入れられるかを表す受容性、問題が見つかったときに改善できるかを表す制御可能性というデータ品質の測定尺度の意味も押さえておきます。「測っても直せない指標」を追いかけても意味がない、という実務上の視点です。
扱う用語(精選・9語)
- データ品質
- データ品質特性(正確性・完全性・一貫性・信憑性・機密性)
- データ品質測定量/データ品質モデル
- データ品質の測定尺度の意味(測定可能性・業務関連性・受容性・制御可能性)
データクレンジングとデータプロファイリング
データ品質を実際に高める代表的な作業がデータクレンジングです。値が入っていない欠損値の補完・除外、他の値から大きく外れた外れ値の修正・削除、明らかに誤りと分かる異常値の修正・削除、同じデータが複数存在する重複の排除、「株式会社」と「(株)」のような表記のゆれをそろえる表記ゆれの修正など、目的に応じた作業を組み合わせます。外れ値と異常値はどちらも「他と違う値」ですが、外れ値は統計的に珍しいだけで正しい可能性がある値、異常値は入力ミスなど明らかに誤りと判断できる値、という区別で捉えると混同しにくくなります。
クレンジングを闇雲に行うのではなく、まずデータの現状を把握する作業がデータプロファイリングです。値の分布・欠損率・重複率などを調査し、どこにどんな品質問題があるかを可視化します。プロファイリングの結果をもとに、実際の品質を評価する活動がデータアセスメントです。「まず現状を調べる(プロファイリング)→評価する(アセスメント)→直す(クレンジング)」という順序で理解すると、実務の流れがつかみやすくなります。
扱う用語(精選・6語)
- データクレンジングの目的と効果(欠損値・外れ値・異常値・重複・表記ゆれ)
- データプロファイリング/データアセスメント
データ品質マネジメントのサイクル
データ品質は一度整えて終わりではなく、継続的に維持・改善する活動として管理します。これがデータ品質マネジメントで、品質目標や基準を定めるデータ品質計画、その基準どおりにデータが保たれているか監視・是正するデータ品質制御、品質が基準を満たしていることを確認・証明するデータ品質保証、問題を継続的に直していくデータ品質改善という4つの活動で構成されます。品質を「計画し」「制御し」「保証し」「改善する」という流れは、PDCAサイクル(Plan-Do-Check-Act)に近い考え方だと捉えると覚えやすくなります。
問題が起きてから直すよりも、そもそも品質が低下しないよう防ぐ視点も重要です。入力段階で誤ったデータを弾くデータ入力チェックと、あらかじめ守るべき基準を明文化して適用するデータ品質ルールの定義及び適用(前章のデータ品質ルールと対応)が、このデータ品質低下の予防措置にあたります。「クレンジングで直す」のは事後対応、「予防措置」は事前対応という対比で整理しておきましょう。
扱う用語(精選・5語)
- データ品質マネジメント(計画・制御・保証・改善)
- データ品質低下の予防措置(データ入力チェック・データ品質ルールの定義及び適用)
仕組みを理解する: なぜデータ品質管理は「一度きり」で終わらないのか
データクレンジングで一度きれいにしたデータも、時間が経てば再び品質が下がります。新しい入力ミスが発生し、システム連携のたびに表記ゆれが生まれ、組織変更でマスターデータの前提が変わるためです。だからこそデータ品質マネジメントは、計画→制御→保証→改善というサイクルとして設計されています。
このサイクルを、前章で学んだデータガバナンスの基本行動(評価・方針又は指示・監視)と重ねて見ると、両者の関係がはっきりします。データ品質計画・改善は「方針又は指示」を、データ品質制御・保証は「評価」と「監視」を、それぞれ具体化したものです。つまり第2章のデータ品質マネジメントは、第1章で学んだガバナンスの基本行動を、品質という具体的な対象に適用した実践編にあたります。「なぜ同じような言葉が章をまたいで出てくるのか」と感じたら、この階層関係を思い出してください。
メタデータの3分類と管理基盤
メタデータとは「データについてのデータ」——データそのものではなく、データの意味・構造・履歴などを説明する情報です。シラバスでは3種類に分類されます。データの意味や業務ルールを説明するビジネスメタデータ(例: 「顧客ID」とは何を指すか)、データ型やテーブル構造など技術的な仕様を説明するテクニカルメタデータ(例: カラムのデータ型、桁数)、データがいつ・誰によってどう処理されたかを記録するオペレーショナルメタデータ(例: 更新日時、処理ログ)です。この3分類は、前章のデータマネジメント3機能(マネジメント・ガバナンス・アーキテクチャ)とは別の切り口で、「誰向けの情報か」(業務担当者向け・技術者向け・運用ログ)で分けていると捉えると整理しやすくなります。
これらのメタデータを保管・管理する仕組みも複数あります。メタデータの定義や標準を登録するメタデータレジストリ、実際のメタデータを一元的に蓄積するメタデータリポジトリ、データ項目の定義を一覧化したデータ辞書、業務用語とその定義を整理したビジネス用語集(ビジネスグロッサリー)、組織内のデータ資産を検索・閲覧できるようにしたデータカタログ、そしてデータがどこから来てどう加工され今の形になったかという来歴を追跡するデータリネージです。データ辞書が「個々の項目の意味」、ビジネス用語集が「業務用語の意味」、データカタログが「どこにどんなデータがあるか」、データリネージが「そのデータがどう作られたか」という役割分担で覚えると混同しにくくなります。
扱う用語(精選・9語)
- ビジネスメタデータ/テクニカルメタデータ/オペレーショナルメタデータ
- メタデータレジストリ/メタデータリポジトリ
- データ辞書/ビジネス用語集(ビジネスグロッサリー)/データカタログ/データリネージ
メタデータの運用体制
メタデータも、作って終わりではなく継続的な運用が必要です。前章で学んだDMO(データマネジメントオフィス)などの中央組織が中心となって運用ルールの整備を行い、そのルールに基づいて現場がメタデータの追加・更新を行います。日常的にはメタデータの収集及び管理、アクセス権限などを扱うセキュリティメタデータの管理、情報が古くならないようにするメタデータの登録及び最新情報への更新が実務の中心です。
メタデータそのものの品質を測るメタデータ品質の評価指標(例: 網羅率、更新頻度)もあわせて確認します。また、誰がメタデータの管理に責任を持つかというDMOなどによる責任者の任命に係る運用、データオーナー・データスチュワードをはじめとする利害関係者の役割・責任範囲の明確化も欠かせません。メタデータ管理は「一度作って放置すると誰も信用しなくなる」性質のものであり、前章の組織体制(CDO・DMO・データオーナー・データスチュワード)がそのまま責任の受け皿になる、という構図を意識しておくと理解が深まります。
扱う用語(精選・8語)
- DMOなどによる運用ルールの整備/運用ルールに基づいたメタデータの追加・更新
- メタデータの収集及び管理/セキュリティメタデータの管理/メタデータの登録及び最新情報への更新
- メタデータ品質の評価指標
- DMOなどによる責任者の任命に係る運用/利害関係者の役割・責任範囲
AIで学ぶ
ここまでの用語は、ChatGPTやClaudeなどの生成AIに以下のプロンプトを投げかけると、比較表つきでさらに深く掘り下げて学習できます。コピーして使ってみましょう。
あなたはデータマネジメント試験の講師です。「データ品質管理とメタデータ管理」の範囲について、以下の用語を初学者向けに**関連づけながら**説明してください(単体の丸暗記より、用語同士のつながりを理解したほうが記憶に定着しやすく、試験本番で紛らわしい選択肢を見分ける力もつくためです)。用語同士の違いが分かる**比較表**を最後に付けてください。
【データ品質の基本概念】データ品質、データ品質特性(正確性・完全性・一貫性・信憑性・機密性)、データ品質測定量、データ品質モデル、測定尺度の意味(測定可能性・業務関連性・受容性・制御可能性)
【クレンジングとプロファイリング】データクレンジング(欠損値・外れ値・異常値・重複・表記ゆれ)、データプロファイリング、データアセスメント
【品質マネジメントサイクル】データ品質マネジメント(計画・制御・保証・改善)、データ品質低下の予防措置(入力チェック・ルールの定義及び適用)
【メタデータの3分類】ビジネスメタデータ、テクニカルメタデータ、オペレーショナルメタデータ、メタデータレジストリ、メタデータリポジトリ、データ辞書、ビジネス用語集、データカタログ、データリネージ
【メタデータの運用体制】運用ルールの整備、メタデータの追加・更新、収集及び管理、セキュリティメタデータの管理、メタデータ品質の評価指標、責任者の任命、利害関係者の役割・責任範囲「データ品質」と「メタデータ」は似た文脈で登場しますが、前者は「データの中身の正しさ」、後者は「データを説明する情報」という別物です。このプロンプトのように用語をグループごとに分けて渡すと、AIも構造を理解した説明を返しやすくなります。特にメタデータの3分類(ビジネス・テクニカル・オペレーショナル)は「誰向けの情報か」という軸で比較表を作らせると違いが明確になります。
章末チェック
最後に、この章で学んだ知識をアウトプットして定着させましょう。全問に答えたら「答え合わせ」を押してください。
問1. データ品質特性のうち、複数のシステム間でデータが矛盾していないかを表す特性はどれか。
問2. 統計的に他の値から大きく外れているが誤りとは断定できない値と、入力ミスなど明らかに誤りと判断できる値の組み合わせとして正しいものはどれか。
問3. データ品質マネジメントを構成する4つの活動の組み合わせとして正しいものはどれか。
問4. メタデータの3分類のうち、データ型やテーブル構造など技術的な仕様を説明するものはどれか。
問5. 組織内のデータ資産を検索・閲覧できるように整理したものと、データがどこから来てどう加工され今の形になったかという来歴を追跡する仕組みの組み合わせとして正しいものはどれか。
この章のまとめ
この章では、データそのものの正しさを表す「データ品質」(品質特性・クレンジング・PDCA型のマネジメントサイクル)と、データを説明する情報である「メタデータ」(ビジネス・テクニカル・オペレーショナルの3分類と管理基盤)を学びました。前章の組織体制(CDO・DMO・データオーナー・データスチュワード)が、この2つの管理活動の責任の受け皿になっている点も確認しました。
次章では、ここまでのガバナンス・品質・メタデータという土台を離れ、実際にデータを蓄積・分析するためのデータ基盤と分析ツールを学びます。→ 第3章 データ基盤とデータ活用の仕組み