過去問ドリル

DP-900:Microsoft Azure Data Fundamentals データの中核的な概念 問1

データの中核的な概念/データの表現方法

ある企業は、IoTセンサーから送られてくる測定データを受信している。各デバイスのメーカーやファームウェアのバージョンによって送信される項目(キー)の数や種類が微妙に異なり、全デバイスで完全に共通のスキーマを事前に定義することが難しい。そのため各レコードをJSON形式のドキュメントとして保存し、ドキュメントごとに任意のキーを持たせられるようにしている。このようなデータの分類として最も適切なものはどれか。

当サイトのオリジナル問題(DP-900:Microsoft Azure Data Fundamentalsの出題範囲「データの中核的な概念」に対応。実際の試験問題ではありません)

正解:B

解説

半構造化データは、行と列から成る厳密な表形式のスキーマを持たないものの、JSONのキーと値やタグのような何らかの構造的な情報を内包するデータです。デバイスやバージョンによって項目が変動するIoTデータのように、事前にスキーマを固定しにくいケースに向いています。対して構造化データは全レコードが同一スキーマに従う表形式データ、非構造化データは音声・画像・動画のように構造を持たないデータを指します。

選択肢ごとの解説

  • A誤り。JSON形式で各レコードにキーと値の対応関係(部分的な構造)があるため、構造を一切持たない非構造化データとは言えません。
  • B正しい。JSONのように行と列の固定スキーマは持たないがキーと値などの何らかの構造を持つデータは半構造化データに分類されます。デバイスごとに項目が異なっても対応できる柔軟性が特徴です。
  • C誤り。構造化データは行と列から成る表形式で、事前に定義されたスキーマに全レコードが従う必要があります。デバイスごとに項目が異なる本件には当てはまりません。
  • D誤り。リレーショナルデータは構造化データの一種で、複数のテーブルを主キー・外部キーで関連付けたものです。スキーマが可変な本件の説明には使えません。
DP-900:Microsoft Azure Data Fundamentalsの問題を演習モードで解く