過去問ドリル

DP-900:Microsoft Azure Data Fundamentals データの中核的な概念 問2

データの中核的な概念/データの表現方法

ある企業は、コールセンターの通話内容を録音した音声ファイルを大量に蓄積しており、将来的に音声認識サービスで文字起こしして分析に利用する計画を立てている。録音ファイルは行と列やキーと値のような定義された構造を持たず、そのままではファイル全体を単位としてしか扱えない。このデータの分類として最も適切なものはどれか。

当サイトのオリジナル問題(DP-900:Microsoft Azure Data Fundamentalsの出題範囲「データの中核的な概念」に対応。実際の試験問題ではありません)

正解:D

解説

非構造化データとは、音声・画像・動画・バイナリファイルのように、あらかじめ定義された構造(スキーマ)を持たないデータを指します。構造化データのように行と列で表現したり、半構造化データのようにキーと値で部分的に構造を表したりすることができないため、そのままでは検索や集計がしにくく、多くの場合はファイル単位で保存し、必要に応じて別の処理(音声認識や画像認識など)でメタデータや構造化された情報を抽出してから分析に利用します。

選択肢ごとの解説

  • A誤り。構造化データは行と列の表形式でスキーマに従うデータです。音声ファイルのように内部に定義された構造を持たないデータには当てはまりません。
  • B誤り。半構造化データはJSONのキーと値のように部分的な構造を持ちますが、音声ファイル自体にはそのような構造化された要素がありません。
  • C誤り。リレーショナルデータは構造化データの一種で、テーブル同士を主キー・外部キーで関連付けたものです。音声ファイルの説明には当てはまりません。
  • D正しい。音声・画像・動画ファイルのように行と列やキーと値などの定義された構造を持たないデータは非構造化データに分類されます。ファイル全体を一つの単位として扱うのが一般的です。
DP-900:Microsoft Azure Data Fundamentalsの問題を演習モードで解く