DP-900:Microsoft Azure Data Fundamentals データの中核的な概念 問2
データの中核的な概念/データの表現方法ある企業は、コールセンターの通話内容を録音した音声ファイルを大量に蓄積しており、将来的に音声認識サービスで文字起こしして分析に利用する計画を立てている。録音ファイルは行と列やキーと値のような定義された構造を持たず、そのままではファイル全体を単位としてしか扱えない。このデータの分類として最も適切なものはどれか。
当サイトのオリジナル問題(DP-900:Microsoft Azure Data Fundamentalsの出題範囲「データの中核的な概念」に対応。実際の試験問題ではありません)
- A構造化データ
- B半構造化データ
- Cリレーショナルデータ
- D非構造化データ
正解:D
解説
非構造化データとは、音声・画像・動画・バイナリファイルのように、あらかじめ定義された構造(スキーマ)を持たないデータを指します。構造化データのように行と列で表現したり、半構造化データのようにキーと値で部分的に構造を表したりすることができないため、そのままでは検索や集計がしにくく、多くの場合はファイル単位で保存し、必要に応じて別の処理(音声認識や画像認識など)でメタデータや構造化された情報を抽出してから分析に利用します。
選択肢ごとの解説
- A誤り。構造化データは行と列の表形式でスキーマに従うデータです。音声ファイルのように内部に定義された構造を持たないデータには当てはまりません。
- B誤り。半構造化データはJSONのキーと値のように部分的な構造を持ちますが、音声ファイル自体にはそのような構造化された要素がありません。
- C誤り。リレーショナルデータは構造化データの一種で、テーブル同士を主キー・外部キーで関連付けたものです。音声ファイルの説明には当てはまりません。
- D正しい。音声・画像・動画ファイルのように行と列やキーと値などの定義された構造を持たないデータは非構造化データに分類されます。ファイル全体を一つの単位として扱うのが一般的です。