過去問ドリル

DP-900:Microsoft Azure Data Fundamentals データの中核的な概念 問3

データの中核的な概念/データストレージの選択肢

データエンジニアが、分析基盤に取り込む前段階として、数億行規模の売上履歴データをファイルとしてストレージに保存することになった。分析クエリでは特定の列(日付・地域・金額など)だけを繰り返し集計するため、必要な列だけを効率よく読み取れて圧縮率も高いファイル形式を選びたい。選ぶべきファイル形式として最も適切なものはどれか。

当サイトのオリジナル問題(DP-900:Microsoft Azure Data Fundamentalsの出題範囲「データの中核的な概念」に対応。実際の試験問題ではありません)

正解:A

解説

Parquetは列指向のファイル形式で、各列のデータをまとめて格納するため、分析クエリが必要とする列だけを選択的に読み取って処理を高速化でき、同じ種類の値がまとまることで圧縮率も高くなります。CSVやTSV、XMLのような行指向・テキストベースの形式は人が読みやすく交換用途には向きますが、大規模な分析ワークロードでの列選択の効率や圧縮率ではParquetに劣ります。

選択肢ごとの解説

  • A正しい。Parquetは列指向(カラムナ)のファイル形式で、クエリに必要な列だけを選択的に読み取れるため大規模な集計処理に適しており、圧縮率も高くなります。
  • B誤り。CSVは行指向のテキスト形式で、特定の列だけを選んで読み取る最適化がされておらず、Parquetに比べて圧縮率も低くなります。
  • C誤り。XMLはタグで要素を表す半構造化データの形式で、大規模な列指向の集計処理に最適化された形式ではありません。
  • D誤り。TSVのようなプレーンテキスト形式もCSVと同様に行単位の構造で、列だけを効率的に読み取る仕組みを持ちません。
DP-900:Microsoft Azure Data Fundamentalsの問題を演習モードで解く