過去問ドリル

DP-900:Microsoft Azure Data Fundamentals Azure の分析ワークロード 問2

Azure の分析ワークロード/大規模分析の要素

あるチームは、センサーのログ(CSV)、アプリケーションのイベント(JSON)、画像ファイルなど、形式も構造もさまざまな大量の生データを、分析方法を決める前の段階でとにかく低コストに保存しておきたいと考えています。データ取り込み時にスキーマを厳密に定義する必要はなく、ACID トランザクションやテーブル管理機能も現時点では不要です。保存先として最も適切なものはどれか。

当サイトのオリジナル問題(DP-900:Microsoft Azure Data Fundamentalsの出題範囲「Azure の分析ワークロード」に対応。実際の試験問題ではありません)

正解:B

解説

正解はデータレイクです。データレイクはファイル形式を問わずあらゆる構造化・半構造化・非構造化データを低コストで大量に保存できるストレージで、取り込み時にスキーマを固定しないスキーマオンリードの考え方を取ります。データウェアハウスは分析用にあらかじめ整形・構造化したデータをスキーマオンライトで格納する仕組みで、生データをそのまま保管する用途には向きません。レイクハウスはデータレイクの上にテーブル管理や ACID トランザクションといったデータウェアハウス的な管理機能を追加した構成であり、今回のように追加の管理機能が不要な段階では過剰な選択です。

選択肢ごとの解説

  • A誤り。データウェアハウスはあらかじめ構造化・整形したデータをスキーマオンライトで格納する仕組みで、多様な形式の生データをそのまま低コストに保存する用途には適していません。
  • B正しい。データレイクはスキーマオンリードの考え方で、形式を問わない大量の生データを低コストに保存できます。
  • C誤り。レイクハウスはデータレイクに ACID トランザクションやテーブル管理などの機能を付加した構成で、そうした管理機能が不要な今回の要件には過剰です。
  • D誤り。OLTP 向けのリレーショナルデータベースはトランザクション処理用に最適化されており、大量の多様な生データをそのまま保存する用途には向きません。
DP-900:Microsoft Azure Data Fundamentalsの問題を演習モードで解く