DP-900:Microsoft Azure Data Fundamentals Azure の分析ワークロード 問8
Azure の分析ワークロード/大規模分析の要素データエンジニアリングチームは、オンプレミスで稼働していた Apache Spark のバッチジョブ(Python・Scala で記述)を Azure に移行しようとしている。移行後も Spark のバージョンやクラスターのワーカー数・インスタンスサイズを用途ごとに細かく指定し、既存のコードをノートブック上でほぼそのまま実行したいと考えている。この要件に最も適したサービスはどれか。
当サイトのオリジナル問題(DP-900:Microsoft Azure Data Fundamentalsの出題範囲「Azure の分析ワークロード」に対応。実際の試験問題ではありません)
- AAzure Data Factory のマッピングデータフロー
- BAzure Synapse Analytics のサーバーレス SQL プール
- CAzure Databricks
- DMicrosoft Fabric のデータフロー Gen2
正解:C
解説
正解は Azure Databricks です。Azure Databricks は Apache Spark をベースにした分析プラットフォームで、クラスターを作成する際に Spark のバージョンやワーカー数・インスタンスサイズを細かく指定でき、Python・Scala・R などで書かれた既存の Spark コードをノートブック上でほぼそのまま実行できます。Azure Data Factory のマッピングデータフローは GUI ベースの低コード変換機能であり、既存の Spark コードをそのまま持ち込んで実行する用途には向きません。Azure Synapse Analytics のサーバーレス SQL プールは Data Lake 上のファイルに T-SQL でクエリを実行する仕組みであり、Spark クラスターやノートブックでのコード実行は提供しません。Microsoft Fabric のデータフロー Gen2 は Power Query ベースの低コードなデータ準備機能であり、Spark クラスターの構成をジョブごとに細かく指定する用途には適していません。
選択肢ごとの解説
- A誤り。Azure Data Factory のマッピングデータフローは GUI ベースの低コード変換機能であり、既存の Spark コード(Python/Scala)をそのまま持ち込んで実行する用途には向きません。
- B誤り。Azure Synapse Analytics のサーバーレス SQL プールは Data Lake 上のファイルに T-SQL でクエリを実行する仕組みで、Spark クラスターやノートブックでのコード実行は提供しません。
- C正しい。Azure Databricks は Apache Spark ベースで、クラスターの Spark バージョンやワーカー数を細かく指定でき、既存の Spark コードをノートブックでほぼそのまま実行できます。
- D誤り。Microsoft Fabric のデータフロー Gen2 は Power Query ベースの低コードなデータ準備機能であり、Spark クラスターの構成をジョブごとに細かく指定する用途には適していません。