DP-900:Microsoft Azure Data Fundamentals Azure の分析ワークロード 問1
Azure の分析ワークロード/大規模分析の要素ある企業は、複数のオンプレミスの SQL Server データベースと、クラウド上の SaaS アプリケーションの双方から業務データを毎晩定期的に収集し、GUI ベースのデータフローで変換処理を定義したうえで、結果を Azure Data Lake Storage に格納する一連の処理をスケジュール実行で自動化したいと考えています。この要件を実現するために中心となるサービスはどれか。
当サイトのオリジナル問題(DP-900:Microsoft Azure Data Fundamentalsの出題範囲「Azure の分析ワークロード」に対応。実際の試験問題ではありません)
- AAzure Data Factory
- BAzure Databricks
- CAzure Synapse Analytics のサーバーレス SQL プール
- DSQL Server Integration Services(SSIS)を実行する Azure 仮想マシン
正解:A
解説
正解は Azure Data Factory です。Azure Data Factory はオンプレミスとクラウドの双方のデータソースに接続できる豊富なコネクタと、セルフホステッド統合ランタイムによるオンプレミス接続、GUI ベースのマッピングデータフロー、パイプラインのスケジュール実行機能を備えたクラウドのデータ統合サービスです。要件にある「複数ソースからの定期収集」「GUI での変換定義」「スケジュール実行の自動化」のいずれも Data Factory のパイプライン機能で実現できます。Azure Databricks は Spark による大規模なコード主体のデータ処理に強みがありますが、GUI ベースの変換定義や豊富な組み込みコネクタでの定期収集を主目的としたサービスではありません。
選択肢ごとの解説
- A正しい。Azure Data Factory はコネクタとマッピングデータフロー、パイプラインのスケジュール実行を組み合わせて、複数ソースからのデータ収集と変換を GUI 中心で自動化できます。
- B誤り。Azure Databricks は Apache Spark ベースのノートブックでコードを書いてデータ処理を行うサービスで、GUI ベースの変換定義やオンプレミス接続の豊富なコネクタを主目的とはしていません。
- C誤り。サーバーレス SQL プールは Azure Data Lake Storage 上のファイルに対して SQL でクエリを実行する分析用の仕組みであり、複数ソースからのデータ収集やスケジュール実行のオーケストレーションは行いません。
- D誤り。SSIS を仮想マシン上で実行する方法はオンプレミスの延長であり、クラウドネイティブな SaaS コネクタやサーバーレスでのスケジュール管理といった要件には適していません。