AZ-305:Designing Microsoft Azure Infrastructure Solutions データストレージソリューションの設計 問5
データストレージソリューションの設計/データ統合の設計ある企業には、オンプレミスのファイアウォール内にある複数の SQL Server から夜間にデータを抽出し、変換して Azure のデータ レイクへ読み込む既存の SQL Server Integration Services(SSIS)パッケージが 200 本あります。サードパーティ製のカスタム コンポーネントも使用しています。パッケージの書き換えは最小限にしつつ、サーバーの運用を廃止してクラウドからスケジュール実行したいと考えています。最も適切な設計はどれか。
当サイトのオリジナル問題(AZ-305:Designing Microsoft Azure Infrastructure Solutionsの出題範囲「データストレージソリューションの設計」に対応。実際の試験問題ではありません)
- AAzure Synapse Analytics のサーバーレス SQL プールで外部テーブルを定義し、T-SQL でパッケージ相当の処理を再実装する
- BAzure Data Factory のコピー アクティビティとマッピング データ フローを使い、セルフホステッド統合ランタイムで全パッケージを再実装する
- CAzure Databricks のノートブックに全パッケージの処理を Spark ジョブとして書き換え、ジョブ スケジューラで実行する
- DAzure Data Factory に Azure-SSIS 統合ランタイムをプロビジョニングし、仮想ネットワークに参加させて VPN または ExpressRoute で接続されたオンプレミスの SQL Server に接続し、パッケージを実行する
正解:D
解説
既存の SSIS パッケージを書き換えずにクラウドで実行するには、Azure Data Factory の Azure-SSIS 統合ランタイムを使います。パッケージ実行用のマネージド クラスターで、カスタム コンポーネントのインストールもできます。仮想ネットワークに参加させればオンプレミスのデータ ソースへ接続でき、Data Factory のパイプラインからスケジュール実行できます。他の選択肢は、いずれもパッケージ全体の再実装が必要になり、移行コストが大きくなります。
選択肢ごとの解説
- A誤り。サーバーレス SQL プールはデータ レイクに対するクエリ用で、200 本の SSIS パッケージを T-SQL で再実装する大規模な書き換えが必要です。オンプレミスの SQL Server からの抽出・スケジュール実行の仕組みも別途必要です。
- B誤り。Data Factory のコピー アクティビティやマッピング データ フローは優れた統合手段ですが、全パッケージの再実装が必要です。カスタム コンポーネントのロジックも置き換えなければならず、書き換え最小限という要件を満たしません。
- C誤り。Databricks は Spark による大規模データ処理基盤で、SSIS パッケージをそのまま実行できません。全パッケージをコードで書き換える必要があり、要件に反します。
- D正しい。Azure-SSIS 統合ランタイムは SSIS パッケージをそのまま実行でき、カスタム コンポーネントや仮想ネットワーク経由のオンプレミス接続にも対応します。