Q41 — AWS SAA-C03 第12章
第 41/100 問 | ← 第12章
Q841. ある企業は、Amazon S3上にデータレイクをホストしています。このデータレイクは、さまざまなデータソースからApache Parquet形式のデータを取り込みます。企業は、取り込まれたデータを準備するために複数の変換ステップを実行しており、これらには異常値のフィルタリング、日付および時刻の標準化(正規化)、分析用の集計値生成などが含まれます。変換後のデータは、データアナリストがアクセスするS3バケットに保存する必要があります。また、企業はコード不要の事前構築済みデータ変換ソリューションを必要としており、データ系統(data lineage)およびデータプロファイリング機能も必須です。さらに、データ変換ステップを社内の全従業員と共有する必要があります。これらの要件を満たすソリューションはどれですか?
- A. AWS Glue Studioのビジュアルキャンバスを設定してデータを変換します。AWS Glueジョブを使用して、従業員と変換ステップを共有します。
- B. Amazon EMR Serverlessを設定してデータを変換します。EMR Serverlessジョブを使用して、従業員と変換ステップを共有します。
- C. AWS Glue DataBrewを設定してデータを変換します。DataBrewレシピを使用して、従業員と変換ステップを共有します。 ✓
- D. データに対してAmazon Athenaテーブルを作成します。Athena SQLクエリを記述してデータを変換します。Athena SQLクエリを従業員と共有します。
正解: C. AWS Glue DataBrewを設定してデータを変換します。DataBrewレシピを使用して、従業員と変換ステップを共有します。
解説
コード不要の事前構築済みデータ変換ソリューションを必要とし、データ系統(data lineage)およびデータプロファイリング機能を提供し、かつ変換ステップを社内従業員と共有できるソリューションとして、推奨されるのは以下の選択肢です: C. AWS Glue DataBrewを設定してデータを変換し、DataBrewレシピを使用して変換ステップを従業員と共有する。 理由は以下の通りです: 選択肢Cでは、AWS Glue DataBrewを活用したデータ変換が提案されています。AWS Glue DataBrewは、コードを書かずにデータを視覚的に探索・クリーニング・変換できるビジュアルデータ準備ツールです。直感的なユーザーインターフェイスと、あらかじめ構築された変換機能およびレシピを備えており、異常値のフィルタリング、データの正規化、分析用集計の生成など、要件で指定されたすべての変換ステップを容易に実行できます。 さらに、DataBrewはデータ系統およびデータプロファイリング機能を提供します。データ系統により、データの起源やフローを追跡・可視化でき、透明性と監査可能性が確保されます。データプロファイリングは、変換対象データの特性や品質を把握するのに役立ちます。 また、DataBrewレシピは、一連の変換操作をキャプチャし、再利用・共有が可能であり、他のデータセットにも適用できます。これにより、変換ステップを社内の全従業員と簡単に共有できます。 一方、選択肢AのAWS Glue Studioは、ETLワークフローをビジュアルに構築できるものの、複雑なETLシナリオ向けであり、場合によってはコード記述が必要になることがあります。これに対し、DataBrewはよりシンプルでユーザーフレンドリーな、コード不要のデータ準備に特化したツールです。 選択肢BのAmazon EMR Serverlessは、ビッグデータ処理には適していますが、本要件に比べて過剰な複雑さを伴い、コード記述が必須であり、DataBrewのようなビジュアルインターフェイスや豊富な事前構築済み変換機能は提供しません。 選択肢DのAmazon Athenaは、データ分析向けの強力なクエリサービスですが、複雑なデータ変換を主目的とはしておらず、各変換ステップごとにSQLクエリを記述・管理するのは煩雑であり、DataBrewのビジュアルインターフェイスに比べて使い勝手が劣ります。 したがって、本要件を最も適切に満たすソリューションは、AWS Glue DataBrewを活用したデータ変換です。これは、コード不要の事前構築済みソリューションであり、ビジュアルインターフェイス、データ系統、データプロファイリング、およびDataBrewレシピによる変換ステップの共有というすべての要件を満たします。