Q38 — AWS SAA-C03 第14章
第 38/100 問 | ← 第14章
Q1038. 気象予報会社が、さまざまなセンサーから継続的に気温の測定値を収集しています。既存のデータ取り込みプロセスでは、これらの測定値を収集し、大きなApache Parquetファイルに集約します。その後、クライアント側暗号化(KMS管理キーを使用するCSE-KMS)でファイルを暗号化し、各カレンダー日ごとに別々のプレフィックスを指定してAmazon S3バケットに書き込みます。 この会社は、特定のカレンダー日に限定して、サンプル移動平均を算出するためのSQLクエリを時折実行したいと考えています。 これらの要件を最もコスト効率よく満たすソリューションはどれですか?
- A. Amazon Athenaを設定して暗号化されたファイルを読み込むようにし、Amazon S3上に直接保存されたデータに対してSQLクエリを実行します。 ✓
- B. Amazon S3 Selectを使用して、Amazon S3上に直接保存されたデータに対してSQLクエリを実行します。
- C. Amazon Redshiftを設定して暗号化されたファイルを読み込むようにし、Redshift SpectrumおよびRedshift Query Editor v2を用いて、Amazon S3上に直接保存されたデータに対してSQLクエリを実行します。
- D. Amazon EMR Serverlessを設定して暗号化されたファイルを読み込むようにし、Apache SparkSQLを用いて、Amazon S3上に直接保存されたデータに対してSQLクエリを実行します。
正解: A. Amazon Athenaを設定して暗号化されたファイルを読み込むようにし、Amazon S3上に直接保存されたデータに対してSQLクエリを実行します。
解説
Amazon S3に保存された暗号化済みのApache Parquetファイルに対して時折SQLクエリを実行するという要件を満たす最もコスト効率の良いソリューションは、以下の通りです。 A. Amazon Athenaを設定して暗号化されたファイルを読み込むようにし、Amazon S3上に直接保存されたデータに対してSQLクエリを実行します。 解説: 1. Amazon Athena: ・Athenaは、サーバーレス型のインタラクティブクエリサービスであり、Amazon S3に保存されたデータに対して直接SQLクエリを実行できます。Apache Parquetファイルをネイティブでサポートしており、データの移動や変換を必要とせずに大規模データセットをクエリするのに最適です。 2. クライアント側暗号化(CSE-KMS)のサポート: ・Athenaは、KMS管理キーを用いたクライアント側暗号化(CSE-KMS)で暗号化されたファイルの読み込みをサポートしています。つまり、手動での復号や追加インフラの管理をすることなく、暗号化済みParquetファイルを直接クエリできます。 3. コスト効率: ・Athenaはサーバーレスであるため、実行したクエリごとにスキャンしたデータ量に基づいて課金されます。これは、Amazon RedshiftやEMRのようなインフラのプロビジョニングと運用を伴う他の選択肢と比較して、通常ははるかにコスト効率が優れています。 その他の選択肢の評価: B. Amazon S3 Selectを使用して、Amazon S3上に直接保存されたデータに対してSQLクエリを実行します。 ・S3 Selectは、S3オブジェクトからSQLを使って一部のデータを取得できる機能ですが、複数ファイルにまたがる集計や大規模データセットに対する複雑なクエリには対応が限定的であり、Athenaと比べて機能面で劣ります。 C. Amazon Redshiftを設定して暗号化されたファイルを読み込むようにし、Redshift SpectrumおよびRedshift Query Editor v2を用いて、Amazon S3上に直接保存されたデータに対してSQLクエリを実行します。 ・Redshift SpectrumによりS3上のデータをクエリ可能ですが、特に偶発的なクエリ用途においては、Athenaと比較してストレージおよびコンピューティングリソースのコストが高くなる傾向があります。 D. Amazon EMR Serverlessを設定して暗号化されたファイルを読み込むようにし、Apache SparkSQLを用いて、Amazon S3上に直接保存されたデータに対してSQLクエリを実行します。 ・EMR Serverlessはデータ処理に柔軟性がありますが、会社の「時折のクエリ」用途には過剰な複雑さとコストを伴い、Athenaに比べてコスト効率が劣ります。 結論: 選択肢Aは、既存のデータ形式および暗号化方式を活かしつつ、コスト効率よく時折のSQLクエリを実行するための最適な選択肢です。