Q61 — AWS SAA-C03 第11章
第 61/100 問 | ← 第11章
Q761. マーケティング会社は、マーケティングキャンペーンからAmazon S3に大量の新しいクリックストリームデータを受信します。同社は、このAmazon S3上のクリックストリームデータを迅速に分析する必要があります。その後、データパイプライン内でデータをさらに処理するかどうかを判断する必要があります。これらの要件を満たすうち、運用オーバーヘッドが最も少ないソリューションはどれですか?
- A. Sparkカタログに外部テーブルを作成し、AWS Glueでジョブを設定してデータをクエリします。
- B. AWS Glueクローラーを設定してデータをクロールし、Amazon Athenaを設定してデータをクエリします。 ✓
- C. Hiveメタストアに外部テーブルを作成し、Amazon EMRでSparkジョブを設定してデータをクエリします。
- D. AWS Glueクローラーを設定してデータをクロールし、Amazon Kinesis Data AnalyticsをSQLで使用してデータをクエリします。
正解: B. AWS Glueクローラーを設定してデータをクロールし、Amazon Athenaを設定してデータをクエリします。
解説
Amazon S3上のクリックストリームデータを迅速に分析し、データパイプライン内でさらに処理するかどうかを判断するという要件を、最も少ない運用オーバーヘッドで満たすには、以下の選択肢Bが最も適しています。\n\nB. AWS Glueクローラーを設定してデータをクロールし、Amazon Athenaを設定してデータをクエリします。\n\n1. AWS Glueクローラー:AWS Glueクローラーは、Amazon S3内のデータを自動的に検出し、カタログ化します。Glueクローラーを設定することで、クリックストリームデータのスキーマおよびメタデータを素早く自動抽出でき、クエリ可能な状態にします。\n2. Amazon Athena:Amazon Athenaは、サーバーレスなクエリサービスであり、標準SQLを使ってAmazon S3内のデータを直接分析できます。Amazon Athenaを設定してクリックストリームデータをクエリすれば、追加のインフラストラクチャ構築や管理を必要とせずに、迅速な分析が可能です。\n\n以下に、選択肢Bが最適である理由を示します。\n\n1. 迅速なデータ分析:AWS GlueクローラーとAmazon Athenaを組み合わせることで、クリックストリームデータを高速かつ効率的に分析できます。Glueクローラーがスキーマを自動抽出するため、手動でのスキーマ設定やデータ前処理が不要です。\n2. 最小限の運用オーバーヘッド:AWS GlueおよびAmazon Athenaはマネージドサービスであり、運用負荷が極めて小さいです。インフラストラクチャのプロビジョニングや管理を明示的に実施する必要がなく、AWS Glueがデータのカタログ化を、Amazon Athenaがクエリ実行・スケーリング・パフォーマンス最適化をそれぞれ自動で処理します。\n\n一方、選択肢A、C、Dは、このシナリオにおいて最適ではありません。\n\n選択肢Aでは、Sparkカタログへの外部テーブル作成とAWS Glueジョブの設定が提案されています。AWS GlueはETLやデータ前処理に有効ですが、Sparkジョブの設定やSparkカタログの管理は、代替ソリューションと比較して運用オーバーヘッドが大きくなります。\n\n選択肢Cでは、Hiveメタストアへの外部テーブル作成とAmazon EMRでのSparkジョブ設定が提案されています。EMRはビッグデータワークロード向けのスケーラブルなプラットフォームですが、サーバーレスなAWS Glue+Amazon Athenaと比較して、より多くの運用管理とオーバーヘッドを要します。\n\n選択肢Dでは、AWS Glueクローラーによるデータクロールと、Amazon Kinesis Data Analyticsを用いたSQLクエリが提案されています。Kinesis Data Analyticsはストリーミングデータの処理・分析に適していますが、S3に保存された静的データのクエリには複雑さと運用オーバーヘッドが過剰です。\n\nしたがって、Amazon S3上のクリックストリームデータを迅速に分析し、データパイプライン内でさらに処理するかどうかを判断するという要件を、最も少ない運用オーバーヘッドで満たす最も適切なソリューションは、選択肢Bです。