Q26 — AWS SAA-C03 第12章

第 26/100 問 | ← 第12章

Q826. ある企業は、10 TB のログファイルを Apache Parquet 形式で Amazon S3 バケットに保存しています。この企業は、時折 SQL を使用してこれらのログファイルを分析する必要があります。 この要件を最もコスト効率よく満たすソリューションはどれですか?

正解: C. AWS Glue クローラーを作成し、S3 バケット内のテーブルメタデータを格納および取得します。Amazon Athena を使用して、S3 バケット内のデータに対して直接 SQL 文を実行します。

解説

この要件を最もコスト効率よく満たすソリューションは、選択肢 C です:AWS Glue クローラーを作成して S3 バケット内のテーブルメタデータを格納および取得し、Amazon Athena を使用して S3 バケット内のデータに対して直接 SQL 文を実行します。 Amazon Athena は、Amazon S3 に保存されたデータに対して直接 SQL クエリを実行できるサーバーレスなクエリサービスです。インフラストラクチャの管理を必要とせず、S3 上のデータを分析するために特化して設計されています。Athena を使用すれば、Apache Parquet 形式のログファイルをそのまま S3 上でクエリでき、データ移行や追加サービスの導入が不要です。 AWS Glue クローラーを活用することで、S3 バケット内のログファイルを自動的に検出し、カタログ化できます。クローラーはテーブルメタデータを格納・取得し、Athena による SQL クエリを容易に実現します。 選択肢 A では、Amazon Aurora MySQL データベースの作成と AWS DMS を用いた S3 からのデータ移行が提案されていますが、これは追加のインフラストラクチャとデータ移行を伴うため、本要件に対してコスト効率が良くありません。 選択肢 B では、Amazon Redshift クラスターの作成と Redshift Spectrum を用いた S3 上のデータへの直接クエリが提案されていますが、Redshift は強力なデータウェアハウスソリューションですが、クラスターの維持コストが高いため、偶発的な SQL 分析には Athena よりも高コストとなります。 選択肢 D では、Amazon EMR クラスターの作成と Apache Spark SQL を用いた S3 上のデータへの直接クエリが提案されていますが、EMR は完全マネージド型のビッグデータ処理サービスですが、運用オーバーヘッドが大きく、偶発的な SQL 分析には Athena よりもコスト効率が劣ります。 したがって、選択肢 C は、追加のインフラストラクチャやデータ移行を必要とせず、AWS Glue と Amazon Athena を活用して S3 上のログファイルを直接クエリできるため、最もコスト効率の高いソリューションです。