Q26 — AWS SAA-C03 第12章
第 26/100 题 | ← 返回第12章
Q826.一家公司在 Amazon S3 存储桶中以 Apache Parquet 格式存储了 10 TB 的日志文件.公司偶尔需要使用SQL来分析日志文件.哪种解决方案能够最具成本效益地满足这些要求?
- A. 创建 Amazon Aurora MySQL 数据库.使用 AWS Database Migration Service (AWS DMS) 将数据从 S3 存储桶迁移到 Aurora.向 Aurora 数据库发出 SQL 语句.
- B. 创建 Amazon Redshift 集群.使用 Redshift Spectrum 直接对 S3 存储桶中的数据运行 SQL 语句.
- C. 创建一个 AWS Glue 爬网程序来存储 S3 存储桶中的表元数据并从中检索表元数据.使用 Amazon Athena 直接对 S3 存储桶中的数据运行 SQL 语句. ✓
- D. 创建 Amazon EMR 集群.使用 Apache Spark SQL 直接对 S3 存储桶中的数据运行 SQL 语句.
正确答案: C. 创建一个 AWS Glue 爬网程序来存储 S3 存储桶中的表元数据并从中检索表元数据.使用 Amazon Athena 直接对 S3 存储桶中的数据运行 SQL 语句.
解析
最经济高效地满足要求的解决方案是选项 C:创建一个 AWS Glue 爬网程序来存储和检索 S3 存储桶中的表元数据.使用 Amazon Athena 直接对 S3 存储桶中的数据运行 SQL 语句.Amazon Athena 是一种无服务器查询服务,允许您直接对 Amazon S3 中存储的数据运行 SQL 语句.它专为分析 S3 中的数据而设计,无需基础设施管理.使用 Athena,您可以直接查询 Apache Parquet 格式的日志文件,无需任何数据迁移或额外服务.通过使用 AWS Glue 爬网程序,您可以自动发现 S3 存储桶中的日志文件并对其进行编目.爬虫将存储和检索表元数据,从而可以轻松地在 Athena 中使用 SQL 语句查询日志文件.选项 A 建议创建 Amazon Aurora MySQL 数据库并使用 AWS Database Migration Service (DMS) 从 S3 存储桶迁移数据.此选项涉及额外的基础设施和数据迁移,这对于给定的要求可能不具有成本效益.选项 B 建议创建 Amazon Redshift 集群并使用 Redshift Spectrum 直接对 S3 存储桶中的数据运行 SQL 语句.虽然 Redshift 是一个强大的数据仓库解决方案,但由于维护 Redshift 集群的成本,它可能比使用 Athena 进行偶尔的 SQL 分析更昂贵.选项 D 建议创建 Amazon EMR 集群并使用 Apache Spark SQL 直接对 S3 存储桶中的数据运行 SQL 语句. EMR 是完全托管的大数据处理服务,但它需要更多的管理开销,并且对于偶尔的 SQL 分析可能不如 Athena 经济高效.因此,选项 C 是最具成本效益的解决方案,因为它利用 AWS Glue 和 Amazon Athena 直接查询 S3 中的日志文件,无需额外的基础设施或数据迁移.