Q61 — AWS SAA-C03 第11章

第 61/100 题 | ← 返回第11章

Q761.一家营销公司从营销活动中收到 Amazon S3 中的大量新点击流数据.该公司需要快速分析 Amazon S3 中的点击流数据.然后公司需要确定是否在数据管道中进一步处理数据.哪种解决方案能够以最少的运营开销满足这些要求?

正确答案: B. 配置 AWS Glue 爬网程序来爬网数据.配置 Amazon Athena 以查询数据.

解析

要快速分析 Amazon S3 中的点击流数据并确定是否以最少的运营开销在数据管道中进一步处理数据,最合适的解决方案是:B. 配置 AWS Glue 爬网程序来爬网数据.配置 Amazon Athena 以查询数据.选项 B 以最少的运营开销提供所需的解决方案:配置 AWS Glue 爬网程序来爬网数据.配置 Amazon Athena 以查询数据:\ 1. AWS Glue 爬网程序:AWS Glue 爬网程序自动发现 Amazon S3 中的数据并对其进行编目.通过配置 Glue 爬网程序,您可以快速自动提取点击流数据的架构和元数据,使其可用于查询.\ 2. Amazon Athena:Amazon Athena 是一种无服务器查询服务,允许您使用标准 SQL 查询直接在 Amazon S3 中分析数据.通过配置 Amazon Athena 来查询点击流数据,您可以快速分析数据,而无需设置和管理额外的基础设施.这就是为什么选项 B 是最佳选择:\ 1.快速数据分析:AWS Glue爬虫与Amazon Athena的结合可以快速高效地分析点击流数据. Glue 爬网程序会自动提取架构,使其可在 Athena 中查询,无需手动架构配置或数据准备.\ 2. 最小的运营开销:AWS Glue 和 Amazon Athena 是托管服务,这意味着您的公司的运营开销更少.您不需要明确配置或管理基础设施. AWS Glue 负责对数据进行编目,Amazon Athena 负责查询执行. 扩展和性能优化.在这种情况下,选项 A. C 和 D 并不是最合适的选择:选项 A 建议在 Spark 目录中创建外部表并在 AWS Glue 中配置作业来查询数据.尽管 AWS Glue 可用于 ETL 和数据准备,但与替代解决方案相比,配置 Spark 作业和管理 Spark 目录会带来额外的运营开销.选项 C 建议在 Hive 元存储中创建外部表,并在 Amazon EMR 中配置 Spark 作业来查询数据.虽然 EMR 提供了用于处理大数据工作负载的可扩展平台,但与使用 AWS Glue 和 Amazon Athena 的无服务器方法相比,它需要更多的运营管理和开销.选项 D 建议配置 AWS Glue 爬网程序来爬网数据,并配置 Amazon Kinesis Data Analytics 以使用 SQL 查询数据.虽然 Kinesis Data Analytics 可以处理和分析流数据,但与使用 Amazon Athena 查询 S3 中的静态数据的简单性相比,它增加了复杂性和操作开销.因此,快速分析 Amazon S3 中的点击流数据并确定是否以最少的运营开销在数据管道中进一步处理数据的最合适的解决方案是 B:配置 AWS Glue 爬网程序来爬取数据.配置 Amazon Athena 以查询数据.