Q25 — AWS SAA-C03 第6章

第 25/65 問 | ← 第6章

Q390. ある企業が最近AWSクラウドへ移行しました。同社は、半構造化データセットの大規模な並列オンデマンド処理を実現するサーバーレスソリューションを求めており、そのデータセットにはログ、メディアファイル、販売取引データ、IoTセンサーデータが含まれ、すべてAmazon S3に保存されています。また、数千件のデータ項目を並列で処理できるようにしたいと考えています。これらの要件を最も運用効率よく満たすソリューションはどれですか?

正解: B. AWS Step FunctionsのMapステートを分散モード(Distributed mode)で使用してデータを並列処理する

解説

ログ、メディアファイル、販売取引データ、IoTセンサーデータなど、さまざまな種類の半構造化データから成るデータセットをAmazon S3に格納した状態で、大規模かつ並列・オンデマンドなサーバーレス処理を実現し、最も運用効率を高めるには、以下の選択肢が最も適しています。 B. AWS Step FunctionsのMapステートを分散モード(Distributed mode)で使用してデータを並列処理する。 分散モードのMapステートは、AWS Step Functionsが提供するサーバーレスワークフローサービスの機能であり、コレクション内の各アイテムを自動的に分割・分散して並列実行します。これにより、数千件に及ぶデータ項目の処理をスケーラブルかつ効率的に実現でき、並列度やスケールの管理をAWS側が自動的に行うため、運用負荷が最小限に抑えられます。 一方、AはインラインモードでのMapステート利用を提案していますが、これは実行環境(ステートマシンの実行コンテナ)内で並列処理を行うため、大量のデータ項目に対してはスケーラビリティやリソース管理の面で制約があり、分散モードほど運用効率が高くありません。 CのAWS Glueは、ETL(抽出・変換・ロード)およびデータカタログ機能に特化したサービスであり、多様なデータ形式の並列処理という点では柔軟性に乏しく、本ユースケースには最適とは言えません。 Dの複数Lambda関数による並列処理は技術的には可能ですが、数千単位の同時実行を安全かつ信頼性高く管理・監視・エラー処理するためには、独自のオーケストレーションロジックが必要となり、運用上の複雑さと保守コストが増大します。これに対し、AWS Step Functionsの分散モードMapステートは、こうした課題をネイティブに解決するため、最も運用効率の高いアプローチです。