ひとことで言うと
Apache Hadoop・Apache Sparkなどのビッグデータフレームワークを、クラスタ構築なしで動かすためのマネージドプラットフォームです。S3・DynamoDBとの間で大量データを変換・移動できます。
要するに、大量の書類を並列でスキャンする工場です。1台の機械(Lambda 1関数)に大量のPDFを流すと詰まりますが、EMRは何十台もの機械を並べて同時にさばきます。
何に使うか
| 用途 | 使い方 | 関連ドメイン |
|---|---|---|
| RAGコーパスの大規模前処理バッチ | 数百万ドキュメント規模のテキスト抽出・正規化・重複排除・チャンク分割を、Knowledge Basesの取り込み前にSparkジョブでまとめて片付ける | D1 |
| 実行基盤 | EMR on EC2・EMR on EKS・EMR Serverlessのいずれでも実行できる | D1 |
試験でどう問われるか
主役では出ません。 D1.3(データ検証と処理パイプライン)の周辺だけで出ます。
| 問われ方 | 正解に寄る条件 | 引っかけ |
|---|---|---|
| 数百万件規模のドキュメントを取り込み前に変換・クレンジング | 「大量」「並列」「Spark/Hadoop」が揃う → EMR | Lambda・Glue(件数が小さい・単発の変換ならこちらが正解) |
取り違えやすいもの
| 迷う相手 | 切り分けの一言 |
|---|---|
| AWS Glue | GlueはサーバーレスETLでジョブ単位が軽い。EMRはクラスタ規模の並列処理向けで、既存のHadoop/Sparkエコシステムをそのまま動かしたいときに強い |
| SageMaker Processing | SageMaker Processingは機械学習のデータ前処理(特徴量エンジニアリング寄り)。EMRはビッグデータ基盤の汎用処理で、対象がML特化かどうかで分かれる |
想起チェック
Q1. 数百万件のドキュメントをKnowledge Base取り込み前に前処理したい。EMRが正解になる決め手は?
件数の規模と並列処理の必要性です。少量・単発ならLambdaやGlueで足りますが、「大量」「Spark/Hadoop」という語が伴えばEMRが選択肢になります。