Analytics

Amazon EMR

Hadoop・Sparkなどビッグデータフレームワークのマネージドクラスタ。AIP-C01ではRAG用コーパスを大量前処理するD1.3のバッチ処理係として脇役で出ます。

  • C|周辺
  • D1 FM統合・データ・コンプラ

ひとことで言うと

Apache Hadoop・Apache Sparkなどのビッグデータフレームワークを、クラスタ構築なしで動かすためのマネージドプラットフォームです。S3・DynamoDBとの間で大量データを変換・移動できます。

要するに、大量の書類を並列でスキャンする工場です。1台の機械(Lambda 1関数)に大量のPDFを流すと詰まりますが、EMRは何十台もの機械を並べて同時にさばきます。

何に使うか

用途使い方関連ドメイン
RAGコーパスの大規模前処理バッチ数百万ドキュメント規模のテキスト抽出・正規化・重複排除・チャンク分割を、Knowledge Basesの取り込み前にSparkジョブでまとめて片付けるD1
実行基盤EMR on EC2・EMR on EKS・EMR Serverlessのいずれでも実行できるD1

試験でどう問われるか

主役では出ません。 D1.3(データ検証と処理パイプライン)の周辺だけで出ます。

問われ方正解に寄る条件引っかけ
数百万件規模のドキュメントを取り込み前に変換・クレンジング「大量」「並列」「Spark/Hadoop」が揃う → EMRLambda・Glue(件数が小さい・単発の変換ならこちらが正解)

取り違えやすいもの

迷う相手切り分けの一言
AWS GlueGlueはサーバーレスETLでジョブ単位が軽い。EMRはクラスタ規模の並列処理向けで、既存のHadoop/Sparkエコシステムをそのまま動かしたいときに強い
SageMaker ProcessingSageMaker Processingは機械学習のデータ前処理(特徴量エンジニアリング寄り)。EMRはビッグデータ基盤の汎用処理で、対象がML特化かどうかで分かれる

想起チェック

Q1. 数百万件のドキュメントをKnowledge Base取り込み前に前処理したい。EMRが正解になる決め手は?

件数の規模と並列処理の必要性です。少量・単発ならLambdaやGlueで足りますが、「大量」「Spark/Hadoop」という語が伴えばEMRが選択肢になります。

出典(AWS公式)