ひとことで言うと
モデルを、自分のアカウントの中のインスタンスとエンドポイントの上で学習させ、ホストするためのマネージド基盤です。Bedrock と決定的に違うのは、推論の実体が「自分の持ち物」として立ち、立っている間ずっと課金されるところです。
Bedrock が電力会社なら、SageMaker AI は自家発電設備の一式リースです。タービン(インスタンス種別)を選び、燃料(モデルの重み)を自分で積み、保守(スケーリング・監視・バージョン管理)はマネージドで面倒を見てもらう。要するに、設備は自分の敷地に立つので、使っていない夜間も基本料が発生します。この「敷地に立つ/立たない」が、試験の分岐点そのものです。
なぜ生まれたか
| 時期 | 何が起きたか |
|---|---|
| 2024-12-03 | Amazon SageMaker が Amazon SageMaker AI に改称。 既存機能の名前は変わらない |
| 同日 | 次世代の Amazon SageMaker が発表され、こちらが上位のブランド名に。 データ・分析・AI を束ねる統合プラットフォームとなり、SageMaker AI はその中の1構成要素になった |
| 以降 | sagemaker の API 名前空間・CLI・マネージドポリシーの AmazonSageMaker 接頭辞・サービスエンドポイント・CloudFormation の AWS::SageMaker・コンソールURL・ドキュメントURLは後方互換のため据え置き |
改称前は「SageMaker」の一語が、ML基盤そのものと、その上の個別機能の両方を指していました。2024年12月の再編で、Amazon SageMaker は傘の名前(SageMaker AI / SageMaker Lakehouse / SageMaker Unified Studio / Data and AI Governance / SQL Analytics / Data Processing、そして Amazon Bedrock を含む)、Amazon SageMaker AI は旧来の「作る・学習させる・デプロイする」部分、と役割が分かれました。
試験ガイドの読み方に効きます。AIP-C01 の In-Scope 表では SageMaker AI と Bedrock が別々のサービスとして並びますが、AWS のドキュメント上はどちらも「次世代 Amazon SageMaker」という傘の下にいます。設問文が「SageMaker」とだけ書いていて、文脈が学習・エンドポイント・インスタンスであれば、それは SageMaker AI のことです。
何に使うか
| 用途 | 使い方 | 関連する試験ドメイン |
|---|---|---|
| Bedrock に無いモデルのホスティング | 重みを自分で積み、リアルタイムエンドポイントに載せる | D1・D2 |
| ファインチューニング済みモデルの配備 | 学習ジョブ → エンドポイント。LoRA アダプタはアダプタ推論コンポーネントでベースモデルに相乗りさせる | D1 |
| モデルのバージョン管理と承認 | Model Registry(モデルグループ/モデルバージョン/承認ステータス/リネージ/クロスアカウント共有) | D1・D3 |
| 大量データの一括推論 | Batch Transform(永続エンドポイントが要らない場面) | D4 |
| 大きな入力・長い処理 | 非同期推論(最大 1GB のペイロード、最大1時間の処理) | D2・D4 |
| 間欠的なトラフィック | サーバーレス推論(無リクエスト時はゼロまで縮む) | D4 |
| マルチモーダルデータの前処理 | Processing ジョブでの分析・前処理・特徴量化 | D1 |
| 本番モデルの監視・説明 | Model Monitor(ドリフト検知)/Clarify(バイアス・説明可能性)/Model Cards | D3 |
試験でどう問われるか
**「SageMaker AI とは何か」は問われません。**問われるのは2段階の分岐です。**① Bedrock で足りるか、SageMaker AI まで降りるか。② 降りたとして、4つの推論オプションのどれか。**この2つを取り違えると、選択肢が2つ残って両方それらしく見えます。
| 問われ方 | 正解に寄る条件 | 引っかけの選択肢 |
|---|---|---|
| Bedrock か SageMaker AI か | Bedrock が提供していないモデルを使う/重みを自分で保持する/インスタンス種別やコンテナを自分で決める必要がある → SageMaker AI | 「MLの専門家がいない」「運用負荷を最小化したい」と書いてあるのに SageMaker AI を選ぶ |
| 推論オプション(低レイテンシ) | 対話的・低レイテンシ → リアルタイムエンドポイント | 「低レイテンシ」なのにサーバーレス(コールドスタートがある) |
| 推論オプション(大きい入力) | 入力が大きい(〜1GB)/処理が長い(〜1時間)/準リアルタイムでよい → 非同期推論 | 同じ条件でリアルタイムエンドポイントを選ぶ |
| 推論オプション(間欠トラフィック) | トラフィックに空白があり、コールドスタートを許容できる → サーバーレス推論 | GPU が要る LLM をサーバーレスに置く(GPU 非対応) |
| 推論オプション(永続不要) | S3 上のデータセットに一括で推論をかけたい → Batch Transform | 使い終わったら消す前提のリアルタイムエンドポイント |
| 夜間コストをゼロにしたい | 非同期はインスタンス数を0までオートスケール/サーバーレスは無リクエスト時に0 | リアルタイムエンドポイントをオートスケールでゼロにする案 |
| 1つのベースモデルを複数の用途に | LoRA アダプタをアダプタ推論コンポーネントとしてベース推論コンポーネントに載せる(計算資源はベース側を共用) | 用途ごとにフルモデルのエンドポイントを立てる案 |
| モデルのバージョン管理・ロールバック | Model Registry(バージョン・承認ステータス・CI/CD 連携・リネージ) | S3 に日付フォルダで重みを並べる案/CloudFormation だけで版を管理する案 |
| 人手レビューを挟む | 推論結果の人間レビュー → Amazon Augmented AI(A2I) | Ground Truth(あれは学習データのラベリング) |
1問拾える境目: 非同期推論では、ペイロードそのものをリクエストで送りません。S3 に置いて、そのポインタを InvokeEndpointAsync に渡します。結果も S3 に置かれ、完了通知は SNS で受けられます。「大きなファイルを HTTP で送る」形の選択肢は、この時点で外れます。
実務でどう使うか
- リアルタイムエンドポイントは、リクエストが1件も来なくても課金されます。 PoC で立てたエンドポイントの消し忘れが、この基盤で一番よくある請求事故です。公式が「リクエストが無いときにゼロまで縮む」と明記しているのは非同期推論とサーバーレス推論のほうです
- サーバーレス推論の制約は具体的です。 メモリは 1024 / 2048 / 3072 / 4096 / 5120 / 6144 MB の6段階、コンテナイメージは最大 10GB、エフェメラルディスクはどのメモリサイズでも 5GB。1エンドポイントの最大同時実行数は 200、1リージョンあたりのサーバーレスエンドポイント数は 50、アカウント全体で共有できる同時実行数はリージョンにより 1000 または 500 です
- コールドスタートは CloudWatch の
OverheadLatencyで測れます。(新しい計算資源の起動にかかった時間を追うメトリクスです。)温めたいならプロビジョンドコンカレンシーを付けます - エンドポイントの種類は行き来できません。 インスタンスベースのリアルタイムエンドポイントをサーバーレスに更新しようとすると
ValidationErrorになります。サーバーレス → リアルタイムへの変換はできますが、戻せません - Batch Transform のパラメータには上限があります。
MaxPayloadInMBは 100MB 以下、MaxConcurrentTransforms × MaxPayloadInMBも 100MB を超えられません。また 入力ファイルが1個しかない状態でインスタンスを複数立てても、働くのは1台だけで残りは遊びます(並列化したいならファイルを分ける)
サーバーレス推論で使えないもの(そのまま出題の材料になります): GPU、AWS Marketplace のモデルパッケージ、プライベート Docker レジストリ、マルチモデルエンドポイント、VPC 構成、ネットワーク分離、データキャプチャ、複数のプロダクションバリアント、Model Monitor、推論パイプライン。
つまり「機密データを VPC に閉じる」「ドリフトを監視する」という要件が1行でも書いてあれば、サーバーレスは候補から落ちます。
非同期エンドポイントは排他です。エンドポイント設定に AsyncInferenceConfig が入っていると、そのエンドポイントは非同期呼び出ししか受け付けません。「同じエンドポイントで同期も非同期も」という設計は成立しません。
取り違えやすいもの
| 迷う相手 | 切り分けの一言 |
|---|---|
| Amazon SageMaker(次世代) | こちらは傘のブランド名。データ・分析・AI を束ねた統合プラットフォームで、SageMaker AI も Bedrock もその下に並ぶ |
| Amazon Bedrock | Bedrock はエンドポイントを持たない。SageMaker AI はエンドポイントが自分の資源として立つ。課金の形(トークン単価 vs インスタンス時間)が違う |
| SageMaker JumpStart | JumpStart は SageMaker AI の中にある既製モデルの入口。別サービスではなく、この基盤へのオンボーディング経路 |
| Batch Transform と非同期推論 | Batch Transform はエンドポイントを持たないジョブ。非同期推論はエンドポイントはあるが、キューを挟む |
| Model Registry と Model Cards | Registry は版と承認(デプロイの手前のゲート)。Model Cards はモデルの説明の文書化(ガバナンス・報告向け) |
| Ground Truth と Augmented AI(A2I) | Ground Truth は学習データにラベルを付ける。A2I は推論結果を人間がレビューするワークフロー |
想起チェック
Q1. シナリオに何が書いてあれば、Bedrock ではなく SageMaker AI に降りますか。
Bedrock で提供されていないモデルを使う/重みを自分で保持する/インスタンス種別・コンテナ・ネットワーク分離を自分で決める必要がある、のいずれかです。逆に「運用負荷を最小化」「ML の専門家がいない」が書いてあれば Bedrock 側に寄ります。
Q2. 「入力が大きく、処理に時間がかかり、応答は準リアルタイムでよい」に対応する推論オプションは?
非同期推論です。最大 1GB のペイロード、最大1時間の処理に対応し、リクエストが無いときはインスタンス数を0までオートスケールします。ペイロードは S3 に置き、ポインタを渡します。
Q3. サーバーレス推論を選んではいけない条件を3つ挙げてください。
GPU が要る/VPC 構成やネットワーク分離が要る/Model Monitor でドリフトを監視する、のいずれかがあれば外れます(他にマルチモデルエンドポイント、データキャプチャ、複数プロダクションバリアントも非対応)。加えてコールドスタートを許容できない場合も外れます。
Q4. ベースモデル1つに対して用途別のファインチューニング結果を複数出したい。エンドポイントを増やさずに済ませる方法は?
LoRA アダプタをアダプタ推論コンポーネントとして、ベース推論コンポーネントに載せます。 アダプタ側は計算資源を要求せず、ベース側の資源を共用します。呼び出し時に推論コンポーネント名を指定して切り替えます。