Machine Learning

Amazon SageMaker Ground Truth

学習データに人手でラベルを付けるための、作業者の手配・作業画面・成果物回収を一式にした仕組み。A2I(推論結果の人間レビュー)と役割が逆なので、そこだけ押さえます。

  • A|GenAIの核
  • D1 FM統合・データ・コンプラ
  • D5 テスト・検証・トラブルシュート

ひとことで言うと

学習用データセットに人間が正解を書き込むための、発注から回収までの一式です。誰に配るか(Mechanical Turk/自社の私設ワークフォース/ベンダー)、どんな画面で作業させるか(タスクテンプレート)、どこに集めるか(S3 の入力/出力マニフェスト)までを SageMaker AI 側が持ちます。

要するに、答え合わせの赤ペンを人海戦術で入れるための手配所です。Ground Truth 自身は正解を知りません。知っているのは誰にどの問題を配って、どの形式で回収するかだけ。だから「モデルが賢くなる機能」ではなく、人間の手を並べる機能として覚えます。

なぜ生まれたか

ラベリングは「人を集める」「作業画面を作る」「品質を担保する」「結果をS3の決まった形に整える」の4つが全部必要で、モデルを作るより先に人事と業務システムの問題になります。Ground Truth はこの4つを SageMaker AI 側の機能として持ち、さらにアクティブラーニングで人手の総量を減らす(自動データラベリング)ところまでを引き受けました。

自前でやると詰まる場所Ground Truth が置いたもの
作業者をどこから集めるかMechanical Turk(50万人超の独立契約者)/私設ワークフォース/AWS Marketplace のベンダー会社 の3系統
作業画面をどう作るか組み込みタスクタイプごとのワーカータスクテンプレート、または HTML 2.0 コンポーネントによるカスタムワークフロー
人手の量をどう減らすか自動データラベリング(アクティブラーニング)。信頼度が閾値を超えたものは人に回さない
結果をどう受け取るかS3 の出力マニフェスト。イベントは CloudWatch の /aws/sagemaker/LabelingJobs

Ground Truth は新規のお客様には提供されていません(公式が明記。既存利用者は継続利用できるが、新機能の追加予定は無い)。A2I も同じ扱いです。試験ガイドの In-Scope に載っている以上「知らない」で済ませられませんが、新しい設計の第一候補として選ばせる問題は作りにくいという前提で読むと、出題の重心が見えます。

何に使うか

用途使い方関連する試験ドメイン
画像のラベリングバウンディングボックス/画像分類(単一・複数ラベル)/セマンティックセグメンテーションD1
テキストのラベリング固有表現抽出(NER)/テキスト分類(単一・複数ラベル)D1
動画・3D点群動画分類・フレーム物体検出・物体追跡/3D点群の物体検出・追跡・セマセグD1
既存ラベルの検証と修正ラベル検証・調整タスクタイプ(前のジョブの出力を人が直す)D5
評価用の正解データ作り人手ラベルを評価セット(ゴールデンデータセット)の材料にするD5
組み込みで足りない作業カスタムラベリングワークフローで自前 UI とツールを与えるD1
逐次流れてくるデータストリーミングラベリングジョブ(動き続けるジョブに新しいオブジェクトを送り続ける)D1

試験でどう問われるか

主役では出ません。「この要件に人手は要るのか、要るならどの段階か」を分ける選択肢の1つとして出ます。A2I との取り違えが本命で、ここだけは確実に1問拾えます。

問われ方正解に寄る条件引っかけの選択肢
人手を入れる位置学習・評価に使うデータへ、これからラベルを付ける → Ground Truth「本番の推論のうち低信頼度のものを人が見る」に Ground Truth を選ぶ(正解は A2I)
逆向きの出題稼働中のモデルの低信頼度の予測や、ランダム抽出した予測を人がレビューする → A2I(Textract・Rekognition・Comprehend・Transcribe・Translate・自前モデルと組む)Ground Truth のラベリングジョブを立てる案
機密データの扱い社外に出せないデータ → 私設ワークフォース(Amazon Cognito または自前の OIDC IdP で管理)Mechanical Turk(不特定多数の独立契約者に配られる)
ラベリングコストを下げたい大量データで組み込みタスクタイプに該当 → 自動データラベリング(アクティブラーニング)「人手をゼロにできる」と読める選択肢(低信頼度のものは人に回る)
自動ラベリングが使えない条件**カスタムタスクタイプは非対応。ストリーミングラベリングジョブも非対応。**対応は画像分類(単一)・セマセグ・物体検出・テキスト分類(単一)の4種のみ「どのタスクタイプでも自動化できる」
FM 向けの選好データ組み込みタスクタイプの一覧にモデル応答のランキングや選好比較は無い。やるならカスタムラベリングワークフロー「RLHF 用の組み込みタスクタイプを使う」

ワークフォースは Ground Truth と A2I で共通です(公式が「work teams は Ground Truth のラベリングジョブまたは A2I の人間レビュータスクに割り当てる」と書いています)。「同じ作業者基盤を使う=同じサービス」ではありません。共通なのは人の側だけで、いつ人を呼ぶか(学習前か、推論後か)が別物です。ここを混ぜた選択肢が最もよく出ます。

実務でどう使うか

  • 自動データラベリングには下限があります。 許容される最小オブジェクト数は 1,250、ただし公式の強い推奨は 5,000以上。これを下回る規模で有効にしても、ニューラルネットが閾値に届かず人手に落ちるだけです
  • 精度の基準は固定で、こちらから設定できません。 画像分類・テキスト分類はラベル精度95%相当の信頼度閾値、バウンディングボックスは平均 IoU 0.6、セマンティックセグメンテーションは平均 IoU 0.7が期待値として決め打ちされています
  • 最初のサンプルで10%を超えて失敗するとラベリングジョブごと落ちます。 指示文が不親切、ワーカーUIでデータが表示できていない、作業時間が足りない、のいずれかを疑う順序まで公式に書かれています
  • 自動ラベリングを有効にすると SageMaker の学習・推論コストが別途かかります。 使うインスタンスは Ground Truth が管理し(EC2 のダッシュボードには現れません)、画像系の学習は ml.p3.2xlarge クラスです。人件費は下がるがコンピュート費は増えるのがこの機能の実像です
  • 検証セットの比率も自動で決まります。 入力が5,000未満なら全体の20%、5,000超なら10%が検証に回ります
  • 自動ラベリングで得たモデルをそのまま本番推論に使わない。 公式が「使うならファインチューニングまたはテスト、あるいは両方をしてから」と明記しています。ジョブの成果物はラベルであって、製品版のモデルではありません

ラベリングの費用は「人件費+コンピュート費」の2階建てです。自動データラベリングを有効にすると人手は減りますが、その分 SageMaker の学習ジョブとバッチ変換(推論)が走ります。データ量が小さいほど、この2階部分だけが乗って割高になります。最小1,250という下限は「そこから使える」ではなく「そこまで下げると意味が薄い」の目安として読みます。

取り違えやすいもの

迷う相手切り分けの一言
Amazon Augmented AI(A2I)時系列で分かれます。 Ground Truth は学習の前(データにラベルを付ける)、A2I は推論の後(出た予測を人が見る)。ワークフォースは共通
SageMaker Data WranglerData Wrangler は既にあるラベル・特徴量を機械的に変換する。Ground Truth は存在しないラベルを人間に作らせる。人手が要るかどうかが境目
SageMaker ProcessingProcessing は人が1人も出てこないバッチ処理。Ground Truth の出力マニフェストを後段で整形するのが Processing の仕事
Bedrock Model Evaluations の人間評価Bedrock 側の評価はFM の出力を採点する。Ground Truth は入力データに正解を付ける。採点対象がモデルかデータかで分かれる
Mechanical Turk 単体MTurk は作業者のマーケットプレイス。Ground Truth はその上にタスクUI・マニフェスト・アクティブラーニングを載せたもの

想起チェック

Q1. 「本番の Textract の抽出結果のうち、信頼度が低いものを人間が確認したい」。Ground Truth ですか。

いいえ、A2I です。 Ground Truth は学習データにラベルを付ける側で、稼働中の推論結果をレビューするのは A2I の人間レビューワークフローです。

Q2. 自動データラベリングを使うと決めた。まず確認すべき2つの条件は?

タスクタイプとデータ量です。対応するのは画像分類(単一)・セマセグ・物体検出・テキスト分類(単一)の4種のみで、カスタムタスクタイプは対象外。最小1,250オブジェクト、推奨は5,000以上です。

Q3. 社外に出せない社内文書にラベルを付けます。どのワークフォースを選びますか。

私設(プライベート)ワークフォースです。Amazon Cognito か自前の OIDC IdP で自社の従業員・契約者を管理します。Mechanical Turk は不特定多数に配られるので選べません。

Q4. FM の応答を人間に順位付けさせて選好データを作りたい。組み込みタスクタイプはありますか。

ありません。 組み込みタスクタイプは画像・テキスト・動画・3D点群のラベリングで、応答のランキングや選好比較は含まれていません。やるならカスタムラベリングワークフローで自前 UI を作る形になります。

出典(AWS公式)