ひとことで言うと
自然言語データ拡張は、元の文に小さな変形を加え、同じラベルの学習例を増やす方法です。画像の微小な移動と違い、単語を少し変えただけで否定や固有名詞が変わり、文の意味そのものが変わります。
同じ設計意図を保ったまま仕様書の言い回しを変える作業に似ています。語順や語を変えられる箇所はありますが、部品番号や「禁止」の一語を変えると別の仕様になります。
なぜ必要か
テキストは収集・ラベル付けの費用が高く、少数データではモデルが表面的な語に過適合しやすくなります。EDAは分類文に対し、同義語置換、ランダム挿入、ランダム交換、ランダム削除の4操作を組み合わせます。原論文は5つの分類タスクでCNNとRNNを評価し、小規模データで特に効果が強いと報告しました。
ただし、増やした文が本当に同じラベルかを確認する工程は省けません。「この映画は良い」と「この映画は良くない」は、1語の追加で反対になります。ラベルが文全体の話題や感情なら軽いノイズが許されても、ラベルが語の位置や境界に結び付くタスクでは許容範囲が狭くなります。
変形回数を増やせばデータの質も上がるわけではありません。元のラベルを保つ確率が下がる操作を大量に混ぜると、データ不足を補う代わりに誤ラベルを増やします。
仕組み
文を単語列 、ラベルを 、拡張操作を とすると、作りたい例は です。ここで は単語数、 は同義語置換などの変換です。前提は の後もラベルが変わらないことですが、自然言語ではそれを機械的に保証できません。
| 操作 | 変えるもの | 典型的な限界 |
|---|---|---|
| 同義語置換 | 語を同義語候補へ置換 | 文脈・否定・専門用法で同義にならない |
| 挿入 | 語の同義語を別位置へ追加 | 不自然な文や意味の強調を生む |
| 入れ替え | 2語の位置を交換 | 語順が意味を担う言語では破壊的 |
| 削除 | 語を取り除く | 否定語・条件語・重要語を落とす |
同義語置換や挿入は語彙の揺らぎを増やしますが、辞書上の同義語は常に文脈上の同義語ではありません。交換や削除は意味を保つ可能性のあるノイズとして使えても、強度を上げるほど文法と意味の破綻が増えます。したがって、操作名を覚えるだけでなく、ラベル不変という条件を検証する必要があります。
逆翻訳は別の考え方です。単言語の目的言語文 を翻訳モデルで入力言語へ戻し、合成文 と元の を対訳 として加えます。元文を単語単位で壊すのではなく、翻訳という文全体の写像を通すため、語順や言い換えを含む別表現を得やすくなります。SennrichらはNMTの訓練でこの合成対訳を混ぜる方法を示しましたが、効果は逆翻訳モデルの品質やデータの量・テストデータとの類似度に依存すると述べています。
試験でどう問われるか
| 問われ方 | 正解に寄る条件 | 引っかけ |
|---|---|---|
| EDAの構成要素 | 置換・挿入・交換・削除の4操作 | 逆翻訳をEDAの4操作に含める |
| 操作の適用判断 | ラベル不変を確認し、強度を調整する | どの文にも同じ確率で適用する |
| 逆翻訳の流れ | 単言語文を反対方向へ翻訳し、元文と対にする | 元文を削除して翻訳文だけ学習する |
| 固有表現抽出への適用 | スパン境界とラベルを壊さないかを確認する | 語を削除・挿入しても常に同じラベルだとする |
実装で確かめる
単語列を配列として扱えば、交換と削除がどのように入力を変えるかを再現できます。実運用では、この後にラベル不変性の検査を置きます。
import numpy as np
tokens = np.array(["この", "映画", "は", "良い"])
rng = np.random.default_rng(0)
i, j = rng.choice(len(tokens), 2, replace=False)
tokens[[i, j]] = tokens[[j, i]]
keep = rng.random(len(tokens)) > 0.25
augmented = tokens[keep]
assert len(augmented) >= 0
取り違えやすいもの
| 手法 | 自然言語での役割 | 判断の軸 |
|---|---|---|
| 同義語置換・挿入 | 語彙の揺らぎを増やす | 文脈上の意味とラベルが保たれるか |
| 交換・削除 | 局所的なノイズを加える | 語順・否定・条件を壊さないか |
| 逆翻訳 | 文全体を別表現にして対訳を増やす | 翻訳品質とドメイン適合性 |
| 通常の正則化 | モデル側の過適合を抑える | 入力データ自体は増えない |
固有表現抽出では、ラベルが文全体ではなく「どの語の範囲が人名・組織名か」に付いています。たとえば固有表現の内部語を同義語に置換すると、表記として別の名前になり得ます。前後に挿入・削除を行えば、BIOタグの境界や隣接関係もずれます。このため分類で使えたEDAを、そのまま系列ラベリングへ移す判断はできません。
想起チェック
EDAの4操作は何か
同義語置換、ランダム挿入、ランダム交換、ランダム削除です。
逆翻訳が単語のランダム変形より意味を保ちやすい理由は何か
文全体を翻訳する写像を通して、語順や言い換えを含む表現を作るためです。ただし翻訳品質に依存します。
固有表現抽出で機械的な削除が危険な理由は何か
ラベルが文全体でなく語のスパン境界に付くため、語の削除や挿入で境界とタグの対応が崩れるからです。