E資格 概念別ノート
E資格に更新はありません。一度取れば一生有効です。ですが、この分野が受験当時のまま 止まっていてくれるわけがない。資格が更新を要求しないことと、知識が古びないことは別の話で、 そこを埋めるために書いている復習ノートです。シラバスの概念を1つずつ、 「ひとことで言うと・なぜ必要か・仕組み・試験でどう問われるか・実装で確かめる」で整理しています。
112 / 112 本(100%)
この教材の前提
| 対象シラバス | E2026#2(JDLA 公表) |
|---|---|
| 受験資格 | 受験申込の過去2年以内に JDLA 認定プログラムを修了していること |
| 立場 | JDLA とは無関係の個人ノート。過去問・シラバス本文の転載はしていません |
応用数学7 / 7
- 確率モデルの推定A 観測データの尤度が最大になるようパラメータを選ぶ最尤推定を軸に、負の対数尤度=損失・MAP推定・KLダイバージェンス最小化との等価性を整理する。
- 情報量とエントロピーA 自己情報量からシャノンエントロピー、交差エントロピー、KLダイバージェンスまでを式でつなぎ、分類の損失がなぜ交差エントロピーなのかを説明する。
- 分布間ダイバージェンスB 2つの確率分布の違いを測る量を、KLの向きとJSの性質から使い分けます。
- 条件付き確率と周辺確率A 同時分布から変数を消す周辺化と、観測済みの条件に応じて分布を絞る条件付き確率を、独立性や機械学習のモデル化と結び付けて整理する。
- ベイズ推論A パラメータを1点に決めず、事前分布をデータの尤度で更新して事後分布を得る推論の枠組みです。
- 尤度とMAP推定B データを固定してパラメータを評価する尤度と、事前分布を加えて一点を選ぶMAP推定を、正則化との対応まで整理します。
- KLとJSダイバージェンスB KLダイバージェンスの向きが生む違いと、対称化したJSダイバージェンスの性質を式と実装で整理します。
機械学習20 / 20
- k近傍法B 学習時にモデルを推定せず、予測時に入力へ近い訓練データを k 個探して分類・回帰する方法です。k、特徴量の尺度、探索コストが挙動を決めます。
- 距離尺度B ユークリッド・マンハッタン・コサインの測っているものを整理し、スケール、次元、Minkowski距離の p から距離尺度を選ぶノート。
- 学習パラダイムA 教師あり・教師なし・強化学習を「何が与えられ、何を最小化するか」で切り分け、半教師あり・自己教師あり・転移学習・表現学習がこの3分類のどこに乗るかを整理する。
- 汎化誤差A 未知データ上での期待損失そのもの。訓練誤差では測れず、i.i.d.仮定のもとでテスト誤差を不偏推定量として使う。
- バイアスとバリアンスA 推定量の平均二乗誤差を「ずれの向き(バイアス)」と「ばらつき(バリアンス)」に分解し、不偏性だけでは推定量の良し悪しを判断できないことを示す枠組み。
- 過学習と未学習A 訓練誤差とテスト誤差の動き方からモデル容量の過不足を判定し、容量不足側と容量過多側で違う対処を選ぶための整理。
- 次元の呪いB 次元が増えると入力空間の領域数が指数的に増え、同じデータ量では各領域を学習できなくなります。疎になる空間で何が壊れるかと、分散表現がそれを緩める理由を押さえます。
- データ分割B 訓練・検証・テストを役割で分け、評価データへの漏れを防ぐための設計を整理するノート。
- 交差検証B データを複数の組合せで訓練・評価し、未知データでの性能を一つの分割に依存せず見積もる手続き。
- 分類性能指標B 正解率だけに頼らず、誤りのコストとクラスの偏りに合わせて分類性能指標を選ぶための俯瞰ノート。
- ROCとAUCB 分類スコアの閾値を動かしたときのTPRとFPRの関係をROC曲線で読み、順位付けの性能をAUCで要約します。
- IoUとmAPB 検出の正解を決める IoU、適合率・再現率曲線を要約する AP、クラス平均の mAP を切り分け、IoU 閾値を変えた評価の読み方を確認します。
- 回帰性能指標B 回帰予測の誤差を、外れ値・単位・平均予測との比較という異なる観点から読むための指標整理です。
- 混同行列C 正解ラベルと予測ラベルの組合せを数え、TP・FP・FN・TNと分類指標の土台を作る表です。
- パープレキシティC 言語モデルの平均負の対数尤度を指数化した評価値で、低いほど次トークンを当てやすいことを表します。
- 近傍探索B クエリに距離が近いデータを探す処理を、厳密さ・速度・メモリの制約から選び分けるための整理です。
- ノルムと相関B ベクトルの大きさを測るノルムと、二つの変数の線形な連動を測る相関を整理し、距離計算と前処理での使い分けを確認する。
- 訓練検証テスト分割B 訓練・検証・テストの役割を分け、評価値に未来の情報を混ぜずにモデルの選択と最終確認を行うためのデータ分割です。
- 適合率再現率F値B 適合率・再現率・F1値を、見落としと誤検知のどちらを避けたいかという運用判断から使い分けます。
- 多クラス平均法C 多クラス分類のクラス別指標を、クラス単位・事例単位・support単位のどれでまとめるかを使い分ける方法。
深層学習80 / 80
- 多層パーセプトロンA 入力と出力の間に非線形の隠れ層を挟むことで、線形分離できない関数まで表現できるようにしたネットワーク構造。表現力の保証と学習できる保証は別物。
- 回帰損失B 回帰損失は外れ値への感度と、学習後に何を推定したいかで選びます。二乗誤差は条件付き平均、絶対誤差は条件付き中央値に対応し、Huber系は勾配の扱いやすさを両立します。
- 二値分類損失B 二値分類で確率の予測を対数尤度として測る損失です。シグモイドの出力を受け取る形と、ロジットを直接受け取る数値安定な形を使い分けます。
- 多クラス分類損失B softmax 出力と組み合わせる多クラス分類の損失を、logitsからの安定した計算、勾配、ラベル形式まで実装目線で整理する。
- 特殊な分類損失C 標準の交差エントロピーでは学習が偏る場面で、例の難しさやラベルの確信度を調整する損失を使い分けます。
- 活性化関数A 各層の出力に非線形性を入れる関数群。導関数の値域から勾配消失・出力の0中心・dying ReLU・計算コストが機械的に読める。
- 確率的勾配降下法A 1回の更新に使うサンプル数で、バッチ・確率的・ミニバッチ勾配降下法を切り分ける。勾配推定のノイズ、バッチサイズと学習率、並列化の関係を更新式から整理する。
- モメンタム法B 過去の更新方向を速度として蓄積し、細長い谷での振動を抑えながら勾配降下を進める方法です。
- 病的曲率C 損失地形の方向ごとの曲がり方が極端に異なると、勾配降下は狭い谷を横断して往復し、学習率の選択が難しくなります。
- 誤差逆伝播法A 出力側の誤差を連鎖律で入力側へ流し、全パラメータの勾配を順伝播1回分とほぼ同じコストで一度に求める手法。
- 自動微分A 数値を揺らさず、計算グラフに沿って連鎖律を自動適用し、入力数と出力数に応じた向きで微分を計算する手続き。
- 適応的最適化法B 座標ごとの勾配履歴から実効学習率を調整し、スケールや勾配の疎らさに左右されにくくする最適化の考え方です。
- パラメータ初期化B 重みを適当に置くのではなく、層をまたいで活性値と勾配のスケールを保つための設計です。ゼロ初期化の対称性、活性化関数ごとの Xavier / He の使い分け、正規化層との関係を整理します。
- ノルムペナルティB 損失にパラメータの大きさを測る項を加え、最適化で選ばれる重みの範囲を絞る仕掛けです。L2は重みを原点へ滑らかに寄せ、L1は座標軸上の解を選びやすくします。
- ドロップアウトB 訓練時にユニットを確率的に無効化し、共適応を崩す正則化手法です。推論時は訓練時のスケールを合わせる実装を忘れません。
- 陰的正則化A 明示的な正則化項を加えなくても、初期値・最適化・停止時点などの学習手続きが到達する解を絞るという見方です。大規模モデルの汎化を容量だけで説明できない反例と、まだ確定していない機構を切り分けます。
- 畳み込み演算A 畳み込みは小さな重みを入力上で共有して局所特徴を取り出す線形演算で、深層学習の実装では通常、カーネルを反転しない相互相関として計算されます。
- 特殊な畳み込みB 標準の畳み込みを空間範囲・出力解像度・サンプリング位置・チャネル重みの観点で変形する手法を整理します。
- プーリングB 局所窓の値を集約して特徴マップの空間サイズを下げる層。最大値と平均値の選択、stride、位置ずれへの性質を実装と出力形状で整理します。
- リカレントニューラルネットワークA 系列を1ステップずつ読み、過去を要約する隠れ状態を次の時刻へ渡すネットワーク。時間方向のパラメータ共有で可変長系列を扱える一方、BPTTでは長期依存の勾配が消失・爆発します。
- BPTTB RNNを時間方向に展開し、各時刻の損失から共有パラメータへ逆向きに勾配を集める手続きと、長い系列を区切るtruncated BPTTを整理します。
- ゲート付きRNNA LSTMとGRUは、状態を残すか更新するかを学習するゲートで、時間方向の勾配を運びやすくしたRNNです。
- 系列変換と注意機構A エンコーダが入力系列を固定長ベクトルへ圧縮し、デコーダが出力系列を生成する構成と、そのボトルネックを加法注意で緩和する仕組みを整理する。
- TransformerA 再帰も畳み込みも使わず、注意機構で系列内の位置同士を直接結び付けるエンコーダ・デコーダ型のモデルです。
- 画像データ拡張B 画像にラベルを保つ変換を施し、モデルが不変であるべき見え方を訓練時に学ばせる手法。変換の強さと適用範囲を誤ると、ラベルと矛盾したデータを作ります。
- 自然言語データ拡張B 文の意味やラベルを壊さない範囲で表現を変え、少ないテキストから学習例を増やす手法と適用限界を整理します。
- 正規化層A バッチ正規化と層正規化を、統計を取る軸と学習・推論時の違いから使い分けるためのノートです。
- 深層学習のアンサンブルB 独立に初期化して学習した複数の深層モデルの予測を平均し、精度と予測の不確実性を改善する実装パターンです。
- ハイパーパラメータ調整B 学習率を軸に調整の順序を決め、検証データで選び、探索の反復による過適合を早期打ち切りと最終テストで管理します。
- ハイパーパラメータ探索B グリッド探索・ランダム探索・ベイズ最適化を、試行の使い方と逐次的な打ち切りの観点で整理する。
- ResNetA 深さを増すと訓練誤差まで悪化する劣化問題に対し、入力を恒等写像で近道させ、残差を学習することで最適化を容易にしたネットワークです。
- Vision TransformerA 画像を固定サイズのパッチ列に変換し、クラストークンと位置埋め込みを加えてTransformerへ入力する画像認識モデルです。
- Faster R-CNNとMask R-CNNA RPNで候補領域の生成を学習に組み込み、共有特徴を使って二段階検出を高速化したFaster R-CNNと、マスク分岐・RoIAlignで画素単位の位置合わせを加えたMask R-CNNを整理します。
- YOLOとSSDA YOLOとSSDは、候補領域を別工程で作らず、画像から矩形・信頼度・クラスを一度のネットワーク評価で予測する一段階検出器です。YOLOのグリッド回帰とSSDのマルチスケール特徴・デフォルトボックスの違いを整理します。
- FCOSB アンカーボックスを置かず、各特徴点から物体の4辺までの距離を直接回帰する一段階検出器です。FPNの層別割り当てと中心度スコアで、低品質な予測を抑えます。
- セマンティックセグメンテーションA 画像の各画素にクラスを割り当てる密な予測です。FCNで空間情報を保ったまま推論し、転置畳み込みとスキップ接続で粗い特徴を画素解像度へ戻します。
- 単語埋め込みA 単語を共起する文脈から低次元の連続ベクトルへ写像し、Skip-gram や CBOW で単語間の近さを計算可能にする方法。
- BERTA Transformerエンコーダで左右の文脈を同時に扱う言語表現モデル。MLMとNSPで事前学習した重みを下流タスクへ移し、出力層を足してファインチューニングします。
- GPTとRAGA GPT系は大規模な自己回帰言語モデルを文脈内の例だけで適用し、RAGはパラメータ内の知識と外部検索する知識を組み合わせて生成します。
- 生成モデルと識別モデルA 生成モデルはデータとラベルの同時分布を、識別モデルはラベルの条件付き分布を学習します。分類だけなら識別モデルが効率的で、生成・欠損補完・異常検知まで扱うなら生成モデルを選びます。
- オートエンコーダB 入力を低次元の表現へ写してから再構成し、復元に必要な特徴を学習する決定的なニューラルネットワークです。
- VAEA 入力から潜在変数の分布を推定するエンコーダと、潜在変数からデータを生成するデコーダを組み合わせ、変分下限を再パラメータ化して学習する生成モデルです。
- GANA 生成器と識別器を競わせ、識別器が最適なら生成器がデータ分布との差を小さくするminimaxゲームとして学習する生成モデルです。
- 条件付きGANB 生成器と識別器の両方に条件を入力し、条件に合ったデータを生成・判定するGANです。
- DQNA ニューラルネットで行動価値関数を近似するQ学習に、経験再生と固定ターゲットネットワークを組み合わせて学習を安定させる構成。
- A3CB 複数の環境を非同期に走らせ、経験再生に頼らず相関を弱めながら方策と価値関数を同時に学習する手法です。
- 転移学習A あるタスクで学習した特徴を別タスクの初期値や固定特徴として再利用し、データや学習コストを抑える枠組み。層の深さ、タスクの類似度、データ量で微調整と特徴抽出を選びます。
- 半教師ありと自己教師あり学習A ラベルの有無で半教師あり学習と自己教師あり学習を切り分け、一貫性正則化・教師モデルの重み平均と、対照学習・データ拡張・投影ヘッドの役割を整理する。
- ペア比較の距離学習B 類似ペアを近づけ、非類似ペアをマージンまで遠ざける距離学習を、contrastive lossとペア設計の観点から整理する。
- 三つ組比較の距離学習B アンカー・正例・負例の距離を三つ組で比較し、正例が負例より近いという相対関係を埋め込み空間に学習させる方法。
- 判断根拠の可視化B 画像分類モデルの判断に寄与した領域を、勾配から可視化するCAM・Grad-CAMと顕著性マップの違いを整理する。
- モデルの近似解釈B 複雑な予測器を、予測点の近傍での線形近似やShapley値による寄与分配に置き換えて局所的に読む方法です。
- 重みとバイアスA 層の写像で、重みは入力の混ぜ方、バイアスは出力の基準位置を担います。パラメータ数の数え方と、初期化・実装上の登録までを確認します。
- MSEとMAEB 二乗誤差と絶対誤差の性質を、外れ値・推定される代表値・勾配の違いから使い分ける。
- ソフトマックスとone-hotB ロジットをクラス確率へ写像するソフトマックスと、正解クラスをベクトルで表すone-hotの対応を、安定実装と勾配まで確認するノート。
- シグモイド活性化B 実数を0〜1へ押し込む活性化関数です。導関数の上限0.25と出力の非ゼロ中心性を、隠れ層・二値分類・ゲート機構の使い分けに結び付けます。
- ReLU系活性化B ReLUの負側で勾配が止まる理由を起点に、Leaky ReLU・PReLU・ELU・GELUの負側の扱いと選択基準を整理します。
- tanh活性化C tanhは出力を-1から1へ収め、0を中心にする活性化関数です。勾配はシグモイドより通りやすい一方、飽和と勾配消失は残ります。
- 勾配降下法A 損失の勾配と学習率から更新量を決め、パラメータを損失の小さい方向へ反復的に動かす最適化手法。
- Nesterov加速B モメンタムで先に進んだ位置の勾配を使い、行き過ぎを早めに補正する最適化手法。
- Adam系最適化B 一次モーメントと二次モーメントで勾配を整え、パラメータごとに実効学習率を変える適応的な最適化手法です。
- XavierとHe初期化B 層を重ねても信号と勾配のスケールが崩れにくいよう、活性化関数の性質に合わせて重みの初期分散を決める方法です。
- L1とL2ペナルティB L1とL2の勾配・更新則の違いを、ゼロに止まる挙動と weight decay の実装まで結び付けて整理します。
- 早期終了B 検証誤差の改善が止まったら学習を打ち切り、最良のパラメータを採用する正則化手法。
- 受容野B ある出力画素に影響し得る入力上の範囲を、カーネル・ストライド・ダイレーションから追跡する設計指標です。
- 特徴マップとパディングB カーネルサイズ・ストライド・パディングから特徴マップの空間サイズを計算し、same と valid の違い、端の画素が受ける扱いを整理する。
- 深さ方向と点ごとの畳み込みB 畳み込みをチャネルごとの空間処理と1×1のチャネル混合に分け、計算量とモデルサイズを大きく削減する構成です。
- LSTMA 長期依存を学習するため、セル状態への加算経路と入力・出力ゲートを持たせ、時間方向の誤差を保持しながら記憶の書き込みと読み出しを制御するRNNです。
- GRUB GRUは更新ゲートとリセットゲートで隠れ状態を直接制御する、セル状態を持たないゲート付きRNNです。
- Self-AttentionA 同じ系列の入力をQuery・Key・Valueへ射影し、位置間の類似度でValueを重み付けして各位置の表現を更新する注意機構です。
- 正規化手法の使い分けA 正規化する軸をバッチ・特徴・グループ・インスタンスで見分け、バッチサイズ、系列長、学習と推論の条件から手法を選びます。
- Residual BlockA 入力を恒等ショートカットで足し戻し、主経路には入力からの残差だけを学習させるブロック。勾配の恒等経路、次元合わせの射影、ボトルネックの役割を式と実装で確認する。
- 物体検出の基本A 画像中の物体を分類するだけでなく、矩形の位置まで推定するタスクです。候補領域、分類・矩形回帰、IoU、NMS、mAPを一続きの処理として整理します。
- NMSとアンカーボックスB 重複する検出枠をIoUとスコアで整理するNMSと、予測の出発点として用意するアンカーボックスの設計を、実装判断につなげて整理します。
- パノプティック分割B stuff と thing を同じ画像上で扱い、全画素にクラスとインスタンス ID を割り当てる統合分割です。
- Word2vecB 文脈から語を予測する学習を通じて単語ベクトルを得る手法群です。CBOWとSkip-gram、負例サンプリングの役割と、語順を捨てる制約を整理します。
- BERT事前学習A BERTの事前学習を、双方向性を得るMLMと文間関係を学ぶNSPのタスク設計、マスクによる不一致の扱い、入力生成の順序から整理する。
- 自己回帰生成A 同時分布を条件付き確率の積に分解し、直前までに得た要素を条件として次の1要素を生成する枠組みです。
- 拡散モデルA データに段階的にノイズを加える過程を定め、その逆向きに各段階のノイズを予測して画像を生成する確率モデル。
- GANの学習安定化B GANで起きるモード崩壊や勾配消失を、分布間距離と識別器のリプシッツ制約の観点から切り分け、WGAN・勾配ペナルティ・スペクトル正規化の役割を整理します。
開発・運用環境5 / 5
- エッジ向けモデル軽量化A エッジ推論では、枝刈り・量子化・蒸留を「何を削るか」で選び、精度だけでなくメモリ帯域と実行カーネルまで含めて軽量化を判断します。
- 分散深層学習A 複数の計算資源で学習を分担し、同期SGDでは勾配を集約して1台の更新にそろえる。台数増加で実効バッチが大きくなるため、学習率・ウォームアップ・通信時間を一体で設計する。
- モデル並列とデータ並列B 何を複製し、何を分割するかで通信の中身が変わります。データ並列・モデル並列・パイプライン並列を、勾配と活性化の流れから切り分けます。
- アクセラレータ構成B GPU・行列演算器・メモリ階層が深層学習の計算量をどう支えるかを、CPUとの違いと実装上の律速点から整理する。
- コンテナ型仮想化B ホストのカーネルを共有してアプリケーションと依存関係を隔離する、軽量で再現性の高い実行方式です。仮想マシンとの差、GPU利用時に必要なランタイム、分離の限界を整理します。