概念

Crawlクロール

クロールは、検索エンジンがURLを見つけ、ページを取得して内容を確認する処理です。検索に出ないときは、インデックス登録の前にGoogleが対象URLへアクセスできているかを切り分けます。

Crawlとは

30秒で理解

クロールとは、検索エンジンのクローラーがURLへアクセスし、ページの内容を取得する処理です。 Google検索では、Googlebotが新しいページや更新されたページを見つけ、テキスト・画像・動画などを読み取ります。

クロールは「検索結果に載った」という意味ではありません。クロールの後に、内容を解析してインデックスに登録する段階があります。検索に出ないページを調べるときは、順位を見る前に「GoogleがそのURLを取得できたか」を確認します。

クロールは、図書館員が新しい本を棚から回収する作業です。回収できなければ目録に載せられず、目録に載っても質問に合う本として案内されるとは限りません。ページの取得、登録、検索結果への表示を同じものとして扱わないのが切り分けの出発点です。

どういう仕組みか

Google検索では、ページが検索結果に至る流れを「クロール」「インデックス登録」「検索結果の提供」の3段階に分けて考えます。クロールは最初の段階です。

段階Google側で起きることサイト側で確認すること
URLの検出既知のページのリンクやサイトマップなどからURLを把握する対象URLへ、クロール可能なリンクがあるか
クロールGooglebotがURLへリクエストし、レスポンスを受け取るrobots.txt、サーバーエラー、ログイン制限がないか
インデックス登録取得した内容を解析し、検索用のデータとして保存するnoindex、重複、正規URLなどの状態
検索結果の提供検索語に合うページを選び、結果に表示する検索パフォーマンスと実際の検索結果

Googleは、見つけたURLをすべて必ずクロールするわけではありません。クロールの頻度や取得するページ数は自動的に決まり、サーバーの応答やアクセス制限も影響します。サイトマップはURLを知らせる手段ですが、クロールやインデックス登録を保証するものではありません。

どこで確認するか

特定のページがクロールされているかを確認する場所は、Search Consoleの「URL検査」です。対象プロパティを選び、上部の検査欄に完全なURLを入力します。

確認したいこと開く場所結果の読み方
GoogleがURLを知っているかURL検査 → 検出参照元やサイトマップなど、URLを見つけた経路を見る
取得できたかURL検査 → クロールクロールの可否、最後のクロール日時、障害の有無を見る
直近の公開状態を確認したいURL検査 → ライブテスト現在のページをリアルタイムに取得できるかを見る
未登録の理由を調べたいページのインデックス登録「検出 - インデックス未登録」など、登録段階の理由を読む

「URLはGoogleに登録されています」と表示されても、検索結果への表示が保証されるわけではありません。逆に、クロールできていない段階でタイトルや本文を直しても、その変更はGoogleに届きません。まず取得の成否、次に登録状態の順で見ます。

よくある誤解

robots.txtは、ページを検索結果から隠すための機能ではありません。主な用途はクローラーがアクセスできるURLを伝え、クロールする対象やトラフィックを管理することです。検索結果から確実に除外したいページでは、noindexやパスワード保護など、目的に合う方法を使います。

誤解実際に切り分けること
クロールされたら検索結果に出るクロール後のインデックス登録と検索結果への表示を別々に確認する
サイトマップを送れば必ずクロールされるURLを知らせる補助であり、URL検査のクロール結果を確認する
robots.txtに書けば検索結果から消えるクロール制御とインデックスからの除外を分け、除外にはnoindexなどを使う
URL検査のライブテストが通れば登録済みライブテストは現在の取得結果で、登録時の重複や正規化まで全て判定するものではない
クロール頻度が高いほど順位が上がるクロールとランキングを別の問題として扱い、検索パフォーマンスで表示状況を見る

これを踏まえて何をするか

ページが検索に出ないときは、対象URLを1つに絞って次の順に確認します。途中で原因が見つかったら、修正後に同じ画面へ戻って結果を見直します。

順番開く場所操作次の判定
1Search Console → URL検査対象URLを入力するURLがGoogleに登録されているか、未登録かを控える
2URL検査 → クロールクロールの可否と最後のクロール日時を見る取得エラー、robots.txtによるブロック、認証要求があれば先に直す
3URL検査 → ライブテスト「公開URLをテスト」を実行し、現在のページを取得する公開中のサーバーでも失敗するなら、HTTP応答・ネットワーク・アクセス制限を調べる
4Search Console → ページのインデックス登録対象URLに該当する未登録理由を開く「クロール済み - インデックス未登録」なら、クロール後の登録問題として内容や重複を確認する
5URL検査 → インデックス登録をリクエスト修正済みの公開URLでリクエストする受付後も即時反映を前提にせず、後日同じURL検査で状態を確認する

最初に押す場所は、Search Consoleの上部にある「URL検査」です。サイト全体の数字を見る前に、検索に出ないURLを1つ入力し、「クロール」の結果に表示された理由を開いてください。

一次情報

普遍的な内容なので、定期の見直し対象にしていません。