Crawlとは
30秒で理解
クロールとは、検索エンジンのクローラーがURLへアクセスし、ページの内容を取得する処理です。 Google検索では、Googlebotが新しいページや更新されたページを見つけ、テキスト・画像・動画などを読み取ります。
クロールは「検索結果に載った」という意味ではありません。クロールの後に、内容を解析してインデックスに登録する段階があります。検索に出ないページを調べるときは、順位を見る前に「GoogleがそのURLを取得できたか」を確認します。
クロールは、図書館員が新しい本を棚から回収する作業です。回収できなければ目録に載せられず、目録に載っても質問に合う本として案内されるとは限りません。ページの取得、登録、検索結果への表示を同じものとして扱わないのが切り分けの出発点です。
どういう仕組みか
Google検索では、ページが検索結果に至る流れを「クロール」「インデックス登録」「検索結果の提供」の3段階に分けて考えます。クロールは最初の段階です。
| 段階 | Google側で起きること | サイト側で確認すること |
|---|---|---|
| URLの検出 | 既知のページのリンクやサイトマップなどからURLを把握する | 対象URLへ、クロール可能なリンクがあるか |
| クロール | GooglebotがURLへリクエストし、レスポンスを受け取る | robots.txt、サーバーエラー、ログイン制限がないか |
| インデックス登録 | 取得した内容を解析し、検索用のデータとして保存する | noindex、重複、正規URLなどの状態 |
| 検索結果の提供 | 検索語に合うページを選び、結果に表示する | 検索パフォーマンスと実際の検索結果 |
Googleは、見つけたURLをすべて必ずクロールするわけではありません。クロールの頻度や取得するページ数は自動的に決まり、サーバーの応答やアクセス制限も影響します。サイトマップはURLを知らせる手段ですが、クロールやインデックス登録を保証するものではありません。
どこで確認するか
特定のページがクロールされているかを確認する場所は、Search Consoleの「URL検査」です。対象プロパティを選び、上部の検査欄に完全なURLを入力します。
| 確認したいこと | 開く場所 | 結果の読み方 |
|---|---|---|
| GoogleがURLを知っているか | URL検査 → 検出 | 参照元やサイトマップなど、URLを見つけた経路を見る |
| 取得できたか | URL検査 → クロール | クロールの可否、最後のクロール日時、障害の有無を見る |
| 直近の公開状態を確認したい | URL検査 → ライブテスト | 現在のページをリアルタイムに取得できるかを見る |
| 未登録の理由を調べたい | ページのインデックス登録 | 「検出 - インデックス未登録」など、登録段階の理由を読む |
「URLはGoogleに登録されています」と表示されても、検索結果への表示が保証されるわけではありません。逆に、クロールできていない段階でタイトルや本文を直しても、その変更はGoogleに届きません。まず取得の成否、次に登録状態の順で見ます。
よくある誤解
robots.txtは、ページを検索結果から隠すための機能ではありません。主な用途はクローラーがアクセスできるURLを伝え、クロールする対象やトラフィックを管理することです。検索結果から確実に除外したいページでは、noindexやパスワード保護など、目的に合う方法を使います。
| 誤解 | 実際に切り分けること |
|---|---|
| クロールされたら検索結果に出る | クロール後のインデックス登録と検索結果への表示を別々に確認する |
| サイトマップを送れば必ずクロールされる | URLを知らせる補助であり、URL検査のクロール結果を確認する |
| robots.txtに書けば検索結果から消える | クロール制御とインデックスからの除外を分け、除外にはnoindexなどを使う |
| URL検査のライブテストが通れば登録済み | ライブテストは現在の取得結果で、登録時の重複や正規化まで全て判定するものではない |
| クロール頻度が高いほど順位が上がる | クロールとランキングを別の問題として扱い、検索パフォーマンスで表示状況を見る |
これを踏まえて何をするか
ページが検索に出ないときは、対象URLを1つに絞って次の順に確認します。途中で原因が見つかったら、修正後に同じ画面へ戻って結果を見直します。
| 順番 | 開く場所 | 操作 | 次の判定 |
|---|---|---|---|
| 1 | Search Console → URL検査 | 対象URLを入力する | URLがGoogleに登録されているか、未登録かを控える |
| 2 | URL検査 → クロール | クロールの可否と最後のクロール日時を見る | 取得エラー、robots.txtによるブロック、認証要求があれば先に直す |
| 3 | URL検査 → ライブテスト | 「公開URLをテスト」を実行し、現在のページを取得する | 公開中のサーバーでも失敗するなら、HTTP応答・ネットワーク・アクセス制限を調べる |
| 4 | Search Console → ページのインデックス登録 | 対象URLに該当する未登録理由を開く | 「クロール済み - インデックス未登録」なら、クロール後の登録問題として内容や重複を確認する |
| 5 | URL検査 → インデックス登録をリクエスト | 修正済みの公開URLでリクエストする | 受付後も即時反映を前提にせず、後日同じURL検査で状態を確認する |
最初に押す場所は、Search Consoleの上部にある「URL検査」です。サイト全体の数字を見る前に、検索に出ないURLを1つ入力し、「クロール」の結果に表示された理由を開いてください。