無料プレビュー 2 / 16

クロール・インデックスの仕組み — Googlebotはどう動くか

学習目標

Googlebotのクロール・インデックス・ランキングの3フェーズを説明できる。robots.txt・sitemap.xml・noindexの役割を理解し、クロール最適化の基本対応を自社サイトで確認できる。

検索エンジンの3フェーズ

Googleが検索結果を表示するまでには3つのフェーズがある。

[クロール] → [インデックス] → [ランキング]
Googlebotが   コンテンツを      ユーザーの
ページを巡回  DBに登録する      クエリに応じて
して収集する                  順位を決定する

フェーズ1: クロール Googlebotと呼ばれる自動プログラムがWebページを巡回してHTMLを取得する。リンクを辿って新しいページを発見するため、内部リンク構造がクロール効率に直結する。

フェーズ2: インデックス クロールで収集したコンテンツを解析し、Googleのサーバー上のデータベースに登録する。このフェーズで「ページが何についての情報か」「品質はどうか」を評価する。インデックスされなければ検索結果に表示されない。

フェーズ3: ランキング ユーザーが検索クエリを入力したとき、インデックス済みのページを200以上の要素で評価して順位を決定する。主要な要素はコンテンツの関連性・品質、E-E-A-T、被リンク、ページ速度などである。

クロールを制御するファイル

robots.txt

robots.txtはサイトのルートに置くテキストファイルで、Googlebotへのクロール許可・拒否を伝える。

# 管理画面はクロール不要
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/

# 静的アセットはクロール許可
Allow: /wp-content/uploads/

# XMLサイトマップの場所を明示
Sitemap: https://example.com/sitemap.xml

よくある誤解: Disallowはクロールを禁止するが、インデックスを保証しない。他サイトからリンクされているページは、robots.txtで拒否していてもGoogleに認識される場合がある。

sitemap.xml

サイト内のURLを一覧にしたXMLファイル。大規模サイトや内部リンクが少ないサイトでは、サイトマップを提出することでクロール効率が向上する。

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://example.com/blog/seo-guide/</loc>
    <lastmod>2026-05-01</lastmod>
    <changefreq>monthly</changefreq>
    <priority>0.8</priority>
  </url>
</urlset>

WordPressを使っている場合は「Yoast SEO」や「All in One SEO」プラグインが自動生成する。Google Search Consoleからサイトマップを送信することで、Googleに優先的に認識させられる。

noindexメタタグ

ページのHTMLヘッダーに以下を記述すると、Googlebotはクロールするがインデックスしない。

<meta name="robots" content="noindex, follow">

使いどころ: 確認ページ・サンクスページ・フィルタリング結果ページ・重複コンテンツなど、検索結果に出てほしくないが内部リンクでは到達させたいページに使う。

クロール状況を確認する方法

  1. Google Search Console(無料): クロール統計・インデックス状況・カバレッジレポートで問題を特定できる。
  2. URLインスペクションツール: 特定URLがGoogleにどう認識されているかを確認できる。
  3. site:コマンド: site:example.comでGoogleにインデックスされているページ数を把握できる(概算)。

Claudeで試してみよう(15分)

以下のプロンプトをClaude Sonnetにコピー&ペーストして実行してください。

SEO担当者として、以下のWebサイトの状況を診断してください。

状況:
- WordPressで構築した中小企業のサービスサイト
- ページ数: 約150ページ
- Search ConsoleでみるとIndexed: 45ページ / Discovered, currently not indexed: 82ページ
- robots.txtには特別な設定なし
- サイトマップは未提出

質問1: 「Discovered, currently not indexed」が多い主な原因を5つ挙げてください
質問2: 優先度が高い順に対処方法を教えてください
質問3: サイトマップ未提出の影響と、WordPress向けの解決方法を教えてください

ファクトチェック手順: Claudeが提示した原因・対処法を実行する前に、必ずGoogle Search Consoleのヘルプドキュメント(クロールの問題を修正する)で確認すること。特に「crawl budget」や「duplicate content」の扱いはGoogleの公式見解と照合する。

観察ポイント:

  • 提示された原因のうち、自分のサイトに当てはまりそうなものはいくつか
  • 「インデックスされていない82ページはすべて改善すべきか?」とClaude に追加質問して、取捨選択の考え方を確認する

参考リンク

全 16 レッスンを、登録なしで無料で読めます。