クロール・インデックスの仕組み — Googlebotはどう動くか
学習目標
Googlebotのクロール・インデックス・ランキングの3フェーズを説明できる。robots.txt・sitemap.xml・noindexの役割を理解し、クロール最適化の基本対応を自社サイトで確認できる。
検索エンジンの3フェーズ
Googleが検索結果を表示するまでには3つのフェーズがある。
[クロール] → [インデックス] → [ランキング]
Googlebotが コンテンツを ユーザーの
ページを巡回 DBに登録する クエリに応じて
して収集する 順位を決定する
フェーズ1: クロール Googlebotと呼ばれる自動プログラムがWebページを巡回してHTMLを取得する。リンクを辿って新しいページを発見するため、内部リンク構造がクロール効率に直結する。
フェーズ2: インデックス クロールで収集したコンテンツを解析し、Googleのサーバー上のデータベースに登録する。このフェーズで「ページが何についての情報か」「品質はどうか」を評価する。インデックスされなければ検索結果に表示されない。
フェーズ3: ランキング ユーザーが検索クエリを入力したとき、インデックス済みのページを200以上の要素で評価して順位を決定する。主要な要素はコンテンツの関連性・品質、E-E-A-T、被リンク、ページ速度などである。
クロールを制御するファイル
robots.txt
robots.txtはサイトのルートに置くテキストファイルで、Googlebotへのクロール許可・拒否を伝える。
# 管理画面はクロール不要
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
# 静的アセットはクロール許可
Allow: /wp-content/uploads/
# XMLサイトマップの場所を明示
Sitemap: https://example.com/sitemap.xml
よくある誤解: Disallowはクロールを禁止するが、インデックスを保証しない。他サイトからリンクされているページは、robots.txtで拒否していてもGoogleに認識される場合がある。
sitemap.xml
サイト内のURLを一覧にしたXMLファイル。大規模サイトや内部リンクが少ないサイトでは、サイトマップを提出することでクロール効率が向上する。
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://example.com/blog/seo-guide/</loc>
<lastmod>2026-05-01</lastmod>
<changefreq>monthly</changefreq>
<priority>0.8</priority>
</url>
</urlset>
WordPressを使っている場合は「Yoast SEO」や「All in One SEO」プラグインが自動生成する。Google Search Consoleからサイトマップを送信することで、Googleに優先的に認識させられる。
noindexメタタグ
ページのHTMLヘッダーに以下を記述すると、Googlebotはクロールするがインデックスしない。
<meta name="robots" content="noindex, follow">
使いどころ: 確認ページ・サンクスページ・フィルタリング結果ページ・重複コンテンツなど、検索結果に出てほしくないが内部リンクでは到達させたいページに使う。
クロール状況を確認する方法
- Google Search Console(無料): クロール統計・インデックス状況・カバレッジレポートで問題を特定できる。
- URLインスペクションツール: 特定URLがGoogleにどう認識されているかを確認できる。
- site:コマンド:
site:example.comでGoogleにインデックスされているページ数を把握できる(概算)。
Claudeで試してみよう(15分)
以下のプロンプトをClaude Sonnetにコピー&ペーストして実行してください。
SEO担当者として、以下のWebサイトの状況を診断してください。
状況:
- WordPressで構築した中小企業のサービスサイト
- ページ数: 約150ページ
- Search ConsoleでみるとIndexed: 45ページ / Discovered, currently not indexed: 82ページ
- robots.txtには特別な設定なし
- サイトマップは未提出
質問1: 「Discovered, currently not indexed」が多い主な原因を5つ挙げてください
質問2: 優先度が高い順に対処方法を教えてください
質問3: サイトマップ未提出の影響と、WordPress向けの解決方法を教えてください
ファクトチェック手順: Claudeが提示した原因・対処法を実行する前に、必ずGoogle Search Consoleのヘルプドキュメント(クロールの問題を修正する)で確認すること。特に「crawl budget」や「duplicate content」の扱いはGoogleの公式見解と照合する。
観察ポイント:
- 提示された原因のうち、自分のサイトに当てはまりそうなものはいくつか
- 「インデックスされていない82ページはすべて改善すべきか?」とClaude に追加質問して、取捨選択の考え方を確認する
参考リンク
- Google 検索セントラル「クロールとは」 https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers
- Google 検索セントラル「robots.txt の概要」 https://developers.google.com/search/docs/crawling-indexing/robots/intro
- Google 検索セントラル「サイトマップについて」 https://developers.google.com/search/docs/crawling-indexing/sitemaps/overview
- Google Search Console ヘルプ「インデックス カバレッジ ステータス レポート」 https://support.google.com/webmasters/answer/7440203
全 16 レッスンを、登録なしで無料で読めます。