トップページ > ClarityのBot Activityに「ページ分類」が入ったが、元データはCDNのログで接続が要る ── 自社のURLを種類分けして、ボットの多い種類を確認する13項目(2026年10月時点)

ClarityのBot Activityに「ページ分類」が入ったが、元データはCDNのログで接続が要る ── 自社のURLを種類分けして、ボットの多い種類を確認する13項目(2026年10月時点)

目次
  1. 01 何が起きたか — ClarityのBot Activityに、ボットの動きをページの種類ごとに見る「ページ分類」が入った
    1. 公式ブログが書いたこと
    2. できることは4つに整理されている
    3. この記事が書いていないことを先に決めておく
    4. Bot Activityの元データはCDNのログである
  2. 02 なぜ・背景 — URL1本ずつでは、ボットの偏りが見えない
    1. 数百のURLを1本ずつ見ても、偏りは見つからない
    2. ボットは名乗りと正体が一致しないことがある
    3. ボットが来ることと、内容が使われることは別である
    4. 費用は、Clarityではなく、つなぐ先にかかることがある
  3. 03 この記事で出てくる用語
    1. ページ分類(Page Classification)
    2. 独自カテゴリ(Custom Category)
    3. URLのパス
    4. CDN
    5. Logpush(ログ転送)
  4. 04 型別 — 適用範囲・この記事が確認していないこと・手順
    1. A. この記事が当てはまる範囲
    2. B. この記事が確認していないこと
    3. C. 手順の全体像 — 5つの順番で進める
    4. データがどこから来るかを、先に1枚で見ておく
    5. なぜ、先に自社のURLを数えるのか
  5. 05 明日、自社サイトで確認できることチェックリスト
    1. まず13項目を通して見る
    2. 観点別の内訳と、かかる時間
    3. 5分で終わらない項目があったとき
  6. 06 代替・他の選択肢(表で)
    1. ページの種類別にボットを見る手段は、1つではない
    2. それぞれの手段が「見られないこと」も知っておく
    3. Clarityのボットの集計と、Search Consoleのクロール統計は、見ているものが違う
    4. CDNのログ転送の費用は、文書によって書き方が違う
    5. ログがあるときの突き合わせ方
    6. 商品ページなどへのボットが多かったときの、次の確かめ方
  7. 07 当サイトで数えてみた結果
    1. 数えた範囲と方法
    2. 先頭の階層ごとの本数
    3. 4つの規則で、96.8%を種類分けできた
    4. この数え方の限界
  8. 08 このテーマの、これまで
    1. ClarityのBot Activityが追加されてきた順
    2. 5月の連携の紹介で、CDNが前提になった
    3. 公式ドキュメントの日付
    4. 当サイトの過去の記事 — ボットとログの話
    5. 数字は確認した時点のものとして扱う
  9. 09 この記事のまとめ

01 何が起きたか — ClarityのBot Activityに、ボットの動きをページの種類ごとに見る「ページ分類」が入った

用語

Bot Activity(ボットアクティビティ):Microsoft Clarityの画面の1つ。AIの仕組みやクローラー、自動で動くプログラムが、自社サイトのどのページを、どれくらいの頻度で読みに来ているかを見られる。(公式の説明にもとづく)

公式ブログが書いたこと

2026年9月22日、Microsoftが提供するアクセス解析ツール「Microsoft Clarity」の公式ブログに、「Introducing Page Classification in Clarity Bot Activity」(訳: ClarityのBot Activityにページ分類を導入します)という記事が載った。Bot Activityという画面の中で、サイトのページを種類ごとにまとめて、ボットの動きを見られるようになったという更新である。

"Page Classification groups your website pages by type, helping you analyze bot activity across your content rather than URL by URL."

(訳: ページ分類は、サイトのページを種類ごとにまとめ、URLを1本ずつ見るのではなく、コンテンツ全体でボットの動きを分析しやすくします。)

記事は、ボットの動きが数百から数千のURLに散らばっていると、サイトのどの部分が注目されているか、どんな種類のコンテンツに偏りがあるかが見えにくい、という問題から書き始めている。ページ分類は、その見えにくさを減らすための機能として紹介されている。

できることは4つに整理されている

公式ブログは、ページ分類を4つの働きに分けて説明している。1つ目は自動の分類、2つ目は種類ごとの集計、3つ目は自分で作れる分類、4つ目は自分の規則が優先されること、である。

"Clarity combines content-based classification with URL-based rules to identify page types, including websites with non-standard URL structures."

(訳: Clarityは、内容にもとづく分類とURLにもとづく規則を組み合わせて、ページの種類を見分けます。URLの付け方が標準的でないサイトも含みます。)

"Create custom categories with your own URL paths or add paths to existing categories such as Product, Blog, and Contact Us to better reflect your website’s structure."

(訳: 自分のURLのパスで独自のカテゴリを作るか、Product・Blog・Contact Usなど既存のカテゴリにパスを足して、サイトの構造をより正確に反映できます。)

"When you create custom classifications, they take priority over automatic classifications, giving you greater control over how pages are categorized."

(訳: 独自の分類を作ると、自動の分類より優先されます。ページをどう分類するかを、より細かく決められます。)

ブログには、使い方の例として、商品ページへのボットのアクセスがブログ記事より多い、特定の場所に動きが集中している、といった見つけ方が書かれている。自社のURLの規則を自分で決めて、ボットの動きを種類ごとに比べるのが、この機能の使いどころである。

公式情報

素材にした公式ブログ:Introducing Page Classification in Clarity Bot Activity(訳: ClarityのBot Activityにページ分類を導入します)(Microsoft Clarity公式ブログ・2026年9月22日)。英文の引用は、ページの文字を取り出した結果をそのまま写した。使うときは原文のページで確かめてほしい。

この記事が書いていないことを先に決めておく

公式ブログには、ページ分類を使える料金プランや、分類の正しさの程度、独自カテゴリを作れる数は書かれていない。ブログの末尾にあるのは、「Page Classification is available now in the Bot Activity dashboard」(訳: ページ分類は、いまBot Activityの画面で使えます)という一文だけである。この記事も、書かれていないことは書かない。自分の画面で確かめる項目として、05章のチェックリストに回した。

Bot Activityの元データはCDNのログである

今回の更新で、実務の上でいちばん大事なのは、Bot Activityのデータが、サーバー側のログから来ていることである。公式ドキュメントは、画面の冒頭に次の注意書きを置いている。

"The data displayed in this dashboard is based on real server-side logs collected through supported CDN and server integrations."

(訳: このダッシュボードに表示されるデータは、対応するCDNやサーバーとの連携を通じて集めた、実際のサーバー側のログにもとづきます。)

つまり、サーバーのログファイルを自分で開かなくても、種類別のボットの動きを見られる。ただし、それはCDN(配信を速くする仲介の仕組み)などをClarityにつないだ後の話である。この記事の軸は、ログを自分で開けない担当者でも、自社のURLの規則を決め、ボットが多い種類と少ない種類を比べるところまで進める手順を、順番に並べることである。

02 なぜ・背景 — URL1本ずつでは、ボットの偏りが見えない

数百のURLを1本ずつ見ても、偏りは見つからない

アクセスの記録を、URLごとに並べた表を思い浮かべてほしい。1位が記事のこのページ、2位が別の記事のこのページ、と続く表は、1本ずつの順位は分かるが、「記事の種類全体が多いのか」「ツールのページ全体が多いのか」は読み取りにくい。ページ数が増えるほど、1本ずつの数は小さくなり、種類としての偏りは数字の海に埋まる。

ボットは名乗りと正体が一致しないことがある

ボットの動きを数えるときは、名前の見分け方にも気を配る必要がある。Googleの公式ドキュメントは、Googleのクローラーが自分を示す方法を3つ挙げている。リクエストに付く利用者の名乗り(ユーザーエージェント)、リクエストの送信元のIPアドレス、そのIPアドレスの逆引きで出るホスト名、の3つである。名乗りだけでは、本物かどうかを決められない。

当サイトの過去の記事に、「AIクローラーが弾かれている」と読みかけた ── 日別に割ったら、正体は数十の名前を名乗る貸しサーバーだったがある。名前を名乗る文字列を数えただけでは、本物の数にならないという話である。Bot Activityの画面の数字は、AIの仕組みやその他の確認済み(verified)のボットが自社のコンテンツへ自動でアクセスした記録を反映したものだ、と公式ドキュメントは説明している("AI systems and other verified bots"、訳: AIの仕組みやその他の確認済みのボット)。自分で数える場合は、名乗りに加えて送信元も確かめる、という作業が増える。

ボットが来ることと、内容が使われることは別である

Bot Activityの公式ドキュメントは、画面の冒頭で、数字の読み方についても注意している。

"Bot activity represents requests made to your site and doesn't indicate that content was retrieved, grounded, cited, or surfaced in AI generated responses."

(訳: ボットの動きは、サイトに対して行われたリクエストを表します。内容が取得された、回答の根拠にされた、引用された、AIが作った回答に表示された、ということを示すものではありません。)

ボットが多い種類のページは、AIの回答に使われているページ、という意味ではない。多いのは、読みに来た回数である。使われたかどうかは、グラウンディング(回答の根拠にされたか)と引用のデータとあわせて評価する、とClarityのFAQも書いている("It is an upstream signal that should be evaluated alongside grounding and citation data."、訳: 上流の手がかりであり、回答の根拠にされたかと引用のデータとあわせて評価すべきものです)。この記事の13項目も、「多い種類を見つける」ところまでを扱い、「だから引用されている」とは結ばない。

費用は、Clarityではなく、つなぐ先にかかることがある

もう1つ、背景として知っておくことがある。Clarityの文書は、費用について次のように書いている。

"Microsoft Clarity does not charge for AI Visibility or the Bot Activity dashboard. However, enabling and running Bot Activity integrations might result in costs from your server, CDN, or cloud provider, depending on your configuration, traffic volume, and provider pricing model."

(訳: Microsoft Clarityは、AI VisibilityやBot Activityの画面に料金を請求しません。ただし、Bot Activityの連携を有効にして動かすと、設定、トラフィックの量、提供元の料金の仕組みによって、サーバー、CDN、クラウドの提供元から費用がかかることがあります。)

画面を見るだけなら無料でも、ログを送る側の契約で費用が出ることがある。この点は、つなぐ前に担当者へ伝えておく必要がある。05章の項目6と項目8は、そのための確認である。

03 この記事で出てくる用語

ページ分類(Page Classification)

サイトのページを、記事・商品・問い合わせのような種類にまとめて、種類ごとにボットの動きを見る機能。公式ブログによれば、自動で分ける仕組みと、自分で決める規則の両方がある。自分で決めた規則のほうが優先される。

独自カテゴリ(Custom Category)

自分のURLのパスを使って作る、自分用のページの種類。たとえば「/column/」で始まるURLを「コラム」という種類にする、といった使い方ができる。既存の種類(Product、Blog、Contact Usなど)に、パスを足すこともできる。

URLのパス

URLの中の、ドメインより後ろの部分。「https://example.com/blog/2026/post-1」なら、「/blog/2026/post-1」がパスである。パスの先頭の階層(この例では「/blog/」)が同じページは、同じ種類として扱いやすい。この記事の手順は、パスの先頭の階層で種類を決めることを土台にしている。

CDN

Content Delivery Networkの略。サイトの前に置かれる、配信を速くしたり、守ったりする仲介の仕組み。Cloudflare、Amazon CloudFront、Fastly、Akamai、Azure Front Doorなどがある。Bot Activityにつなぐ相手として、公式の文書に名前が挙がっているのは、この種類のサービスである。

Logpush(ログ転送)

CloudflareがCDNで受けたリクエストのログを、外へまとめて送る機能の名前。Clarityの文書によれば、Cloudflareの連携は、このログ転送の設定を1つ作ることで動く。連携を外すときも、この設定を消す作業になる。

04 型別 — 適用範囲・この記事が確認していないこと・手順

A. この記事が当てはまる範囲

当てはまるのは、Microsoft Clarityを使っている(または使おうとしている)サイトの運営担当者である。そのうち、自社のURLの付け方に規則がある(記事は「/blog/」、商品は「/products/」のように)サイトでは、手順がそのまま使える。URLに規則がないサイトは、自動の分類に任せる部分が増える。

サーバーのログを自分で開けない担当者を想定している。ただし、Bot Activityを見るには、CDNなどとの連携が前提になる。CDNを使っていないサイトは、この手順の後半(Clarityの画面)には進めない。その場合は、06章の「代わりの手段」から、自社に合うものを選んでほしい。

B. この記事が確認していないこと

  • ページ分類を使える料金プランや、利用の条件(公式ブログに書かれていない)
  • 自動の分類が、どれくらいの割合で正しく種類を当てるか(書かれていない)
  • 独自カテゴリを作れる数や、1つのカテゴリに入れられるパスの数(書かれていない)
  • 当サイトのClarityの画面で、ページ分類が実際にどう表示されるか(管理画面を開いて確かめていないため、当サイトのBot Activityの数字は載せない)
  • 日本語のURLや、パラメータ付きのURLが、どう分類されるか(書かれていない)

注意

ここに挙げた点は、公式の記述が見つからなかった、というだけで、「できない」とは限らない。つなぐ前と後に、自分の画面で確かめるのが確実である。

C. 手順の全体像 — 5つの順番で進める

手順は5つに分ける。1つ目は、サイトの中身を数えること。2つ目は、URLの先頭の階層で種類を決めること。3つ目は、CDNをClarityにつなぐこと。4つ目は、Bot Activityで種類ごとのボットの多い少ないを見ること。5つ目は、ログを見られる場合に、同じ分け方で突き合わせること。1つ目と2つ目は、Clarityの画面を開かなくても、公開しているサイトマップだけで進められる。

ボットの動きをページの種類で見るまでの5つの順番を示す図。1は数える、公開サイトマップを開いてURLの総数を控える。2は分ける、URLの最初の区切りで記事やツールなどの種類を決める。3はつなぐ、CDNをClarityにつなぐ。設定のAI Visibilityから進む。4は見る、Bot Activityで種類ごとのボットの多い少ないを比べる。5は照らす、サーバーのログを見られるなら同じ分け方で突き合わせる。
サイトの中身を数えて分け方を決めてから、画面で見る

データがどこから来るかを、先に1枚で見ておく

手順の3つ目で何をつなぐのかが分かりにくいので、データの流れを先に描いておく。サイトに届いたリクエストは、CDNがログとして記録し、Clarityに渡され、Clarityがボットを見分けて、Bot Activityの画面に集計する。公式ドキュメントによれば、Clarityの画面で連携を外しても、それだけではデータの流れは止まらない。

Bot Activityのデータの流れを示す図。ボットと人のリクエストが、CDNでログとして記録され、Clarityがログを受け取ってボットを見分け、Bot Activityがページ分類で種類別に集計する。下の注意書きは、Clarityの画面で接続を外してもCDN側の設定を外すまでログはClarityへ届き続けるという公式の説明。費用はClarityではなくCDNやクラウドの側にかかることがある。
つなぐ作業は、Clarityの画面だけでなく、CDNの側にも及ぶ

"Disconnecting an integration from the Microsoft Clarity dashboard only removes the Bot Activity dashboard within AI Visibility. It doesn’t stop data from flowing into Clarity by itself."

(訳: Microsoft Clarityの画面から連携を外しても、AI Visibilityの中のBot Activityの画面が消えるだけです。それだけでは、Clarityへのデータの流れは止まりません。)

なぜ、先に自社のURLを数えるのか

Clarityの画面を開いてから種類を考えると、画面に最初から入っている種類の名前に引きずられる。先に、自社のURLがどんな階層でできているかを数えておけば、「この階層は記事」「この階層はツール」と、自分の言葉で種類を決められる。決めた種類は、独自カテゴリの名前としても、ログを数えるときの区切りとしても、同じものが使える。

05 明日、自社サイトで確認できることチェックリスト

まず13項目を通して見る

以下は、明日、公開しているサイトマップとClarityの画面だけで、自社のURLを種類に分け、ボットの多い種類まで見つけるための項目である。チェックの状態はブラウザに保存され、サーバーには送信されない。1〜4番目がURLを数えて種類を決める作業、5〜6番目がCDNを確かめる作業、7〜8番目がClarityに接続する準備、9〜11番目がBot Activityで種類別に見る作業、12番目が独自カテゴリの作成、13番目がログとの突き合わせである。

実務のヒント

公開しているサイトマップがない場合や、URLの一覧を作りたい場合は、当サイトの🔧 sitemap.xml作成ツールで一覧を作ってから、項目1に進めると速い。自社のページの状態をまとめて見たいときは、🔧 WEBサイト総合分析・レポートツールも使える。

  • 自社の公開サイトマップ(/sitemap.xmlなど)をブラウザで開き、URLの総数を数えて書き留める
  • サイトマップのURLを、先頭の階層(/blog/、/products/など)ごとに数えて、多い順に上位5つの階層と件数を書き出す
  • 5つの階層を、記事・商品・問い合わせ・ツール・その他のように、自分の言葉の種類に割り当てて、1行1階層の表を1枚作る
  • 表に当てはまらなかったURLの本数を数えて、全体の何%かを書き、10%を超えるなら、残りの階層を1つずつ表に足す
  • 自社のサイトの前に置いているCDNが、Cloudflare・CloudFront・Fastly・Akamai・Azure Front Doorのどれか、契約書か管理画面で1つ確認する
  • 使っているCDNの料金のページを開き、ログを外へ送る機能について、「無料」「有料」「従量」のどれと書かれているかを書き留める
  • Clarityのプロジェクトを開き、設定のAI Visibilityの画面で、CDNの接続が済んでいるかを確認する
  • 接続が済んでいない場合は、接続の作業をする担当者と、費用を受け持つ部署を、それぞれ1人(1部署)決めて書く
  • 接続が済んでいる場合は、Dashboards > AI Visibility > Bot Activityを開き、Path requestsの上位10件のパスを書き出す
  • 9番目の10件を、3番目の表の種類に当てはめて、種類ごとに何件あるかを数える
  • 10番目の結果から、ボットが多い種類と少ない種類を1つずつ選び、全体の中の割合を書き留める
  • ページ分類の画面で、独自カテゴリを1つ作り、自社のURLのパスを1本入れて、該当するページがそのカテゴリに入ることを確認する
  • サーバーのログを見られる場合は、直近7日のうち1日分で、GPTBot・OAI-SearchBot・ChatGPT-Userの3つの名前の件数を数え、種類別の結果と照らす

観点別の内訳と、かかる時間

観点該当する項目目安時間
URLを数えて種類を決める1〜4番目(4項目)20分
CDNと費用を確かめる5〜6番目(2項目)10分
Clarityに接続する準備7〜8番目(2項目)10分
種類別に見る9〜11番目(3項目)15分
独自カテゴリを作る12番目(1項目)5分
ログと突き合わせる13番目(1項目)10分

すべてに目を通す時間の目安は、あわせて1時間10分ほどである(筆者の見積もりで、サイトの規模や権限によって変わる)。項目7〜8で接続が済んでいない場合は、項目9〜12は接続の後に回してよい。その場合でも、項目1〜6は、画面を開かずに進められる。

5分で終わらない項目があったとき

サイトマップが大きい、階層の数が多い、という場合は、上位5つの階層だけで十分である。残りは「その他」にまとめて、全体の何%かだけを書いておく。完全な表を作ることが目的ではなく、ボットが多い種類と少ない種類を比べられる形にすることが目的である。

06 代替・他の選択肢(表で)

ページの種類別にボットを見る手段は、1つではない

05章では、Clarityを使う前提で書いた。ただ、CDNを使っていない、Clarityを入れていない、という場合もある。ここでは、ページの種類ごとにボットの動きを見る手段を並べ、それぞれが見られることと、見られないことを表にまとめる。特定の製品の優劣ではなく、種類ごとの整理である。

それぞれの手段が「見られないこと」も知っておく

手段見られること見られないこと
ClarityのBot ActivityCDNのログにもとづく、ボットの種類・パスごとの件数。ページ分類で、種類ごとにまとめて見られるCDNをつなぐ前の動き。ボットが取った内容が、AIの回答に使われたかどうか
サーバーのログサーバーに届いたリクエストの、日時・パス・名乗り・送信元。URLの先頭の階層で数え直せるCDNで止められて、サーバーまで届かなかった分。名乗りが本物かどうか(送信元の確認が別に要る)
Search Consoleのクロール統計Googleのクローラーの動き(直近90日分)。ファイルの種類や応答の種類別Google以外のクローラーやAIの動き
CDNの管理画面の集計そのCDNが記録した、ボットの判定や遮断の件数(提供元によって内容が違う)CDNをまたいだ比較。ページ分類に当たる集計があるかは、提供元ごとに確かめる必要がある

いちばん確実なのは、2つ以上の手段で、同じ分け方を使って数えることである。Clarityの画面とサーバーのログで、種類ごとの多い少ないの順番が同じなら、読み方に自信が持てる。順番が違うなら、どちらかの集計の範囲が違っている。

Clarityのボットの集計と、Search Consoleのクロール統計は、見ているものが違う

上の表のSearch Consoleのクロール統計と、ClarityのBot Activityは、同じ「ボットの動き」を見ているように思えるが、元になる数字が違う。2つの公式文書を開いて、書かれていた範囲を並べた。

見る点ClarityのBot ActivitySearch Consoleのクロール統計
元になる数字「based on real server-side logs collected through supported CDN and server integrations」(訳: 対応するCDNやサーバーの連携で集めた、サーバー側の実際のログにもとづく)「statistics about Google's crawling history on your website」(訳: サイトに対するGoogleのクロールの履歴についての統計)
対象のボット「AI systems and other verified bots」(訳: AIシステムと、そのほかの確認済みのボット)Googleのクローラー。Google以外のクローラーについては、このページに書かれていなかった。
見られる期間Bot Activityの概要のページには、書かれていなかった。「past 90 days」(訳: 過去90日)
ページの種類ごとに見られるか見られる。ページ分類で、Product・Blog・Contact Usなどの種類にまとめられ、自分のURLのパスで作った分類のほうが、自動の分類より優先される。内訳は、応答の種類・ファイルの種類・クロールの目的・Googlebotの種類。商品ページや記事ページのような、ページの種類ごとの内訳は、書かれていなかった。
使うための条件対応するCDNかサーバーをつなぐことが必要。つなぐ先の事業者から、費用がかかることがある。「available only for root-level properties」(訳: ルートレベルのプロパティでのみ使える)

出典は、Bot Activity overview(訳: Bot Activityの概要)(Microsoft Learn)、Clarityの公式ブログ(ページ分類の記事)、Crawl Stats report(訳: クロール統計レポート)(Search Console ヘルプ)である。

Clarityの文書には、「doesn't indicate that content was retrieved, grounded, cited, or surfaced in AI generated responses」(訳: 内容が取得された、根拠として使われた、引用された、AIの回答に出た、ということを示すものではない)とも書かれている。つまり、数字は「来た」記録であって、「使われた」記録ではない。2つの画面で件数が合わなくても、不思議ではない。数えている相手も、数え方も違うためである。種類ごとの多い少ないの順番を比べるのが、この表の使い方になる。

CDNのログ転送の費用は、文書によって書き方が違う

05章の項目6で費用を確かめるのは、文書の書き方が一致していないためである。Clarityの費用の文書は、Cloudflareについて「LogPush is typically available on paid plans and might have usage-based pricing」(訳: Logpushは通常、有料プランで使え、使った量に応じた料金になることがあります)と書いている。一方、Cloudflareの公式ドキュメントのLogpushのページでは、取得した結果の対応表に、Free・Pro・Business・Enterpriseのすべてが「Yes」と書かれていた。

2つは、文書の日付や、扱うログの種類の違いで食い違って見えるのかもしれない。理由はここでは確かめていない。自分のプランで使えるか、使う量でいくらかかるかは、契約している画面で確かめるのが確実である。Akamaiについては、Clarityの費用の文書が「追加の費用の考慮はない」と書いている。

ログがあるときの突き合わせ方

サーバーのログを見られる場合は、名乗りの名前で数えるとよい。OpenAIの公式ドキュメントは、OpenAIのボットを3つに分けている。OAI-SearchBotは、ChatGPTの検索機能にサイトを表示するための名乗りである。GPTBotは、生成AIの基盤モデルを良くするためにコンテンツを集める名乗りである。ChatGPT-Userは、ChatGPTやカスタムGPTで、利用者の操作にもとづいてページを見に来る名乗りである。

項目13では、この3つの名前の件数を数えて、Clarityの種類別の結果と順番を比べる。件数そのものを合わせることが目的ではない。集計の範囲や時間帯が違えば、件数は合わないのが普通である。比べるのは、多い種類と少ない種類の順番である。

商品ページなどへのボットが多かったときの、次の確かめ方

ページ分類で、商品ページのような特定の種類にボットの動きが偏っていても、それだけで問題とは言えない。次の2つを、順に確かめるとよい。

  • robots.txtを開く。そのパスに、どんなルールを書いているかを見る。Googleの文書は、robots.txtを「tells search engine crawlers which URLs the crawler can access on your site」(訳: 検索エンジンのクローラーに、サイトのどのURLに入ってよいかを伝えるもの)と説明している。同じ文書は、従うかどうかはクローラー次第である、という趣旨も書いている(Introduction to robots.txt(訳: robots.txtの紹介)(Google Search Central))。
  • サイトの意図と合っているかを見る。そのページは、AIや検索に見つけてもらいたい内容か。見つけてもらいたいなら、多いことは歓迎してよい。そうでないなら、ルールの書き方を見直す候補になる。

いずれも、すぐにボットを止める話ではない。まず、自分のサイトの意図を決め、そのあとで書き方を合わせる順番である。

07 当サイトで数えてみた結果

数えた範囲と方法

当サイト(WEBサイトサポート)の公開サイトマップ(/sitemap.xml)を、2026年10月2日に取得した。サイトマップに載っているURLは315本だった。このURLを、パスの先頭の階層ごとに数えた。方法は、05章の項目1〜4と同じである。ClarityのBot Activityの画面は、この記事では見ていないため、ボットの件数は載せない。

先頭の階層ごとの本数

先頭の階層本数割合中身
/ai_ron/archives150本47.6%連載のブログ記事
/seo_article118本37.5%解説記事(この記事もこの種類)
/tool21本6.7%無料ツール
/blog16本5.1%運営者のブログ
その他(単独)10本3.2%トップ・規約・サイトの紹介など、各1本のページ
当サイトの公開サイトマップ315URLを、URLの先頭の階層で数えた棒グラフ。ai_ron/archivesが150本で47.6%、seo_articleが118本で37.5%、toolが21本で6.7%、blogが16本で5.1%、その他の単独のページが10本で3.2%。先頭の階層4種類だけで315本のうち305本、96.8%を種類分けできた。
先頭の階層だけで、サイトの96.8%を種類分けできた(2026年10月2日に取得)

4つの規則で、96.8%を種類分けできた

先頭の階層4つ(連載のブログ記事、解説記事、無料ツール、運営者のブログ)だけで、315本のうち305本を種類に分けられた。残りの10本は、それぞれ単独のページである。URLに規則があるサイトでは、4つほどの規則で、ほぼ全体を種類分けできる、というのが当サイトでの結果である。

Clarityの独自カテゴリに当てはめるなら、この4つのパスを4つのカテゴリにする形が、最初の出発点になる。残りの10本は、自動の分類に任せるか、「その他」にまとめる。

この数え方の限界

数えたのは、サイトマップに載っているURLの本数である。ボットが実際に読みに来るページの数や、読みに来た回数ではない。サイトマップに載せていないページ(検索結果のページ、会員向けのページなど)にも、ボットは来る可能性がある。種類ごとの本数が多いことは、種類ごとのボットの件数が多いことを、そのまま意味しない。本数は、件数を読むときの目安である。

08 このテーマの、これまで

ClarityのBot Activityが追加されてきた順

Bot Activityは、公式ブログで、順に機能が足されてきた。取得した公式ブログの一覧の日付で並べると、次のとおりである。

  • 2026年5月26日:Bot Activityの更新。ボットの動きを測る新しい方法と、CDNとの連携が紹介された
  • 2026年6月23日:Bot Analyticsに、robots.txtの違反が表示されるようになった
  • 2026年8月13日:AIのクローラーの動きと、実際の訪問を結びつける「scrape-to-referral」の見方が追加された
  • 2026年9月22日:ページ分類が追加された(この記事の主題)

5月の連携の紹介で、CDNが前提になった

5月26日の公式ブログは、Bot Activityのデータが、CDNとの連携で集められることを紹介した。対応するCDNとして、Fastly、Amazon CloudFront、Cloudflare、Azure Front Door、Akamaiが挙げられている。WordPressのサイトでは、最新のClarityのプラグインを使うと、自動で使える、と書かれている。

公式ドキュメントの日付

公式ドキュメントのBot Activityの概要ページの日付欄は、2026年7月30日付だった。費用のページと、連携を外すページの日付欄は、どちらも2026年5月11日付だった。FAQは、2026年9月8日付だった。日付欄は、文書の更新の日付であり、機能の追加の日付とは限らない。ページ分類の説明が、概要ページ側に入っているかどうかは、この記事では確かめていない。

当サイトの過去の記事 — ボットとログの話

当サイトには、ボットとログの記事が、いくつかある。AIは331回来たと書いた。実際は11,024回だった ── HTTPのログだけを52日間 見ていたは、数える範囲で結果が変わる話である。ボットが世界の57%を占めた日 — AIクローラー時代のアクセスログ、WEBディレクターが今知るべき数字は、ボットの割合の大きさを扱った。「守る」から「見分ける」へ ── Cloudflare Precursor GAが変えるbot対策と、WEBディレクターが今週確認すべき3点は、CDNの側で見分ける話である。

解説記事では、AIクローラーは1つではない ── robots.txt・llms.txtで「通す」「止める」を切り分ける(2026年9月時点)が、ボットの種類の分け方を扱っている。同じClarityの話題では、ClarityのAI Visibilityで、ブランド用語を自分で決められるようになった ── 自社名・商品名の書き方のゆれを洗い出して確認する14項目(2026年10月時点)が、引用の画面側の設定を扱った。この記事は、その隣にある、ボットの動きの画面側の話である。

数字は確認した時点のものとして扱う

Clarityの画面や文書は、更新が続いている。この記事で引いた文は、2026年10月2日に開いたページの内容である。画面の名前や、使える条件は、変わることがある。使うときは、公式のページと、自分の画面で、もう一度確かめてほしい。

ClarityのBot Activityに、ボットの動きをページの種類ごとに見る「ページ分類」が入った。元データはCDNのログで、接続が要る。自社のURLを種類分けして、ボットの多い種類を確かめる13項目を、公式が書いていない点と分けて整理した。
2025/05/31
THU
00:00:00

ブラウザ・OS 最新バージョン

毎日更新:2026-10-02 調査更新済
  • Android(stable) 未取得
  • Chrome Android(stable) 155.0.8059.30
  • Chrome iOS(stable) 155.0.8059.24
  • Chrome(beta) 156.0.8078.4
  • Chrome(dev) 156.0.8072.0
  • Chrome(stable) 155.0.8059.26
  • Edge(stable) 154.0.4258.37
  • Firefox(stable) 157.0
  • Opera(stable) 136.0.6008.80
  • Safari iOS(stable) 未取得
  • Safari(stable) 未取得
  • iOS(stable) 未取得

現在の貴方のIPアドレス

216.73.217.145

このサイトで書いている人

株式会社ツクルン

株式会社ツクルン

Webアドバイジング・クリエイター
池田南美夫
もうすぐ●●歳。ずっーと現役SE。日本にインターネットが上陸してから、ずっーと携わる。 ほんとは超アナログ人間のギター弾き、バンドマン。でも音楽活動とSE、案外似てる。