技術監査

AI Bot Crawler ファイアウォール: GPTBot、ClaudeBot、Perplexity アクセスを管理

robots.txt、Cloudflare WAF、およびサーバー ヘッダーを構成して、AI 検索ボットが不正行為をスクレイピングすることなくコンテンツのインデックスを作成できるようにします。

多くの企業は、AI クローラーに CAPTCHA 画面を表示する積極的な Cloudflare WAF チャレンジを誤って構成しています。その結果、ChatGPT と Perplexity はページにアクセスできず、会話の回答から除外されます。このマニュアルでは、未承認のスクレイパーをブロックしながら、検証済みの検索ボットを許可するための正確な WAF ルールを提供します。

AEO Direct Answerダイレクト アンサー / AI エグゼクティブ サマリー

AI Crawler ファイアウォールは、主要な生成検索プラットフォーム全体でボット アクセスを管理し、スクレイピングの過負荷を防ぎながら正規の検索ボットを許可する最適化された robots.txt ルールと Cloudflare WAF ポリシーを構成します。

ステップバイステップのチュートリアルとユーザーガイド

1

1. 既存の robots.txt ファイルを監査する

包括的な「Disallow: /」ディレクティブが GPTBot、ClaudeBot、または PerplexityBot をブロックしていないことを確認します。

2

2.Cloudflare検証済みボットWAFルールを構成する

公式 ASN と一致する検証済みのクローラー ユーザー エージェントに対して「チャレンジをスキップ」ポリシーを設定します。

3

3. cURL 経由で生の HTML 配信をテストする

端末からの GPTBot リクエストをシミュレートし、クリーンな HTML で即時の HTTP 200 応答を確認します。

4

4. ダッシュボードでボットのアクセスログを監視する

[AI クローラー分析] タブで、クローラーの訪問頻度と遅延を追跡します。

プロのヒントとエンジニアリングのベスト プラクティス

  • GPTBot (リアルタイム検索インデックス作成) と CCBot (広範なトレーニング スクレーパー) を区別します。
  • クローラーリクエストに対するサーバー応答時間 (TTFB) を 300 ミリ秒未満に維持します。
  • 公開ドキュメント ページで侵入的なクライアント側チャレンジ スクリプトを無効にします。

コードと技術の統合

検証済み AI ボット用の Cloudflare WAF カスタム ルール

検証済み AI ボット用の Cloudflare WAF カスタム ルールtext
(http.user_agent contains "GPTBot" and cf.bot_management.verified_bot) or (http.user_agent contains "ClaudeBot" and cf.bot_management.verified_bot) or (http.user_agent contains "PerplexityBot" and cf.bot_management.verified_bot) => Action: Skip (Bypass WAF Challenges & Deliver Raw HTML)

Related Documentation & Guides

All Articles