技术审核

AI Bot Crawler 防火墙:管理 GPTBot、ClaudeBot 和 Perplexity 访问

配置 robots.txt、Cloudflare WAF 和服务器标头,以确保 AI 搜索机器人为您的内容建立索引,而不会滥用内容。

许多公司无意中配置了激进的 Cloudflare WAF 挑战,向 AI 爬虫呈现验证码屏幕。因此,ChatGPT 和 Perplexity 无法访问页面并将其从对话答案中排除。本手册提供了准确的 WAF 规则,以允许经过验证的搜索机器人,同时阻止未经授权的抓取工具。

AEO Direct Answer直接回答/人工智能执行摘要

AI Crawler Firewall 管理跨主要生成搜索平台的机器人访问,配置优化的 robots.txt 规则和 Cloudflare WAF 策略,允许合法的搜索机器人,同时防止抓取过载。

分步演练和用户指南

1

1.审核现有的Robots.txt文件

确保没有一揽子“Disallow: /”指令阻止 GPTBot、ClaudeBot 或 PerplexityBot。

2

2. 配置 Cloudflare Verified Bot WAF 规则

为与官方 ASN 匹配的经过验证的爬网程序用户代理设置“跳过挑战”策略。

3

3. 通过 cURL 测试原始 HTML 交付

模拟来自终端的 GPTBot 请求,以使用干净的 HTML 确认即时 HTTP 200 响应。

4

4. 在仪表板中监控机器人访问日志

在“AI 爬虫分析”选项卡中跟踪爬虫访问频率和延迟。

专业技巧和工程最佳实践

  • 区分 GPTBot(实时搜索索引)和 CCBot(广泛训练抓取工具)。
  • 将爬网程序请求的服务器响应时间 (TTFB) 保持在 300 毫秒以下。
  • 在公共文档页面上禁用侵入性客户端质询脚本。

代码和技术集成

针对已验证 AI 机器人的 Cloudflare WAF 自定义规则

针对已验证 AI 机器人的 Cloudflare WAF 自定义规则text
(http.user_agent contains \"GPTBot\" and cf.bot_management.verified_bot) or (http.user_agent contains \"ClaudeBot\" and cf.bot_management.verified_bot) or (http.user_agent contains \"PerplexityBot\" and cf.bot_management.verified_bot) => Action: Skip (Bypass WAF Challenges & Deliver Raw HTML)

Related Documentation & Guides

All Articles