← 返回工具箱

SEO / 站长

robots.txt 生成与测试

直接编辑完整规则,按搜索引擎常用解释方式测试 User-agent 分组、Allow / Disallow、通配符与最长路径命中。

robots.txt 管的是抓取,不是密码、权限或可靠的删除索引手段。需要阻止页面出现在搜索结果时,还要结合noindex或访问控制;不要把敏感路径当成秘密写在这里。

规则编辑器

可直接粘贴线上 robots.txt,注释会保留在下载文件中。

HOW TO USE

发布前这样检查

1. 先写最终规则使用线上路径与正式 Sitemap 地址,不要把测试域名、后台密钥或私人目录列表留在文件中。

2. 用真实爬虫名测试分别测试 Googlebot、Bingbot 和目标 AI 爬虫。具体分组只与同等具体度的分组合并,不会自动叠加通配符组。

3. 上线后看原始响应把文件放在域名根目录的 /robots.txt,确认返回 200 与纯文本,再用站长平台和日志复查抓取。

规则解释参考Google robots.txt 文档。 不同爬虫对 Crawl-delay、Host、Content-Signal 等扩展指令的支持并不一致。

RELATED TOOLS

查看全部工具 →

USE & REVIEW

robots.txt 生成器常见问题

查看全部工具指南 →

robots.txt 禁止抓取后,页面就不会出现在搜索结果里吗?

不一定。robots.txt 主要控制爬虫是否访问 URL,不是可靠的删除索引方式。搜索引擎仍可能从外部链接发现地址,只是不读取页面内容。要让可访问页面退出索引,应允许搜索引擎抓取并返回 noindex;敏感内容则必须使用登录、权限或网络访问控制。

通配符 User-agent 规则会和 Googlebot 专用规则叠加吗?

按 Google 当前解释,不会。爬虫会选择名称匹配最具体的规则组;只有具体度相同的多个组才会合并。存在 Googlebot 专用组时,User-agent: * 组不会自动补进来,因此专用组里需要写全该爬虫真正要执行的规则。

Allow 和 Disallow 同时命中时听哪一条?

先比较匹配路径的具体长度,较长、较具体的规则优先;具体度相同且 Allow 与 Disallow 冲突时,采用限制较少的 Allow。例如 Disallow: /private/ 配合 Allow: /private/public-page 可以只开放更具体的公开路径。

robots.txt 的星号和美元符号怎样使用?

星号 * 可以匹配任意字符,结尾的 $ 表示必须在 URL 末尾结束。例如 Disallow: /*.pdf$ 可匹配以 .pdf 结尾的路径,但不会匹配 .pdf?download=1。不同爬虫的扩展支持可能不同,上线后应使用目标搜索引擎的测试工具或访问日志复查。

Crawl-delay 应该设多少,Googlebot 会遵守吗?

Crawl-delay 不是 robots.txt 核心标准的一部分,Googlebot 不采用该指令,其他爬虫是否支持及单位解释也不完全一致。遇到抓取压力时,优先修复缓存、响应速度和服务器容量,再在对应站长平台或爬虫文档中确认限速方式。

Content-Signal 能阻止 AI 训练或引用内容吗?

Content-Signal 目前属于扩展提案,并非所有机器人都会识别,也不等于合同、身份验证或技术访问控制。可以把它作为公开偏好声明,同时保留明确的许可条款、robots 规则和必要的权限控制;是否执行仍取决于访问方。