robots.txt 屏蔽页面后,还需要 noindex 吗?
不要用 robots.txt 挡住一个需要读取 noindex 的页面。爬虫无法访问页面时就看不到 Meta Robots 或 X-Robots-Tag,URL 仍可能因外链而出现在结果中。要退出索引,应允许抓取并返回 noindex;敏感内容则使用登录和权限控制。
SEO / 索引控制
配置页面收录、链接跟随、摘要、图片和视频预览,生成 HTML Meta 标签或适用于 PDF、图片等资源的 HTTP 响应头。
DECISION GUIDE
RELATED TOOLS
USE & REVIEW
不要用 robots.txt 挡住一个需要读取 noindex 的页面。爬虫无法访问页面时就看不到 Meta Robots 或 X-Robots-Tag,URL 仍可能因外链而出现在结果中。要退出索引,应允许抓取并返回 noindex;敏感内容则使用登录和权限控制。
它允许爬虫在访问页面时读取链接,但不适合当作长期稳定的链接传递方案。页面持续 noindex 后,搜索引擎可能逐渐减少抓取,也不会把它当正常索引页面处理。重要链接应直接出现在可索引页面和站点导航中。
PDF、图片、视频和其他没有 HTML head 的资源适合由服务器或 CDN 返回 X-Robots-Tag。HTML 页面也可以用响应头,但要避免它与页面 Meta Robots 产生冲突。发布后应检查真实 HTTP 响应,而不是只看应用配置文件。
Google 当前把 noarchive、nocache 和 nositelinkssearchbox 列入历史或未使用规则,因此继续生成只会制造“已经控制缓存”的错觉。需要限制摘要时使用 nosnippet 或 max-snippet;需要保护原文则依靠访问权限、许可和服务端策略。
它们是支持方可采用的展示上限,不保证搜索结果一定有摘要、图片或视频。-1 通常表示不设长度上限,0 表示不允许对应预览;不同搜索引擎支持范围可能不同,应按目标爬虫的当前文档和线上结果复查。
它用于请求搜索引擎在指定时间后不再展示页面,但抓取与处理不是瞬时任务。重要下架还应同步更新页面状态、内链、Sitemap 和缓存;如果内容永久迁移,应使用重定向,如果页面永久消失则返回合适的 404 或 410。