新站上线时,很多人会问两个文件:robots.txtsitemap.xml。它们都和搜索引擎有关,但作用完全不同。

一句话说:

  • robots.txt 是告诉爬虫哪些地方不建议抓。
  • sitemap.xml 是告诉爬虫哪些页面值得发现。

这篇用新站、博客、工具站、电商站的实际场景讲清楚怎么配,并配合 robots.txt 生成器Sitemap XML 生成器 使用。


robots.txt 是什么?#

robots.txt 放在网站根目录,例如:

txt已剪下 ✓
https://example.com/robots.txt

基本写法:

txt已剪下 ✓
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

这表示允许大多数爬虫抓取全站,并告诉它 sitemap 地址。

如果你要禁止某些路径:

txt已剪下 ✓
User-agent: *
Disallow: /admin/
Disallow: /api/
Sitemap: https://example.com/sitemap.xml

注意,robots.txt 是抓取建议,不是权限系统。敏感数据不能靠它保护,后台和接口仍然要做真正的鉴权。


sitemap.xml 是什么?#

sitemap.xml 是站点地图,列出你希望搜索引擎发现的页面。

简单示例:

xml已剪下 ✓
<url>
  <loc>https://example.com/tools/heic</loc>
  <lastmod>2026-07-07</lastmod>
  <changefreq>monthly</changefreq>
  <priority>0.7</priority>
</url>

sitemap 适合放:

  • 首页
  • 重要栏目页
  • 工具页
  • 文章页
  • 产品页
  • 文档页

不适合放:

  • 登录后才能看的页面
  • 搜索结果页
  • 低质量筛选页
  • 重复内容页
  • 临时测试页

新站怎么配置?#

新站最简单的配置:

txt已剪下 ✓
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

然后准备 sitemap,把重要页面列进去。对小站来说,别过度纠结 prioritychangefreq,更重要的是页面本身能正常访问、标题描述清晰、内部链接合理。

可以用 Sitemap XML 生成器 把 URL 列表整理成 XML,再把 sitemap 地址写进 robots.txt。


博客站怎么配置?#

博客站的重点是文章页和栏目页。

建议:

  • sitemap 包含首页、博客首页、文章页。
  • robots 不要误屏蔽 /blog/
  • 标签页和分页页要谨慎,质量不高就不要全放 sitemap。
  • 文章更新后同步更新 lastmod。

如果博客有很多重复标签页,sitemap 只放最重要的入口即可。


工具站怎么配置?#

工具站通常有很多独立工具页,每个工具页都可能对应一个明确搜索词,例如 HEIC 转换、JSON 格式化、图片压缩。

建议:

  • 每个正式工具页进 sitemap。
  • 工具箱首页也进 sitemap。
  • 每个工具页有独立 title、description、canonical。
  • 工具页之间做相关内链,例如 JSON 工具链接到 JSONPath、JSON Schema。
  • 草稿工具、测试工具不要放 sitemap。

如果你的工具是浏览器本地执行,也不影响收录。搜索引擎重点看页面内容、标题描述、可访问性和链接结构。


电商站怎么配置?#

电商站要注意筛选页和重复内容。

建议:

  • sitemap 放重要分类页和商品页。
  • 不要把所有排序、筛选、参数组合都放进 sitemap。
  • 缺货商品是否保留,要看是否还有搜索价值。
  • 用户中心、购物车、结算页不应进入 sitemap。

参数页面太多时,可以用 canonical、robots meta 或站内规则做控制,不要只依赖 robots.txt。


常见误区#

Disallow 就等于不收录吗?#

不一定。robots.txt 主要控制抓取,不等于一定不展示。如果页面已经被外部链接发现,搜索结果里仍可能出现 URL。真正不希望收录的页面,更适合用 noindex,但前提是搜索引擎能抓到这个指令。

可以用 Meta Robots 生成器 生成页面级 noindex 规则。

sitemap 里放了就一定会收录吗?#

不会。sitemap 是发现线索,不是收录保证。页面质量、重复程度、可访问性、站点整体信号都会影响收录。

robots.txt 能保护后台吗?#

不能。robots.txt 是公开文件,任何人都能看到。后台、接口、私密文件必须依靠登录验证、权限控制和服务器配置。

所有页面都要进 sitemap 吗?#

不需要。sitemap 应该放你希望被发现的正式页面,而不是把所有 URL 都塞进去。


小结#

robots.txt 管“能不能抓”,sitemap.xml 管“哪些页面值得发现”。新站上线时,最稳的做法是:

  1. robots.txt 不要误伤重要页面。
  2. sitemap.xml 放正式、可访问、有价值的页面。
  3. 重要页面写好 title、description 和 canonical。
  4. 用内部链接把工具页、文章页、栏目页串起来。

你可以先用 robots.txt 生成器 写抓取规则,再用 Sitemap XML 生成器 整理站点地图。