robots.txt 是放在网站根目录的文本文件,告诉搜索引擎爬虫哪些页面可以抓取、哪些不能。对 SEO 来说这是一个基础但重要的配置。

robots.txt 适合做什么

robots.txt 适合控制搜索引擎爬虫对网站内容的访问。常见场景包括:

  • 禁止爬虫抓取管理后台、登录页面等内部区域。
  • 为部分支持 Crawl-delay 的爬虫提供抓取间隔建议。
  • 指定网站地图(Sitemap)的位置,帮助爬虫发现所有页面。
  • 阻止特定类型的爬虫(如 AI 训练爬虫)抓取网站内容。

基本使用步骤

  1. 打开 robots.txt 生成工具。
  2. 填写指令:
    • User-agent:指定规则适用于哪个爬虫(* 表示所有爬虫)。
    • Disallow:禁止爬虫访问的路径。
    • Allow:允许爬虫访问的路径(在 Disallow 块内使用)。
    • Sitemap:网站地图的完整 URL。
    • Crawl-delay:建议的抓取间隔(秒)。
  3. 点击生成,复制内容。
  4. 将内容保存为 robots.txt 文件,上传到网站根目录。

示例

一个典型网站的 robots.txt:

User-agent: *
Disallow: /admin/
Disallow: /private/
Allow: /public/

Sitemap: https://www.maowenben.com/sitemap.xml

Crawl-delay: 10

这个规则的含义:

  • 所有爬虫(*)适用。
  • 禁止抓取 /admin//private/ 路径。
  • 允许抓取 /public/ 路径。
  • 网站地图位于 https://www.maowenben.com/sitemap.xml
  • 建议两次抓取之间间隔 10 秒。

常见问题

Disallow 和 Allow 有冲突时怎么办? 通常会按更具体的路径规则优先处理,不同爬虫实现可能有细节差异。常见写法是先用 Disallow 禁用较大的目录,再用 Allow 放行其中某个更具体的子路径。

robots.txt 能防止别人看我的网页吗? 不能。robots.txt 是个“君子协议”,遵守规则的爬虫才会遵守它。不遵守规则的爬虫和用户直接用浏览器就能访问那些页面。真正需要保密的页面应该用登录认证等方式保护。

Sitemap 是必须的吗? Sitemap 可以帮助搜索引擎更快发现和索引网站页面,虽然不是必须的,但对 SEO 有益。建议在 robots.txt 中加入 Sitemap 声明。

相关工具推荐