robots.txt 是放在网站根目录的文本文件,告诉搜索引擎爬虫哪些页面可以抓取、哪些不能。对 SEO 来说这是一个基础但重要的配置。
robots.txt 适合做什么
robots.txt 适合控制搜索引擎爬虫对网站内容的访问。常见场景包括:
- 禁止爬虫抓取管理后台、登录页面等内部区域。
- 为部分支持 Crawl-delay 的爬虫提供抓取间隔建议。
- 指定网站地图(Sitemap)的位置,帮助爬虫发现所有页面。
- 阻止特定类型的爬虫(如 AI 训练爬虫)抓取网站内容。
基本使用步骤
- 打开 robots.txt 生成工具。
- 填写指令:
- User-agent:指定规则适用于哪个爬虫(
*表示所有爬虫)。 - Disallow:禁止爬虫访问的路径。
- Allow:允许爬虫访问的路径(在 Disallow 块内使用)。
- Sitemap:网站地图的完整 URL。
- Crawl-delay:建议的抓取间隔(秒)。
- User-agent:指定规则适用于哪个爬虫(
- 点击生成,复制内容。
- 将内容保存为
robots.txt文件,上传到网站根目录。
示例
一个典型网站的 robots.txt:
User-agent: *
Disallow: /admin/
Disallow: /private/
Allow: /public/
Sitemap: https://www.maowenben.com/sitemap.xml
Crawl-delay: 10
这个规则的含义:
- 所有爬虫(
*)适用。 - 禁止抓取
/admin/和/private/路径。 - 允许抓取
/public/路径。 - 网站地图位于
https://www.maowenben.com/sitemap.xml。 - 建议两次抓取之间间隔 10 秒。
常见问题
Disallow 和 Allow 有冲突时怎么办? 通常会按更具体的路径规则优先处理,不同爬虫实现可能有细节差异。常见写法是先用 Disallow 禁用较大的目录,再用 Allow 放行其中某个更具体的子路径。
robots.txt 能防止别人看我的网页吗? 不能。robots.txt 是个“君子协议”,遵守规则的爬虫才会遵守它。不遵守规则的爬虫和用户直接用浏览器就能访问那些页面。真正需要保密的页面应该用登录认证等方式保护。
Sitemap 是必须的吗? Sitemap 可以帮助搜索引擎更快发现和索引网站页面,虽然不是必须的,但对 SEO 有益。建议在 robots.txt 中加入 Sitemap 声明。
相关工具推荐
- 配置 robots.txt 的同时,可以用 Meta 标签生成器 设置页面级别的 SEO 信息。
- 完成配置后,可以用 搜索结果预览工具 检查标题和描述的显示效果。
- 如果需要查看 Meta 标签的效果,可以用 搜索结果预览。