robots.txt 是放在网站根目录下的一个文本文件,常见地址是 https://example.com/robots.txt。它的作用是告诉搜索引擎爬虫:哪些路径可以抓取,哪些路径不建议抓取。
很多新手会把 robots.txt 理解成“控制收录的开关”。这个说法不准确。robots.txt 主要控制的是抓取,不是绝对控制索引。一个 URL 即使被 robots.txt 禁止抓取,如果外部有链接指向它,搜索引擎仍然可能知道这个地址,并在搜索结果里显示一个没有内容摘要的结果。
robots.txt 是什么
robots.txt 是搜索引擎爬虫访问网站时通常会先读取的文件。它通过简单规则告诉不同爬虫哪些目录或文件不应该抓取。
一个常见写法如下:
User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Sitemap: https://example.com/sitemap.xml
这里的意思是:对所有爬虫生效,不建议抓取 /wp-admin/,但允许访问 admin-ajax.php,同时告诉爬虫站点地图地址。
robots.txt 对 SEO 的作用
- 减少无价值路径被抓取。例如后台路径、筛选参数、搜索结果页、重复列表页。
- 帮助爬虫找到站点地图。在文件里写入 Sitemap 地址,可以给搜索引擎一个明确入口。
- 降低重复页面干扰。对一些没有搜索价值的参数页,可以通过 robots.txt 减少抓取。
- 避免抓取资源浪费。大型网站页面很多时,抓取资源应该尽量留给重要页面。
对小型网站来说,robots.txt 不一定需要复杂配置。越复杂,越容易误伤重要页面。
robots.txt 不能解决什么问题
- 不能保护隐私。robots.txt 是公开文件,任何人都能访问。敏感目录不要靠它隐藏。
- 不能保证页面不被索引。如果页面已经被外部链接发现,仍可能以 URL 形式出现在搜索结果里。
- 不能替代 noindex。想让页面不被收录,更适合使用 noindex,前提是搜索引擎能抓取到该页面并看到 noindex。
- 不能修复低质量内容。屏蔽抓取不是内容优化,不能用来掩盖大量薄内容。
新手最常见的配置错误
- 误屏蔽整站。
Disallow: /会阻止所有路径被抓取,正式站不要随便使用。 - 屏蔽 CSS 和 JS。搜索引擎需要渲染页面,屏蔽样式和脚本可能影响页面理解。
- 把 robots.txt 当成安全工具。敏感文件应该通过权限控制、登录验证或服务器规则保护。
- 禁止抓取却希望 noindex 生效。如果页面被 robots.txt 挡住,搜索引擎可能看不到页面里的 noindex。
- 改版后忘记检查。测试环境规则如果带到正式站,可能导致重要页面无法被抓取。
哪些页面适合用 robots.txt 限制
适合限制的通常是没有搜索价值、容易产生重复、又不希望消耗抓取资源的路径。
- 后台管理路径,例如 WordPress 的
/wp-admin/。 - 站内搜索结果页。
- 大量筛选参数页,例如价格、排序、颜色组合生成的 URL。
- 临时文件、测试目录、无公开价值的脚本路径。
- 重复度很高的分页或参数组合,但要谨慎处理。
重要栏目、文章页、产品页、图片资源、CSS 和 JS 文件,一般不建议随便屏蔽。
robots.txt 和 noindex 怎么选
可以按目标来判断:
- 不想让爬虫抓取某类路径:用 robots.txt。
- 不想让页面出现在搜索结果里:用 noindex。
- 旧页面已经换地址:用 301 重定向。
- 页面永久删除且无替代内容:返回 404 或 410。
不要把所有问题都交给 robots.txt。它适合做抓取规则,不适合承担所有索引和页面质量问题。
配置前建议先检查这些地方
- 网站是否有重要页面被误写进 Disallow。
- 站点地图地址是否正确。
- 移动端、图片、CSS、JS 是否能被正常抓取。
- 测试环境和正式环境是否使用了不同规则。
- Google Search Console 里是否有抓取异常。
适合 WordPress 网站的基础写法
多数 WordPress 内容站可以从简单规则开始:
User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Sitemap: https://你的域名/sitemap.xml
如果你使用 SEO 插件生成 sitemap,要把上面的 Sitemap 地址换成插件实际输出的地址。不要照搬别人的 robots.txt,因为每个网站的目录结构、插件和参数规则都不同。
常见问题
robots.txt 文件一定要有吗?
不是必须,但建议有。即使规则很简单,也可以放入站点地图地址,并明确后台路径的抓取规则。
robots.txt 能让页面不收录吗?
不能保证。它主要是不让爬虫抓取。如果目标是禁止收录,通常应该用 noindex,而不是只靠 robots.txt。
修改 robots.txt 后多久生效?
文件更新后会立即对访问它的爬虫可见,但搜索引擎重新读取和反映变化需要时间。重要改动后,可以在 Google Search Console 里检查相关 URL。
总结
robots.txt 是 SEO 技术基础里很小但很容易出错的一部分。新手只要记住三点:它控制抓取,不等于绝对控制索引;不要屏蔽重要页面和资源文件;正式站改动前一定要检查规则。配置得当,它能减少无价值抓取;配置错误,也可能让重要页面失去抓取机会。
如果你正在系统检查网站基础设置,可以继续参考:网站 SEO 优化要素全过程对照表。
未经允许不得转载:Scrape SEO » robots.txt 对 SEO 有什么影响?新手配置避坑指南

Scrape SEO