robots.txt
测试器
robots.txt 中一行写错,就可能让你的整个网站对 Google——或对 ChatGPT——隐身。粘贴你的文件和网址,选择一个爬虫,看清究竟是哪条规则决定了每条路径。在你的浏览器中运行——不上传任何内容。
哪条规则胜出?一探究竟。
路径判定
| 路径 | 判定 | 决定性规则 |
|---|
文件健康度
Yetty 自动为每个网站撰写并提供正确的 robots.txt——包含站点地图行——并附带一键式 AI 爬虫控制。
爬虫究竟是
如何读你的文件的
只有一个组适用
爬虫会挑选点名它的最具体 User-agent 组。如果存在一个具体的组,* 组会被完全忽略——而不是合并。
最长路径胜出
规则不是从上到下读的。匹配路径最长的那条规则说了算——无论它在文件的哪个位置。
平局时 Allow 胜过 Disallow
长度相同、判定相反?Allow 规则胜出。这就是你在被屏蔽区域内开放某一个文件夹的方法。
通配符:* 和 $
* 匹配任意字符,$ 把规则钉在网址末尾。Disallow: /*.pdf$ 屏蔽所有 PDF,仅此而已。
一个字符的陷阱
Disallow: / 屏蔽一切。Disallow:(空)什么都不屏蔽。无数网站就因那一个斜杠而消失。
站点地图行
Sitemap: https://…/sitemap.xml 也属于 robots.txt——爬虫靠它无需猜测就能找到你的页面列表。
大家还问
我该如何测试我的 robots.txt 文件?
把你的 robots.txt 和一列路径粘贴到这个测试器,选择你关心的爬虫,你会得到每条路径的 ALLOWED 或 BLOCKED 判定,以及做出该判定的确切那一行。它应用爬虫真正使用的规则:最具体的 user-agent 组胜出,然后是最长的匹配路径,平局时 Allow 胜过 Disallow。
robots.txt 中规则的顺序重要吗?
不——这几乎让所有人吃惊。爬虫不会从上到下读规则。在适用于它们的组内,匹配路径最长的规则胜出,无论它在文件的哪个位置。如果一个 Allow 和一个 Disallow 以相同长度匹配,Allow 胜。顺序只对可读性有影响。
robots.txt 中只有一个斜杠的 Disallow 是什么意思?
Disallow: / 会为该组覆盖的任何 user-agent 屏蔽整个网站,因为每条路径都以斜杠开头。而空的 Disallow:(冒号后什么都没有)意思相反——什么都不屏蔽。一个字符就分开了"欢迎"和"走开",这正是测试胜过猜测的原因。
更多免费工具:
AI 能看到你的网站吗? ·
重定向链可视化器 ·
所有免费工具
更愿意再也不碰这个文件? 查看自动驾驶般的 SEO