Yetty公开测试版
免费工具

robots.txt
测试器

robots.txt 中一行写错,就可能让你的整个网站对 Google——或对 ChatGPT——隐身。粘贴你的文件和网址,选择一个爬虫,看清究竟是哪条规则决定了每条路径。在你的浏览器中运行——不上传任何内容。

免费,无需注册 在你的浏览器中运行——不上传任何内容 真实匹配规则,* 和 $ 通配符
测试任意文件

哪条规则胜出?一探究竟。

100% 私密——没有任何内容离开你的浏览器。

路径判定

路径 判定 决定性规则

文件健康度

    再也不用手动编辑 robots.txt?

    Yetty 自动为每个网站撰写并提供正确的 robots.txt——包含站点地图行——并附带一键式 AI 爬虫控制。

    真正的规则

    爬虫究竟是
    如何读你的文件的

    只有一个组适用

    爬虫会挑选点名它的最具体 User-agent 组。如果存在一个具体的组,* 组会被完全忽略——而不是合并。

    最长路径胜出

    规则不是从上到下读的。匹配路径最长的那条规则说了算——无论它在文件的哪个位置。

    平局时 Allow 胜过 Disallow

    长度相同、判定相反?Allow 规则胜出。这就是你在被屏蔽区域内开放某一个文件夹的方法。

    通配符:* 和 $

    * 匹配任意字符,$ 把规则钉在网址末尾。Disallow: /*.pdf$ 屏蔽所有 PDF,仅此而已。

    一个字符的陷阱

    Disallow: / 屏蔽一切。Disallow:(空)什么都不屏蔽。无数网站就因那一个斜杠而消失。

    站点地图行

    Sitemap: https://…/sitemap.xml 也属于 robots.txt——爬虫靠它无需猜测就能找到你的页面列表。

    快速解答

    大家还问

    我该如何测试我的 robots.txt 文件?

    把你的 robots.txt 和一列路径粘贴到这个测试器,选择你关心的爬虫,你会得到每条路径的 ALLOWED 或 BLOCKED 判定,以及做出该判定的确切那一行。它应用爬虫真正使用的规则:最具体的 user-agent 组胜出,然后是最长的匹配路径,平局时 Allow 胜过 Disallow。

    robots.txt 中规则的顺序重要吗?

    不——这几乎让所有人吃惊。爬虫不会从上到下读规则。在适用于它们的组内,匹配路径最长的规则胜出,无论它在文件的哪个位置。如果一个 Allow 和一个 Disallow 以相同长度匹配,Allow 胜。顺序只对可读性有影响。

    robots.txt 中只有一个斜杠的 Disallow 是什么意思?

    Disallow: / 会为该组覆盖的任何 user-agent 屏蔽整个网站,因为每条路径都以斜杠开头。而空的 Disallow:(冒号后什么都没有)意思相反——什么都不屏蔽。一个字符就分开了"欢迎"和"走开",这正是测试胜过猜测的原因。

    更多免费工具: AI 能看到你的网站吗? · 重定向链可视化器 · 所有免费工具
    更愿意再也不碰这个文件? 查看自动驾驶般的 SEO

    轮到你了

    带上你已有的网站。

    或者让 robots.txt 自己写自己。

    每个 Yetty 网站都自动提供正确的 robots.txt 和站点地图——欢迎爬虫、链接站点地图、零编辑。