tomai
登录
免费 · SEO工具

Robots.txt 检测工具

抓取任意网站的 robots.txt,实测某个爬虫能否访问某路径——按真实抓取规则判定,并显示决定性规则。

输入任意 http(s) 地址,带具体路径(如 /private/admin)也可以。工具会下载该网站的 robots.txt 并用这个精确路径来判断。
决定测试结果的爬虫。采用前缀匹配——"Googlebot" 同样适用于 Googlebot-News、Googlebot-Image……
输入网址并选择爬虫,然后点击"检查访问权限"。判定结果会告诉你:按照该网站真实的 robots.txt,这个爬虫能否访问该路径。

常见问题

结果到底意味着什么?

判定只针对一个(爬虫, 路径)组合:根据该网站真实的 robots.txt 得出"允许"或"禁止"。页面会显示规则来自哪个 User-agent 分组、由哪一条规则最终决定结果。匹配完全遵循 RFC 9309:最长匹配优先;长度相同时 Allow 优先于 Disallow;星号匹配任意字符(含斜杠);末尾 $ 表示锚定结尾;没有任何规则匹配时默认允许。值为空的 Disallow 是空操作,与主流搜索引擎的处理一致。

为什么 Googlebot 也匹配 Googlebot-News 和 Googlebot-Image?

RFC 9309 规定 User-agent 分组按爬虫产品令牌的"不区分大小写前缀"匹配——写给"Googlebot"的分组因此也管 Googlebot-News、Googlebot-Image、Googlebot-Video 等。网站正是利用这一点为一整族爬虫写一套规则。你也可以输入任意精确机器人名(如 "GPTBot" 或 "Baiduspider-image");如果网站有针对它的分组,则只应用该分组的规则。

这个工具会加载我的页面吗?robots.txt 从哪来?

只下载目标的 /robots.txt,绝不加载页面本身;因为浏览器无法直读其他域的 robots.txt(CORS 限制),下载由本网站服务器代为执行。抓取有限速、512 KB 上限、最多跟随 3 次重定向,并拒绝私有/保留地址。收到的文件完全在浏览器本地解析,无需账号,也不存储你的网址。

这款检测工具校验什么

以爬虫的视角看你的 robots.txt

抓取、解析并模拟——每条 Disallow 规则都用你自己的 URL 实测,逐条路径给出判定。

🕸️

真实规则、真实判定

下载网站真实的 robots.txt 并按搜索引擎同款方式判定——RFC 9309 最长匹配、同长度 Allow 优先、User-agent 前缀分组,绝无猜测。

⚖️

亮出决定性规则

除了"允许 / 禁止"徽章,还展示最终判定所依据的那条规则和它所属的 User-agent 分组,让你明白为什么——以及该改什么。

🆓

不加载页面、免登录、免费

只抓取公开的 robots.txt(绝不抓你的页面),经限量、512 KB 上限、拒绝私有地址的读取器执行。无需账号、无需积分。

相关工具

什么是 robots.txt 检测工具?

robots.txt 检测工具会下载一个网站的 robots.txt,并告诉你某个抓取代理到底被允许访问什么——判定方式与主流搜索引擎完全一致。robots.txt 是每个网站都可以发布的小型公开文本文件,用来声明哪些路径允许、哪些禁止爬虫访问(如 "Disallow: /admin/"、"Allow: /public/",按 User-agent 行分组对应不同爬虫)。它不是安全边界,但却是向搜索引擎和其他机器人传达抓取偏好的方式——而规则写错,是网页意外从 Google 消失的常见原因。本工具读取该文件并按 RFC 9309 执行匹配:最长匹配优先、同长度 Allow 优于 Disallow、星号匹配任意字符、末尾 $ 锚定结尾、规则分组对爬虫按产品令牌的不区分大小写前缀生效。

这款工具能显示什么

  • 针对某个精确(路径, 爬虫)组合的即时"允许 / 禁止"判定
  • 决定结果的规则及其所属 User-agent 分组
  • robots.txt 响应的 HTTP 状态(404 表示全部放行)
  • 找到的分组数、匹配规则数与 sitemap 行数统计
  • 原始 robots.txt 全文,供你核对

什么时候使用它

  • 上线新栏目之前,确认它对 Googlebot 确实可抓取
  • 排查页面在搜索结果中消失——先看是不是 robots 规则挡住了
  • 验证 Allow 覆盖是否真的压过了更早的 Disallow(常见误区)
  • 要放行新的机器人(AI 爬虫、图片机器人)时,确认它能走哪些路径

隐私说明:本工具会把您输入的网址发送到本网站服务器,由它下载目标的公开 robots.txt——绝不加载您的页面。解析在您的浏览器本地完成,结果会短暂缓存以节省带宽,无需账号,也不存储任何关于您的信息。

相关工具