Robots.txt 检测工具
抓取任意网站的 robots.txt,实测某个爬虫能否访问某路径——按真实抓取规则判定,并显示决定性规则。
⚠️ 无法检查该网站
- 检测路径
- 规则分组
- 决定性规则
原始 robots.txt
常见问题
结果到底意味着什么?
判定只针对一个(爬虫, 路径)组合:根据该网站真实的 robots.txt 得出"允许"或"禁止"。页面会显示规则来自哪个 User-agent 分组、由哪一条规则最终决定结果。匹配完全遵循 RFC 9309:最长匹配优先;长度相同时 Allow 优先于 Disallow;星号匹配任意字符(含斜杠);末尾 $ 表示锚定结尾;没有任何规则匹配时默认允许。值为空的 Disallow 是空操作,与主流搜索引擎的处理一致。
为什么 Googlebot 也匹配 Googlebot-News 和 Googlebot-Image?
RFC 9309 规定 User-agent 分组按爬虫产品令牌的"不区分大小写前缀"匹配——写给"Googlebot"的分组因此也管 Googlebot-News、Googlebot-Image、Googlebot-Video 等。网站正是利用这一点为一整族爬虫写一套规则。你也可以输入任意精确机器人名(如 "GPTBot" 或 "Baiduspider-image");如果网站有针对它的分组,则只应用该分组的规则。
这个工具会加载我的页面吗?robots.txt 从哪来?
只下载目标的 /robots.txt,绝不加载页面本身;因为浏览器无法直读其他域的 robots.txt(CORS 限制),下载由本网站服务器代为执行。抓取有限速、512 KB 上限、最多跟随 3 次重定向,并拒绝私有/保留地址。收到的文件完全在浏览器本地解析,无需账号,也不存储你的网址。
这款检测工具校验什么
- 抓取健康度 — 解析前先核验状态码、重定向链和 content-type;/robots.txt 位置若返回的是 HTML 页面会明确报错。
- 指令审计 — 未知指令会被标记出来(爬虫本就忽略它们);crawl-delay 按主流爬虫的上限做合理性检查。
- URL 模拟 — 粘贴路径即可逐条判定放行还是拦截,并引用精确命中的那一行。
- Sitemap 存在性 — 提取 Sitemap 声明并检查其可达性。
以爬虫的视角看你的 robots.txt
抓取、解析并模拟——每条 Disallow 规则都用你自己的 URL 实测,逐条路径给出判定。
真实规则、真实判定
下载网站真实的 robots.txt 并按搜索引擎同款方式判定——RFC 9309 最长匹配、同长度 Allow 优先、User-agent 前缀分组,绝无猜测。
亮出决定性规则
除了"允许 / 禁止"徽章,还展示最终判定所依据的那条规则和它所属的 User-agent 分组,让你明白为什么——以及该改什么。
不加载页面、免登录、免费
只抓取公开的 robots.txt(绝不抓你的页面),经限量、512 KB 上限、拒绝私有地址的读取器执行。无需账号、无需积分。
相关工具
什么是 robots.txt 检测工具?
robots.txt 检测工具会下载一个网站的 robots.txt,并告诉你某个抓取代理到底被允许访问什么——判定方式与主流搜索引擎完全一致。robots.txt 是每个网站都可以发布的小型公开文本文件,用来声明哪些路径允许、哪些禁止爬虫访问(如 "Disallow: /admin/"、"Allow: /public/",按 User-agent 行分组对应不同爬虫)。它不是安全边界,但却是向搜索引擎和其他机器人传达抓取偏好的方式——而规则写错,是网页意外从 Google 消失的常见原因。本工具读取该文件并按 RFC 9309 执行匹配:最长匹配优先、同长度 Allow 优于 Disallow、星号匹配任意字符、末尾 $ 锚定结尾、规则分组对爬虫按产品令牌的不区分大小写前缀生效。
这款工具能显示什么
- 针对某个精确(路径, 爬虫)组合的即时"允许 / 禁止"判定
- 决定结果的规则及其所属 User-agent 分组
- robots.txt 响应的 HTTP 状态(404 表示全部放行)
- 找到的分组数、匹配规则数与 sitemap 行数统计
- 原始 robots.txt 全文,供你核对
什么时候使用它
- 上线新栏目之前,确认它对 Googlebot 确实可抓取
- 排查页面在搜索结果中消失——先看是不是 robots 规则挡住了
- 验证 Allow 覆盖是否真的压过了更早的 Disallow(常见误区)
- 要放行新的机器人(AI 爬虫、图片机器人)时,确认它能走哪些路径
隐私说明:本工具会把您输入的网址发送到本网站服务器,由它下载目标的公开 robots.txt——绝不加载您的页面。解析在您的浏览器本地完成,结果会短暂缓存以节省带宽,无需账号,也不存储任何关于您的信息。