Robots.txt 生成器
按爬虫设置 Allow/Disallow 规则和站点地图链接,一键复制使用
最容易踩坑的指令语义
- 更长规则优先 — 同一组内,匹配路径更长的 Allow 胜过更短的 Disallow;预览会标注实际生效的是哪条规则。
- 分组边界 — 空行即结束一组;意外混排会让其后的规则全部失效(此处会做校验)。
- Crawl-delay — Bing/Yandex 遵守,Google 忽略(输出注释中有说明)。
- Sitemap 行 — 只接受绝对 URL;允许多条且都能正确输出。
按爬虫解析的方式来写规则
User-agent 分组、allow/disallow 顺序、crawl-delay 和 sitemap 声明——勾选即组装,附带实时文件预览。
三种起步预设模式
允许全部、屏蔽全部和 WordPress 预设一键填好规则组,每种都带有符合意图的 User-agent 和 Allow 或 Disallow 行。
按爬虫分行的规则
每个 User-agent 拥有独立的 Allow 和 Disallow 路径编辑行,Sitemap 行从单独输入框追加,两者互不混淆。
编辑后即时重生成
文件文本随每次修改在等宽输出框中重新生成,复制或下载前就能看到最终 robots.txt 的内容。
常见问题
空的 Disallow 行是什么意思?⌄
只写“Disallow:”而不加任何内容,表示“不禁止任何内容”——也就是说这个爬虫可以访问所有页面。这正是“允许全部”预设生成的效果。
robots.txt 真的能阻止页面被收录吗?⌄
并不能完全保证——它只是要求遵守规则的爬虫不要抓取某个路径。即便被禁止抓取,页面仍可能因外部链接等原因被收录。要真正把页面排除在搜索结果之外,应使用 noindex 元标签或 HTTP 响应头。
我的内容会被上传到别处吗?⌄
不会——一切都通过纯 JavaScript 在你的浏览器本地运行,你输入的内容不会发送到任何服务器。
robots.txt 能把页面从 Google 中移除吗?⌄
不能——Disallow 阻止的是抓取,不是索引。被屏蔽的 URL 仍可能以裸链接形式出现。要真正移除,请使用 noindex 或移除工具。
相关工具
什么是 Robots.txt 生成器?
robots.txt 是网站根目录下的一个纯文本文件,告诉搜索引擎爬虫和其他机器人可以抓取站点的哪些部分。典型文件包含若干规则组——一行 User-agent 后跟 Allow 和 Disallow 路径——通常还有一行指向 sitemap。手写并不难,但很容易犯隐蔽的错误,比如 Disallow 遮住了本应生效的 Allow。这个生成器用可编辑的规则行和预设来组装文件,让站长和 SEO 从业者每次都能从正确的起点出发。
生成器会构建什么
- 🤖 按爬虫分组的规则,从指定机器人到通配 *
- 🚫 每组可 Disallow、✅ 可 Allow 多个路径
- ⏱️ 可选的 Crawl-delay 行
- 🗺️ 一条或多条 Sitemap 行
- 🧩 起步预设:全部允许、全部屏蔽、WordPress 默认
- 📋 复制成品文件,或直接下载
什么时候会写一份
- 把测试或预览环境从搜索结果中屏蔽
- 阻止某个爬虫频繁抓取你的站点
- 给全新安装的 WordPress 配置抓取规则
- 改版后引导爬虫读取新的 sitemap
文件完全在浏览器本地组装,不上传任何内容。有两点需要知道:成品文件要上传到网站根目录并确认可访问;另外 robots.txt 是请求而非强制——守规矩的爬虫会遵守,但它无法强迫任何机器人停止。
最后更新 · 2026-09-01