Robots.txt 檢測工具
擷取任意網站的 robots.txt,實測某個爬蟲能否訪問某路徑——依真實擷取規則判定,並顯示決定性規則。
⚠️ 無法檢查該網站
- 檢測路徑
- 規則分組
- 決定性規則
原始 robots.txt
常見問題
結果到底意味著什麼?
判定只針對一個(爬蟲, 路徑)組合:依該網站真實的 robots.txt 得出「允許」或「禁止」。頁面會顯示規則來自哪個 User-agent 分組、由哪一條規則最終決定結果。匹配完全遵循 RFC 9309:最長匹配優先;長度相同時 Allow 優先於 Disallow;星號匹配任意字元(含斜線);結尾 $ 表示錨定結尾;沒有任何規則匹配時預設允許。值為空的 Disallow 是空操作,與主流搜尋引擎的處理一致。
為什麼 Googlebot 也符合 Googlebot-News 和 Googlebot-Image?
RFC 9309 規定 User-agent 分組按爬蟲產品權杖的「不區分大小寫前綴」匹配——寫給「Googlebot」的分組因此也管 Googlebot-News、Googlebot-Image、Googlebot-Video 等。網站正是利用這點為一整族爬蟲寫一套規則。你也可以輸入任意精確機器人名稱(如「GPTBot」或「Baiduspider-image」);如果網站有針對它的分組,則只套用該分組的規則。
這個工具會載入我的頁面嗎?robots.txt 從哪來?
只下載目标的 /robots.txt,絕不載入頁面本身;因為瀏覽器無法直讀其他網域的 robots.txt(CORS 限制),下載由本網站伺服器代為執行。擷取有限速、512 KB 上限、最多跟隨 3 次重新導向,並拒絕私有/保留地址。收到的檔案完全在瀏覽器本機解析,無需帳號,也不儲存你的網址。
檢查器驗證什麼
- 抓取健康度 — 解析之前先確認狀態碼、轉址鏈與 content-type;如果 /robots.txt 回傳的是 HTML 頁面,會明確報錯。
- 指令稽核 — 未知的指令會被標出(爬蟲本來就會忽略);crawl-delay 會依主要 bot 的上限做合理性檢查。
- URL 模擬 — 貼上路徑逐一測試,每筆顯示 Allowed/Blocked,並引用實際命中的那一行。
- Sitemap 有無 — 會擷取 Sitemap 宣告並檢查是否可連上。
用 bot 的角度檢視你的 robots.txt
抓取、解析再模擬 — 你自己的每一條 URL 都會對所有 Disallow 規則測試,並逐一路徑顯示判定結果。
真實規則、真實判定
下載網站真實的 robots.txt 並依搜尋引擎同款方式判定——RFC 9309 最長匹配、同長度 Allow 優先、User-agent 前綴分組,絕無猜測。
亮出決定性規則
除了「允許 / 禁止」徽章,還展示最終判定所依據的那條規則和它所屬的 User-agent 分組,讓你明白為什麼——以及該改什麼。
不載入頁面、免登入、免費
只擷取公開的 robots.txt(絕不擷取你的頁面),經限量、512 KB 上限、拒絕私有地址的讀取器執行。無需帳號、無需點數。
相關工具
什麼是 robots.txt 檢測工具?
robots.txt 檢測工具會下載一個網站的 robots.txt,並告訴你某個抓取代理到底被允許存取什麼——判定方式與主流搜尋引擎完全一致。robots.txt 是每個網站都可以發布的小型公開文字檔案,用來聲明哪些路徑允許、哪些禁止爬蟲存取(如「Disallow: /admin/」、「Allow: /public/」,按 User-agent 行分組對應不同爬蟲)。它不是安全邊界,但卻是向搜尋引擎和其他機器人傳達抓取偏好的方式——而規則寫錯,是網頁意外從 Google 消失的常見原因。本工具讀取該檔案並依 RFC 9309 執行匹配:最長匹配優先、同長度 Allow 優於 Disallow、星號匹配任意字元、結尾 $ 錨定結尾、規則分組對爬蟲依產品權杖的不區分大小寫前綴生效。
這款工具能顯示什麼
- 針對某個精確(路徑, 爬蟲)組合的即時「允許 / 禁止」判定
- 決定結果的規則及其所屬 User-agent 分組
- robots.txt 回應的 HTTP 狀態(404 表示全部放行)
- 找到的分組數、符合規則數與 sitemap 行數統計
- 原始 robots.txt 全文,供你核對
什麼時候使用它
- 上線新欄目之前,確認它對 Googlebot 確實可抓取
- 排查頁面在搜尋結果中消失——先看是不是 robots 規則擋住了
- 驗證 Allow 覆蓋是否真的壓過更早的 Disallow(常見誤區)
- 要放行新的機器人(AI 爬蟲、圖片機器人)時,確認它能走哪些路徑
隱私說明:本工具會把您輸入的網址傳送到本網站伺服器,由它下載目標的公開 robots.txt——絕不載入您的頁面。解析在您的瀏覽器本機完成,結果會短暫快取以節省頻寬,無需帳號,也不儲存任何關於您的資訊。