tomai
登入
免費 · SEO工具

Robots.txt 檢測工具

擷取任意網站的 robots.txt,實測某個爬蟲能否訪問某路徑——依真實擷取規則判定,並顯示決定性規則。

輸入任意 http(s) 網址,帶具體路徑(如 /private/admin)也可以。工具會下載該網站的 robots.txt 並用這個精確路徑來判定。
決定測試結果的爬蟲。採用前綴匹配——「Googlebot」同樣適用於 Googlebot-News、Googlebot-Image……
輸入網址並選擇爬蟲,然後點「檢查存取權限」。判定結果會告訴你:依該網站真實的 robots.txt,這個爬蟲能否存取該路徑。

常見問題

結果到底意味著什麼?

判定只針對一個(爬蟲, 路徑)組合:依該網站真實的 robots.txt 得出「允許」或「禁止」。頁面會顯示規則來自哪個 User-agent 分組、由哪一條規則最終決定結果。匹配完全遵循 RFC 9309:最長匹配優先;長度相同時 Allow 優先於 Disallow;星號匹配任意字元(含斜線);結尾 $ 表示錨定結尾;沒有任何規則匹配時預設允許。值為空的 Disallow 是空操作,與主流搜尋引擎的處理一致。

為什麼 Googlebot 也符合 Googlebot-News 和 Googlebot-Image?

RFC 9309 規定 User-agent 分組按爬蟲產品權杖的「不區分大小寫前綴」匹配——寫給「Googlebot」的分組因此也管 Googlebot-News、Googlebot-Image、Googlebot-Video 等。網站正是利用這點為一整族爬蟲寫一套規則。你也可以輸入任意精確機器人名稱(如「GPTBot」或「Baiduspider-image」);如果網站有針對它的分組,則只套用該分組的規則。

這個工具會載入我的頁面嗎?robots.txt 從哪來?

只下載目标的 /robots.txt,絕不載入頁面本身;因為瀏覽器無法直讀其他網域的 robots.txt(CORS 限制),下載由本網站伺服器代為執行。擷取有限速、512 KB 上限、最多跟隨 3 次重新導向,並拒絕私有/保留地址。收到的檔案完全在瀏覽器本機解析,無需帳號,也不儲存你的網址。

檢查器驗證什麼

用 bot 的角度檢視你的 robots.txt

抓取、解析再模擬 — 你自己的每一條 URL 都會對所有 Disallow 規則測試,並逐一路徑顯示判定結果。

🕸️

真實規則、真實判定

下載網站真實的 robots.txt 並依搜尋引擎同款方式判定——RFC 9309 最長匹配、同長度 Allow 優先、User-agent 前綴分組,絕無猜測。

⚖️

亮出決定性規則

除了「允許 / 禁止」徽章,還展示最終判定所依據的那條規則和它所屬的 User-agent 分組,讓你明白為什麼——以及該改什麼。

🆓

不載入頁面、免登入、免費

只擷取公開的 robots.txt(絕不擷取你的頁面),經限量、512 KB 上限、拒絕私有地址的讀取器執行。無需帳號、無需點數。

相關工具

什麼是 robots.txt 檢測工具?

robots.txt 檢測工具會下載一個網站的 robots.txt,並告訴你某個抓取代理到底被允許存取什麼——判定方式與主流搜尋引擎完全一致。robots.txt 是每個網站都可以發布的小型公開文字檔案,用來聲明哪些路徑允許、哪些禁止爬蟲存取(如「Disallow: /admin/」、「Allow: /public/」,按 User-agent 行分組對應不同爬蟲)。它不是安全邊界,但卻是向搜尋引擎和其他機器人傳達抓取偏好的方式——而規則寫錯,是網頁意外從 Google 消失的常見原因。本工具讀取該檔案並依 RFC 9309 執行匹配:最長匹配優先、同長度 Allow 優於 Disallow、星號匹配任意字元、結尾 $ 錨定結尾、規則分組對爬蟲依產品權杖的不區分大小寫前綴生效。

這款工具能顯示什麼

  • 針對某個精確(路徑, 爬蟲)組合的即時「允許 / 禁止」判定
  • 決定結果的規則及其所屬 User-agent 分組
  • robots.txt 回應的 HTTP 狀態(404 表示全部放行)
  • 找到的分組數、符合規則數與 sitemap 行數統計
  • 原始 robots.txt 全文,供你核對

什麼時候使用它

  • 上線新欄目之前,確認它對 Googlebot 確實可抓取
  • 排查頁面在搜尋結果中消失——先看是不是 robots 規則擋住了
  • 驗證 Allow 覆蓋是否真的壓過更早的 Disallow(常見誤區)
  • 要放行新的機器人(AI 爬蟲、圖片機器人)時,確認它能走哪些路徑

隱私說明:本工具會把您輸入的網址傳送到本網站伺服器,由它下載目標的公開 robots.txt——絕不載入您的頁面。解析在您的瀏覽器本機完成,結果會短暫快取以節省頻寬,無需帳號,也不儲存任何關於您的資訊。

相關工具