Robots.txt / sitemap 檢查器
內容只在瀏覽器本機處理。請勿貼上敏感 token 或私密資料。
使用說明
從瀏覽器直接 GET robots.txt 或 sitemap URL,顯示 HTTP 狀態並計算字面上的 Sitemap: 列或 <url> 標籤。
網站剛上線,Google 卻遲遲不收錄?問題很可能出在 `robots.txt` 或 `sitemap.xml` 設定錯誤!這款 SEO 健檢小幫手協助您快速檢測 robots.txt 的拒絕規則是否不小心擋到了搜尋引擎爬蟲,並驗證 Sitemap 格式是否符合 Google 規範!
💡 3 步驟快速上手
將網站上的 robots.txt 文字或 Sitemap XML 語法貼入檢測框。
系統自動解析 User-agent、Disallow、Allow 規則與 Sitemap 指令。
一秒查看是否有阻擋重要網頁索引的錯誤設定,讓 Google 爬蟲順暢收錄!
適用情境
輸入網站首頁時會檢查同源根目錄的 /robots.txt 與 /sitemap.xml;輸入 robots.txt 或 .xml URL 時只檢查該網址。
計算或處理方式
工具使用瀏覽器 fetch,不經 GoGo Tools 後端。XML 只以區分大小寫的 <url> 字串計數;robots.txt 只以每行開頭的 Sitemap:(不分大小寫)計數。它不解析 XML、sitemap 索引、壓縮檔或 robots 規則。
具體範例
範例:輸入 https://example.com 會依序嘗試 https://example.com/robots.txt 與 https://example.com/sitemap.xml。
限制與資料處理
跨來源伺服器未允許 CORS 時,瀏覽器無法讀取內容,工具只顯示錯誤文字,不會產生手動連結。工具沒有自訂逾時或快取,也不解析 sitemap 索引、命名空間、壓縮 sitemap 檔或 robots 規則。
瀏覽器會直接向目標網站傳送 GET,因此目標站會收到來自你的網路請求;網址不會送到 GoGo Tools 後端。分析事件不包含輸入網址或回應內容。
Robots.txt 排除協定、Sitemap XML 規範與搜尋引擎抓取指南
一、Robots Exclusion Protocol (RFC 9309) 國際標準
放置於網站根目錄的 `robots.txt` 是網站管理者與全球搜尋引擎爬蟲(Googlebot、Bingbot、Baiduspider)之間的首要溝通協定。IETF 於 2022 年正式將其標準化為 RFC 9309。
常見的指令包含:`User-agent`(指定目標爬蟲名稱)、`Allow`(允許抓取特定子路徑)、`Disallow`(禁止抓取敏感後台或私密路徑)、以及 `Sitemap`(宣告網站地圖的完整絕對路徑)。需要特別注意:`Disallow` 僅阻止爬蟲「抓取頁面內容」,並不能完全阻止該 URL 因外部反向連結而被 Google 建立索引;若要徹底阻止索引,應使用 `<meta name="robots" content="noindex">`。
二、Sitemap 0.9 XML 規範與 Hreflang 多語系宣告
Sitemap XML 依據 sitemaps.org 0.9 協議編寫,主動向搜尋引擎提交網站上的所有權威 Canonical URL。每個 URL 節點包含 `<loc>`(網址)、`<lastmod>`(最後更新日期 ISO 8601 格式)及選填的 `<changefreq>` 與 `<priority>`。
對於多語系網站,可在 Sitemap 內透過 `xhtml:link rel="alternate" hreflang="..."` 標籤宣告各語言版本與 `x-default` 回退頁面,幫助 Google 在各國搜尋引擎中精確投放對應語言的搜尋結果。
三、抓取預算(Crawl Budget)優化與大型網站 SEO 策略
搜尋引擎對每個網站分配的每日抓取頻率與數量稱為「抓取預算」。透過精準配置 `robots.txt` 封鎖無限迴圈的篩選分頁、搜尋結果頁與非公開管理端點,能將寶貴的爬蟲資源集中於高價值的原創工具與長篇指南頁面,大幅提升新頁面的索引速度。
Feedback
這個工具好用嗎?
歡迎告訴我們你的工具建議或錯誤回報。
常見問題
Robots.txt / sitemap 檢查器:網址會如何選擇?
一般網站網址會忽略其路徑,改查同源根目錄的 /robots.txt 與 /sitemap.xml;網址路徑以 robots.txt 結尾或 .xml 結尾時,只查輸入的完整網址。
Robots.txt / sitemap 檢查器:結果會顯示什麼?
每個可讀取的回應會顯示目標網址、HTTP 狀態,以及 Sitemap: 行數或字面 <url> 標籤數。這只是文字計數,不代表規則、XML 或 URL 都有效。
Robots.txt / sitemap 檢查器:CORS 與格式有哪些限制?
跨來源伺服器未允許 CORS 時,瀏覽器無法讀取內容,工具只顯示錯誤文字,不會產生手動連結。工具沒有自訂逾時或快取,也不解析 sitemap 索引、命名空間、壓縮 sitemap 檔或 robots 規則。
Robots.txt / sitemap 檢查器:輸入網址會傳送到哪裡?
瀏覽器會直接向目標網站傳送 GET,因此目標站會收到來自你的網路請求;網址不會送到 GoGo Tools 後端。分析事件不包含輸入網址或回應內容。