用 Screaming Frog 大規模產生 Markdown

來源聲明:本文根據〈Using the Screaming Frog SEO Spider to Generate Markdown at Scale〉(Mark Porter,Screaming Frog,2026-04-21)編譯整理,不是逐句翻譯,也不複製文中完整程式碼。原文連結:https://screamingfrog.co.uk/blog/generate-markdown-at-scale。頁面未見開放授權。文中「編輯解讀」為本站觀點。

SEO 工作流常要把網頁變成乾淨文本,供 RAG、微調、競品分析或遷移備份。HTML 含導覽、cookie、廣告等雜訊;Markdown 較小且保留結構。Screaming Frog 可用 Custom JavaScript 在爬取時輸出 Markdown。

兩種擷取路徑

兩者都需啟用 JavaScript 轉譯:

  • Readability.js + Turndown:Mozilla Readability(Firefox 閱讀模式同源思路)找主內容,Turndown 轉 Markdown;多數站免設定。
  • 視覺自訂擷取 + Turndown:Readability 失手或只要局部時,用選擇器精準抓。

文內提供可貼上的腳本與後續把 xlsx 拆成多個 .md 的 Python 流程;實作請回原文複製,避免版本過期。

不是給機器人另開 Markdown 站

作者區分:有人實驗對 LLM 爬蟲提供 Markdown(甚至 Cloudflare 一鍵轉換),但 Google 的 John Mueller 曾在 Bluesky 稱其為 “a stupid idea”。本文立場是抽取既有頁面供下游工具,不是維護平行機器站。

常見問題

  • 為什麼要用 Markdown?比 HTML 小、保留標題與清單結構、多數 LLM/RAG 流程預設或接近此格式,也方便人工抽查。
  • 兩種方法是什麼?(1)Readability.js + Turndown 自動找主內容;(2)視覺自訂擷取 + Turndown,在 Readability 失手或只要局部時使用。兩者都要開 JavaScript 轉譯。
  • 這和「把 Markdown 提供給爬蟲」是同一件事嗎?不是。原文明確反對把本教學理解成對 LLM 爬蟲提供平行 Markdown 站;並提及 John Mueller 曾在 Bluesky 批評該做法。本篇是離線/批次抽取既有 HTML。
  • 輸出後如何變成許多 .md 檔?文章說明可將 SEO Spider 的 xlsx 匯出交給配套 Python 腳本,拆成個別 Markdown 檔。
  • 設定上最容易漏什麼?未啟用 Configuration > Spider > Rendering > JavaScript,Custom JavaScript 就不會在完整轉譯後的頁上跑。

編輯解讀

一句話重點:把爬蟲當「內容 ETL」——為 AI 與稽核準備乾淨文本,而不是改搜尋抓取協定。

這對你的網站意味著什麼:

  • 遷移或知識庫專案先抽 Markdown,再人工抽樣核對導覽是否誤入正文。
  • 不要為了省 token 就對公開爬蟲回與 HTML 不一致的 Markdown。
  • 與 JavaScript SEO 同一條:轉譯設定錯,抽取與索引判斷都會偏。

適用與不適用的情境:適用大量 URL 的內容營運與 AI 資料準備。只要幾頁時,瀏覽器閱讀模式即可。

需要注意的限制:Screaming Frog 產品部落格,發布者銷售該軟體,有商業利益。第三方函式庫與腳本需自行評估授權與維護。John Mueller 評論來自社群平台轉述,應回原文脈絡理解。

延伸閱讀:

名詞與資料來源

Similar Posts