
SiteOne Crawler 新手指南一条命令搞定网站爬取、离线克隆与 Markdown 转换【免费下载链接】siteone-crawlerSiteOne Crawler is a cross-platform website crawler and analyzer for SEO, security, accessibility, and performance optimization—ideal for developers, DevOps, QA engineers, and consultants. Supports Windows, macOS, and Linux (x64 and arm64).项目地址: https://gitcode.com/gh_mirrors/si/siteone-crawler接手一个老网站想离线存档又不想一页页手动截图SiteOne Crawler 是个跨平台网站爬取工具一条命令把整站抓取下来顺手完成离线克隆、Markdown 转换和 SEO 分析。单个原生二进制文件零运行时依赖Windows、macOS、Linux 通吃x64 与 arm64 都有包。网站备份、内容归档、给 RAG 准备语料都靠它。下载解压后跑通首次爬取去官方发布页下载对应平台的压缩包注意选对 x64 还是 arm64。解压后只有一个siteone-crawler可执行文件拷到哪都能跑。终端里执行./siteone-crawler --urlhttps://example.com--url就是要爬取的起始地址。跑起来后终端会实时打出每个 URL 的状态码、响应时间、体积和标题收尾附总耗时统计。报告默认存在当前目录的tmp/里HTML 版用浏览器打开即可。离线存档的正确姿势如果你的目标是把整站搬到本地慢慢看加个导出目录./siteone-crawler --urlhttps://example.com --offline-export-dir./site-backup页面连同样式、脚本、图片、字体一起落地链接全部改写成相对路径双击index.html离线就能浏览。整站备份、断网应急、挂到静态托管做灾备都靠这一条命令。转 Markdown 后怎么用如果你的目标是把整站内容喂给 RAG 或大模型把--markdown-export-dir./site-md加到同一条命令后面即可导出的.md之间自带可点击的相对链接再追加--markdown-export-single-file还能合并成单文件并自动去掉每页重复的页头页脚——比直接丢 HTML 干净得多。新手容易踩的坑⚠️--url必须写带http://或https://前缀的完整地址裸域名会被参数校验直接拦下。⚠️ Linux 有 glibc 与 musl 两种二进制新发行版选 glibc 更快老系统报GLIBC not found就换 musl 静态版。 找不到结果文件时先ls tmp/报告默认都在里面想指定路径用--output-html-report等参数。想深入可以去看裸跑二进制不带参数会进交互式向导10 种预设模式快速审计、SEO 分析、离线克隆……不用记任何 flag新手最省心。仓库里docs/JSON-OUTPUT.md、docs/TEXT-OUTPUT.md列全了两种输出的字段写脚本对接先看这俩。集成思路离线导出挂 Pages/Netlify 做静态灾备单文件 Markdown 直接推进知识库--ci质量门可以在 CI 里按评分卡部署。【免费下载链接】siteone-crawlerSiteOne Crawler is a cross-platform website crawler and analyzer for SEO, security, accessibility, and performance optimization—ideal for developers, DevOps, QA engineers, and consultants. Supports Windows, macOS, and Linux (x64 and arm64).项目地址: https://gitcode.com/gh_mirrors/si/siteone-crawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考