团队常问:「重写内容前该先爬什么?」开源 SEO 爬虫的价值,不在于发明排名规则,而在于把很长的检查清单变成可观察的产物。本文记录对公开仓库 puneetindersingh/open-seo-crawler(MIT)的设计观察,并用 Mika 自己的话写成审计实践笔记。我们没有转载该项目的文档正文。
为什么研究爬虫清单
对审计人员来说,爬虫的价值在于它如何给问题命名与分组。Open SEO Crawler 定位为自托管蜘蛛:并发抓取、可选 JS 渲染、CMS 预设、批量导出。对 Mika 真正有用的,不是安装器,而是它选择暴露、分组并导出哪些失败模式。
这些命名检查,能把工程语言(状态码、canonical、软 404)翻译成业务风险(「页面可能无法被干净发现」)。对照这些类别写审计工作表,比一个含糊的「SEO 健康分」更好辩护。
单页常见信号
根据公开功能描述,每个抓到的 HTML 页面会沿这些轴评估:
- 标题与 meta description —— 缺失、过短、过长,或跨 URL 重复。
- H1 结构 —— 缺失、多个 H1,或与 title 完全相同。
- Canonical —— 缺失、自指,或指向其他地址。
- 可索引性 —— meta robots 或
X-Robots-Tag中的 noindex。 - Hreflang —— 提取与校验,包括缺少回指。
- 结构化数据是否存在 —— 检测 JSON-LD / microdata 类型(存在性,不是排名承诺)。
- Open Graph / Twitter Card —— 常见社交元数据缺口。
- 薄弱或近重复正文 —— 过短字数与基于 shingle 的相似页配对。
- 重定向与链路 —— 多跳路径;规范化重定向与「真实」重定向分开统计。
- HTTP 错误、缺 alt 图片、混合内容、安全头、viewport、过深点击距离页面等。
这些都不会「保证」引用或排名,但能说明站点 HTML 是否足够自洽,让爬虫与人不必靠猜。
全站报告:sitemap、重复、坏链
除了单页行,项目强调跨 URL 报告:全部标题/meta/H1/canonical、重复分组、重定向链、状态码分布、深页、缺 alt 图片、hreflang 一致性等。Sitemap 分析会把抓取集合与 sitemap.xml 对照:sitemap 缺失、仅在 sitemap 出现、非 200、sitemap 内重定向。
坏链与畸形 href 被当作一等公民。无协议或把地址纯文本贴进链接的情况,会报成畸形链接,而不是在每个共享页脚的页面下炸出幽灵 404。对有共享页眉页脚的 B2B 站,这很关键:一个坏页脚不该看起来像几百个独立故障。
抓取预算与软 404 陷阱
另一条可见主题是:保护爬虫不要掉进无穷或低价值 URL 空间。公开材料描述了跳过非页面路径、重复路径段、常见页面构建器分页参数,以及抓取后探测服务器是否对「不可能存在」的 URL 返回 200。另有抓取预算视图按查询参数分桶,并可为分面/追踪陷阱建议 robots Disallow。
对审计者:在扩写主题覆盖之前,先盘点幽灵 URL 类别。站点若对任意路径 soft-404,再扩内容只会浪费抓取并污染诊断。
对网站审计的启发
Mika 的结论是:把开源爬虫清单当作覆盖地图,而不是排行榜:
- 把发现健康(状态码、robots、sitemap 差异、软 404)与页面清晰度(标题、H1、薄弱文案)分开。
- 改多语言模板前,先导出重复内容与 hreflang 报告。
- 模板级缺陷(页脚链接、重复资源缺 alt)修一次,再复爬。
- 若有 JS / 无 JS 对比,用来看非执行 JS 的爬虫实际收到什么。
顺序保持人在环:工具列证据,人按业务优先级决策。
本文不是什么
本文不安装、不分叉、不镜像 Open SEO Crawler,也不声称 Mika 复制了他们的文档。MIT 在此意味着我们可以研究并做事实归因;正文仍是 Mika 原创。清空爬虫警告也不承诺带来 AI 引用或流量增长——技术整洁是必要卫生条件,替代不了买家需要的有来源答案。