核对抓取限制,核心是确认三件事:博客是否允许搜索引擎抓取、哪些目录被意外屏蔽、抓取预算是否被低价值页面浪费。对多人协作的博客项目,建议把这三项做成一份可执行清单,每次上线新栏目或改版后逐项过一遍。下面每项都包含查什么、怎么查、结果说明什么。
查什么:站点根目录下的 robots.txt 有没有 Disallow 规则误伤博客目录、文章页或静态资源。
怎么查:在浏览器打开 你的域名/robots.txt,逐条对照博客的 URL 结构。重点看三类路径:文章列表页、文章详情页、图片与 CSS/JS 所在目录。假设博客路径是 /blog/,如果出现 Disallow: /blog/,那么整站博客都不会被抓取。
结果说明什么:存在针对博客路径的 Disallow,说明抓取被主动禁止,需要确认这是有意为之还是配置遗留。若规则只屏蔽了 /blog/draft/ 这类草稿目录,属于合理限制,不必改动。多人协作时,把 robots.txt 纳入代码评审,避免有人为了临时测试加了一条屏蔽规则后忘记删除。
查什么:文章页的 <meta name="robots"> 是否出现 noindex,以及 canonical 是否指向了错误的页面。
怎么查:打开一篇已发布的博客文章,查看网页源代码,搜索 meta name="robots" 和 rel="canonical"。如果站点使用模板,抽查不同栏目各一篇,因为不同模板可能带不同的默认值。
结果说明什么:出现 noindex 表示该页被明确排除在索引之外,即使能被抓取也不会进入搜索结果。canonical 指向其他页面,说明该文章被当作重复内容处理,权重会归并到目标页。两种情况的处理方式不同:前者要改模板或页面配置,后者要确认是否真的存在重复内容。测试环境模板误带到生产环境,是这类问题的常见来源。
查什么:搜索引擎实际抓取了博客的哪些页面、抓取频次是否异常、是否有大量抓取落在无价值 URL 上。
怎么查:如果站点已接入搜索引擎站长平台,查看抓取统计与抓取错误报告;没有接入的话,先看服务器访问日志,筛选搜索引擎爬虫的 User-Agent,统计博客目录的请求量与返回码。
结果说明什么:抓取量集中在标签页、分页、筛选参数上,说明抓取预算被稀释,真正需要收录的文章反而抓取不足。返回码里大量 404 或 301 链,说明站内链接或跳转配置有问题。注意,抓取频次会随站点权重、内容更新频率和搜索需求变化而波动,单日数据不足以定论,建议看一个完整周期的趋势。
查什么:博客依赖的 CSS、JS、图片是否允许抓取。
怎么查:在 robots.txt 中查找针对 /static/、/assets/、/wp-content/ 等资源目录的屏蔽规则,再结合页面源代码确认资源实际路径。
结果说明什么:资源被屏蔽时,搜索引擎可能无法正确渲染页面,影响对内容的理解。这类问题在移动端适配和图文博客上表现更明显。如果资源目录和后台管理目录共用同一前缀,限制要写得足够精确,避免连带屏蔽。
多人协作最容易返工的地方,是抓取限制只存在于某个人的记忆里。建议把上述检查做成发布前清单,每项写明负责人和通过标准:
noindex下一步,选一篇近期发布的博客文章,按第一项到第四项完整走一遍,把发现的问题记录成可复用的检查项,再决定是否需要调整模板或 robots.txt。