判断“哪个网站建设好”,不能只看页面外观和功能演示,还要看它上线前能否把抓取与索引配置核对清楚。一个合格的建站方案,应当让你在发布前明确知道:哪些页面允许搜索引擎抓取,哪些页面需要屏蔽,哪些地址应返回正确状态码,以及站点地图和规范链接是否指向最终版本。下面这份清单可以直接用于上线前的技术检查。
要查的是首页、栏目页和关键内容页能否被正常访问。用浏览器无痕模式打开,再用命令行工具请求一次,观察返回状态码。
200。curl -I 页面地址,或浏览器开发者工具的“网络”面板查看响应状态。404、500 或跳转到登录页,搜索引擎即使发现链接也无法获得有效内容。返回 200 才说明该地址可以正常读取。这一步的适用条件是:页面已经部署到最终域名。如果还在测试域名上检查,结果不能代表上线后的抓取情况。
robots.txt 是抓取阶段的入口规则,写错一个符号就可能挡住整站或整类资源。
Disallow: /,是否误挡了 CSS、JavaScript、图片目录或文章目录。你的域名/robots.txt,逐行阅读规则;再对照网站实际目录结构,确认被屏蔽的路径是否包含需要收录的页面。注意,robots.txt 只控制抓取,不控制索引。一个页面被 robots.txt 屏蔽后,仍可能因外部链接被索引,只是搜索引擎无法读取内容。因此不要把它当成删除页面的工具。
页面能被抓取,不等于会被索引。需要检查页面级指令和规范链接是否一致。
<meta name="robots" content="noindex">;是否设置了 <link rel="canonical">;规范链接指向的地址是否返回 200。noindex 和 canonical;再访问 canonical 指向的地址,确认状态码和内容一致。noindex,它不会进入索引。如果 canonical 指向错误地址、旧域名或 404 页面,搜索引擎可能不收录当前页面,或把权重集中到错误地址。适用条件是:同一内容存在多个访问地址时,例如带 www 和不带 www、带参数和不带参数。此时 canonical 应指向最终选定的主地址。若页面本身是独立内容,不应随意把 canonical 指向其他文章。
站点地图是帮助搜索引擎发现页面的辅助入口,不是收录保证。核对重点是它列出的地址是否都是最终可访问版本。
200;是否包含已删除页面、测试地址、带 noindex 的页面;是否只列出规范地址。404 或重定向地址,会浪费抓取预算,也会降低对站点质量的判断。若站点地图只包含最终地址且状态正常,说明配置方向正确。这一步的适用条件是:站点规模较大、栏目较多时尤其必要。小型站点页面少,可以手工核对;页面多时,应借助脚本批量检查状态码,而不是只抽查首页。
https 和带 www。noindex,确认 canonical 指向最终地址。200 的规范地址。如果以上检查中发现任何一项不一致,先修正配置再提交站点地图。下一步可以选一个核心栏目页,按“状态码—robots.txt—noindex—canonical—站点地图”的顺序完整走一遍,把结果记录下来,作为整站核对的模板。