上线验收的核心是确认三件事:页面能正常访问、搜索引擎能抓到正确内容、站内没有会阻断收录的技术错误。时间和人手有限时,按“先看能否被抓,再看抓得对不对,最后看内容质量”的顺序执行,把不可逆的阻断项排在前面。
部署完成后不要急着提交,先做一轮观察。用浏览器无痕模式打开首页和两三个典型内页,确认返回状态正常、没有跳转到错误地址。同时查看服务器返回码,200 表示正常,301 表示永久跳转,404 表示页面不存在,5xx 表示服务端异常。这一步能快速排除最严重的可用性问题。
接着检查 robots.txt 是否可访问,以及里面有没有误写 Disallow: /。这类配置一旦写错,整站都不会被抓取,属于必须最先处理的问题。判断方法很简单:在浏览器地址栏输入域名加 /robots.txt,看返回内容是否符合预期。
观察之后进入判断环节。重点确认三处:一是页面 <head> 中是否存在 noindex;二是重要页面是否被 robots 规则屏蔽;三是规范链接 canonical 是否指向了错误地址。任何一项出错,都可能导致页面无法进入索引。
这里要区分“可能原因”和“已经定位的原因”。例如某页面没有被收录,可能是抓取被屏蔽,也可能是内容重复、内链太少、页面刚上线还没被处理,不能只凭一个现象就断定是单一原因。排查时逐项核对,把确认过的和待确认的分开记录。
noindex。robots.txt 是否屏蔽了 CSS、JS 或整站目录。canonical 是否指向本页自身或正确的规范地址。发现阻断项后,按影响面从大到小处理。整站被屏蔽、核心页面 noindex、大量 5xx 属于最高优先级;单个页面标题重复、图片缺少替代文本属于可延后项。修改后不要只看后台提示,要重新用无痕模式访问,确认返回内容已经变化。
如果站点使用模板或插件生成页面,注意模板改动可能同时影响所有页面。例如假设某建站程序默认给所有页面加了 noindex,那么只改一个页面没有意义,需要回到模板或全局设置层面调整。这里说的“假设”仅用于说明判断思路,具体行为要以你实际使用的程序版本和当前配置为准。
处理完成后做一轮复查。重新抓取 robots.txt,重新访问被修改的页面,确认返回码和 meta 标签符合预期。如果站点有搜索资源平台账号,可以在平台中查看抓取和索引状态,但不同平台的处理节奏不同,不要以固定时间作为验收标准。
复查时建议记录:检查时间、页面地址、修改前后状态、是否已确认。这样下次出问题能快速定位,也方便交接。验收不是一次性动作,上线后一周内再抽查一次,能发现延迟暴露的配置问题。
下一步:把上面四个检查项整理成一张清单,每次上线按顺序过一遍,先处理阻断抓取和索引的问题,再处理内容与体验问题。