上线前核对抓取与索引配置,核心不是“让搜索引擎立刻收录”,而是确认三件事:爬虫能拿到页面、拿到的页面允许被索引、索引指向的地址是你希望用户看到的那一个。时间人手有限时,先查 robots 与 meta 指令,再查可访问性和规范化,最后才处理站点地图与提交入口。
很多人把“页面能打开”当成“能被索引”。这两件事没有必然关系。一个页面可能返回 200,但被 robots.txt 屏蔽、被 <meta name="robots" content="noindex"> 标记、被登录或地域限制挡住,或者 canonical 指向了另一个地址。对南昌网站开发项目来说,测试环境常带 noindex 或基础认证,上线时若只改域名不改这些标记,就会出现“线上能访问、搜索里看不到”的情况。因此核对的目标是排除阻断项,而不是追求某个收录速度。
先看根目录的 robots.txt。重点不是文件是否存在,而是它是否误屏蔽了整站或关键目录。常见写法中,Disallow: / 会阻止全站抓取;如果测试阶段加过这条,上线时必须删掉或改成只屏蔽后台、搜索结果页等无需收录的路径。同时检查页面响应头或 HTML 里的 X-Robots-Tag、meta robots,确认没有残留 noindex、nofollow。
robots.txt 是否可公开访问,返回状态是否为 200。Disallow: /,或屏蔽了 CSS、JS、图片目录。noindex。抓取放行后,再看索引许可。用浏览器开发者工具或命令行查看目标 URL 的 HTTP 状态码和响应头。希望被收录的页面应为 200;301 表示永久跳转,应指向最终地址;404、410 表示不存在,不应作为可收录页面提交;5xx 说明服务器异常,此时提交站点地图意义不大。若页面需要登录、验证码或特定 IP 才能访问,爬虫通常拿不到内容,这类页面不适合作为公开收录目标。
可以按下面的顺序执行一次抽查:
curl -I 或浏览器网络面板查看状态码与响应头。meta robots 与 canonical。同一内容常有多个入口:带 www 与不带 www、http 与 https、带尾斜杠与不带尾斜杠、带跟踪参数与不带参数。若这些版本都返回 200 且各自 canonical 指向自己,就会形成重复。正确处理是选定一个规范版本,其余做 301 跳转,或在页面中把 canonical 统一指向规范地址。判断条件很简单:用户和爬虫最终应落到同一个地址,且该地址返回 200。
这里要区分“可能原因”和“已定位原因”。例如某个页面未被收录,可能是 canonical 指错、可能被 robots 屏蔽、也可能是内容质量或竞争原因,不能只凭一个现象就断言唯一原因。上线前能确认的是技术阻断项,收录结果本身还受其他因素影响,不应承诺固定时间见效。
站点地图是辅助发现,不是收录保证。确认前面的抓取与索引配置无误后,再生成只包含规范、可索引、200 状态 URL 的站点地图,并在对应搜索引擎的站长平台提交。若站点地图里混入 404、重定向或被 noindex 的地址,会降低排查效率。对时间和人手有限的项目,优先顺序应是:先修阻断项,再统一规范地址,最后提交站点地图;不要反过来先提交再排查。
下一步建议:从线上环境随机抽 5 个关键页面,按“状态码→meta robots→canonical→robots.txt”四项做一次表格记录,把异常项直接分配给对应开发或运维处理,修完后复测同一批 URL。