抓取、索引、排名是三个先后不同、判断方法也不同的环节。抓取是百度蜘蛛来读取网址并获取页面内容;索引是把抓取到的内容处理后存入可供检索的库;排名是用户搜索某个词时,页面在结果中的先后位置。一个人说“页面没收录”,可能指抓取失败,也可能指抓取成功但未建索引;说“没排名”,则可能页面已被索引,只是没有出现在目标词的前列。把这三件事分开记录,多人协作时才不会把不同问题混成一条待办。
不要凭感觉判断,先固定一组可核对的现象。对同一个网址,分别检查以下三项:
site: 加上具体网址或目录做粗查,再配合百度搜索资源平台里该站点的抓取与索引相关数据查看趋势。若日志有蜘蛛访问、页面返回正常,但长期查不到该网址,通常说明卡在索引环节,而不是抓取环节。这三项的顺序不能颠倒:没被抓取,就谈不上索引;没被索引,就谈不上这个词的排名。团队里常见的返工,是把“没排名”直接当成“内容质量差”去改文案,而实际原因可能是页面返回了 403,蜘蛛根本没读到内容。
建议为每个待处理网址建一行记录,至少包含:网址、检查日期、日志中是否有百度蜘蛛访问、最近一次返回状态码、site: 查询是否可见、目标词是否出现。每条结论后面写清依据来源,例如“依据为 3 月 10 日服务器日志”或“依据为搜索资源平台数据页”。
这样做的代价是需要人工核对日志和查询结果,比直接凭印象下结论慢;收益是不同人可以复核同一份依据,不会出现一个人说“没收录”、另一个人说“我搜到了”却各说各话。适用条件是站点能拿到访问日志、且有人能定期查看;如果站点完全没有日志权限,就只能依赖搜索资源平台的数据和公开查询,判断精度会下降,此时应在记录中注明“依据有限”。
按下面的顺序执行,可以避免在错误环节上花力气:
举例说明(以下为假设情形):某页面日志显示百度蜘蛛连续两周访问且返回 200,site: 查询查不到该网址,目标词也搜不到。此时不应判断为“排名差”,而应先按索引环节处理。反过来,若该网址能被查到,只是目标词搜不到,才属于排名环节的问题,改内容相关性和内链更有针对性。
“抓取频次下降”和“索引量下降”不是一回事。前者看日志中蜘蛛访问次数的变化,后者看可检索网址数量的变化,二者可能同时发生,也可能各自独立。另一个常见混淆是“搜索结果里没有”与“没有被索引”:前者是搜索表现,后者是索引状态,判断依据不同,不能互相替代。记录时把现象和环节分开写,协作交接时就不容易把结论传错。
下一步,选一个当前有争议的网址,按上面的三项检查各填一次,把依据写进同一份记录,再决定这条待办属于抓取、索引还是排名。