区分抓取、索引和排名,最可靠的方法是看“页面有没有被访问”“页面能不能被搜到”“页面出现在第几位”这三件事分别发生了什么。抓取是搜索引擎发现并读取网址;索引是把读取到的内容存入可供检索的数据库;排名是用户搜索某个词时,系统从索引中挑出页面并决定展示顺序。一个页面被抓取不等于被索引,被索引也不等于有排名,有排名更不等于排名稳定。
出现问题时,不要先猜“是不是被降权了”,而要先收集能直接对应的证据。
robots.txt是否允许访问;页面是否需要登录或依赖脚本才能显示主要内容。site:配合完整网址做初步检查;观察页面标题、摘要是否来自该页自身。这三类证据不能互相替代。日志有访问记录,只能说明抓取发生过;网址查询能搜到,只能说明它进入了索引;用某个词搜不到,可能是排名靠后,也可能是该词与页面主题不匹配,不能直接倒推为“没被索引”。
把观察结果按下面顺序对照,能减少误判。以下判断条件是通用逻辑,不针对某个特定搜索引擎。
robots.txt、页面状态码、内链是否可达、是否有异常屏蔽规则。此时讨论排名没有意义。假设某产品页在日志中每天都有抓取记录,但用完整网址查询也找不到。此时应优先怀疑索引环节,而不是继续优化标题关键词。反过来,如果完整网址能查到,只是“某类查询词”没有出现,就应该检查内容与查询意图的匹配度,而不是反复提交网址。
面对“搜不到”的问题,常见做法有两种:一种是直接改标题、堆关键词、反复提交网址;另一种是先确认抓取和索引状态,再决定是否调整内容。前一种动作快,但代价是可能把原本正常的页面改乱,也无法解释问题到底出在哪。后一种多花一点时间收集日志和查询证据,但能避免在错误环节上反复投入。
适用条件也不同。如果页面是新发布且从未被抓取,先解决可抓取性更合理;如果页面早已能被搜到,只是某个词的位置下降,重点应放在内容质量、查询意图和竞争页面对比上。判断结果很简单:证据指向哪一环,就处理哪一环;证据不足时,先补证据,不先动页面。
按下面步骤做一轮,通常就能把三个环节分开:
下一步,选一个你正在处理的网址,先完成日志、网址查询、目标词查询这三项记录,再决定是修抓取、修索引,还是调整内容与排名策略。