先给结论:额度有限时,不要按“页面数量”平均分配查询,而要先按页面类型分层,再从每层里挑最能暴露问题的代表页。一个可执行的做法是:把手中要查的页面按模板、流量来源和最近改动分成三到五组,每组只查一到两个样本,先看组间差异,再决定把剩余额度投向哪一组。这样做的代价是单页覆盖不全,但换来的是更快判断“问题是个别页面还是整站模式”。
挑选样本前,先把这次查询要验证的假设写成一句话。常见的假设有三类:某类模板页是否普遍收录异常;某个改版是否影响了抓取;某批新页面是否只是还没被处理。三种假设对应的样本完全不同。如果假设是模板问题,样本要覆盖同一模板下的不同内容深度;如果假设是改版影响,样本要包含改版前已有表现的页面和改版后新生成的页面。没有这句假设,抽样就会退化成随机点选,额度花完仍得不到可比较的结论。
额度紧张时,读者通常面对两种做法:按流量排序取头部页面,或按模板与目录分层取样。两者都合理,但成立条件不同。
判断依据可以看一个信号:如果头部页面和长尾页面的生成方式一致,优先分层;如果两者生成方式不同,分别取样,不要混在一组比较。
假设你手上有两百个页面,额度只够查二十次。可以按下面的顺序处理:
这里的关键动作是:先查“改动过”和“未改动”各一个样本。如果改动组出现同类异常而未改动组正常,下一步应把剩余额度集中投向改动组,而不是继续平均抽样。这个动作直接决定后续额度分配,而不是等全部查完再判断。
单看查询结果容易误判。至少同时记录三项对照:该页在站内是否还有可抓取入口、该页是否被其他页面链接、该页最近一次内容更新的大致时间。原因在于,查询结果异常可能有多种解释:可能是页面本身没被处理,也可能是入口被移除、内链被削弱,或只是更新时间太近尚未反映。若这些对照信息缺失,就不能把“查询无结果”直接当成页面质量问题。必要时,具体平台对某项状态的判定口径需要以该平台当时的说明为准。
假设某站有详情页和标签页两类模板,额度只够查十次。做法是:详情页改动组查两次、未改动组查一次;标签页改动组查两次、未改动组查一次。若发现标签页改动组两次都出现同类异常,而详情页两组都正常,则把剩余四次全部投给标签页改动组的不同内容深度样本。若两组都正常,则剩余额度用于验证入口和内链是否被削弱。这个例子的数字只用于说明比较方法,不代表任何真实站点的查询结果或额度规则。
当新增样本不再改变你的判断方向时,就可以停止。具体表现是:同一层内连续两个样本给出相同结论,且对照信息也一致。此时继续查同类页面,信息增量很低;更有效的做法是把额度转向尚未验证的层,或转向能区分原因的那一项对照信息。额度有限时的目标不是查全,而是尽快得到可执行的处理方向。