抽查的目标不是重新评价顾问能力,而是找出“试做样本”和“批量交付”之间哪一项条件变了。试做阶段通常样本少、页面经过挑选、沟通轮次多;批量后页面类型变杂、模板复用、审稿被压缩。要判断问题出在哪,先固定一个可复现的抽查单元,再对比同一单元在两个阶段的表现。
按页面随机抽,很容易抽到试做阶段没覆盖过的类型,把“类型差异”误判成“质量下降”。更稳的做法是按页面模板 + 内容任务定义单元,例如“产品分类页 + 重写首屏与内链”“文章页 + 补充结构化小标题”。每个单元至少抽 5 个批量交付样本,再回看试做阶段同类样本是否真的存在。
如果试做阶段根本没有同类样本,说明批量变差这个判断本身缺少对照,应先补一个同类型的小样,而不是直接要求返工。这一步的动作是:列出批量交付里出现频次最高的 3 个单元,逐个标注“试做阶段有无同类”。结果会直接决定下一步——有同类就进入对比,没有同类就先补样。
表现变差通常来自三类原因,证据形态不同,处理方式也不同:
这三类原因会导向完全不同的动作:输入问题要改任务单和资料模板;执行问题要回到单元级返工并补样例;验收问题要先统一评分口径,再决定是否返工。
假设某批分类页在试做阶段首屏都写了使用场景,批量后有一半只写了参数罗列。抽查时先确认这 10 个页面是否属于同一模板、同一任务类型。若是,再核对任务单里“首屏必须包含场景句”这一条是否在批量任务中被删掉或写成可选项。
如果任务单没变、资料也没缺,但产出仍系统性偏移,说明是执行层问题,应要求顾问对同单元样本重做并说明判断依据;如果任务单里这条被弱化,问题在需求侧,改任务单比要求返工更有效。这个例子的数字只是说明比较方法,不代表任何真实项目的比例。
抽查结束后,不要直接给“整体返工”或“整体通过”的结论,而是按单元给出三种处置:
每次处置后记录一个可观察的后续信号,例如下一批同单元样本中该检查项的通过情况,用它判断问题是被解决还是被转移。抓取量、收录量或某个统计归零不能单独证明返工正确,它们还可能是抓取节奏、索引延迟或页面类型变化造成的,需要结合单元级对比再判断。
试做阶段表现好,本身不构成批量交付一定合格的依据,因为试做样本往往经过挑选、沟通轮次更多、审稿人更集中。反过来,批量阶段个别样本差,也不等于整体质量下降,可能只是新页面类型尚未建立样例。抽查要成立,前提是两批样本属于同一单元、同一验收口径、同一资料完整度;三者任一不同,结论就只能限定在对应条件下,不能推广到全部交付。