终止条件应该在试验开始前就写下来,而不是等数据出来再判断。它的作用是回答一个问题:什么情况下可以推广,什么情况下必须停。如果只规定“效果好就推广”,没有规定“多差算停”,试验页的数据往往会变成选择性解读的材料,推广决定会被期待而不是证据推动。
常见的情况是试验页的点击率或停留时间上升,但推广到全站后,整体指标没有同步变化。有人由此认为试验结论被推翻,也有人认为只是全站稀释了效果。两种解释都成立,区别在于试验页本身是否具有代表性。
如果试验页是自然流量较高、内容较完整的页面,它的表现可能来自页面自身条件,而不是这次改动。此时推广后没有变化,说明改动与结果之间的联系本来就弱。如果试验页与全站页面结构接近,只是样本量小,那么推广后没有变化更可能来自需求波动或采集口径差异,而不是改动无效。
第一种是绝对阈值终止:事先规定一个指标门槛,达到就推广,低于就停。它适合改动目标单一、页面之间差异不大的场景,比如统一调整标题标签的写法。代价是门槛设得过高会错过有效改动,设得过低会让噪声通过。
第二种是相对比较终止:把试验页与一组条件接近的对照页对比,只有当试验组稳定优于对照组时才推广。它适合页面差异大、流量分布不均的场景。代价是需要更多页面和时间,且对照页的选择本身会影响结论。
选择哪一种,取决于你能否找到足够接近的对照页。找不到对照页时,绝对阈值更容易执行,但要把结论限定在试验页范围内,不直接外推到全站。
要判断试验页表现是来自改动还是页面自身条件,可以检查三组证据。
这三组证据不能各自单独下结论。请求量、抓取量或某项统计归零,也不能单独证明处理正确,因为采集口径调整、页面被合并或统计工具变更都可能产生同样现象。
假设某站有 200 个内容页,先选 10 个页面试验新的段落结构,观察两周。事先写下的终止条件是:试验组与对照组的页面停留时间差值连续两周方向一致,且差异幅度超过采集波动范围,才推广;如果两周内方向反复,或对照页出现同向变化,则暂停并检查原因。
执行这个条件的结果是:如果触发暂停,下一步不是直接放弃改动,而是先核对流量来源和采集口径,确认没有外部干扰后再决定是否重跑。如果条件满足,推广也不是一次性全站替换,而是分批推进,每批保留对照页,以便在推广过程中继续观察。
终止条件只有落到具体动作才有意义。至少写明三件事:观察多长时间、看哪个指标、触发后做什么。触发后是停止、重跑还是缩小范围,要在试验开始前确定。
推广阶段同样需要终止条件。分批推广时,如果某一批的指标方向与试验阶段相反,应暂停后续批次并回到证据核对,而不是继续推完再解释。这样做的代价是推广周期变长,但换来的是每个决定都有可追溯的依据。
最后,一次改动前后的比较要考虑季节、搜索需求变化和数据采集差异,不能把同期发生的所有变化都算到改动头上。终止条件的价值不在于预测结果,而在于让推广决定有一个事先约定的边界。