结论不是“不能写”,而是必须把结论绑在能核验的那部分事实上:先列出缺口属于哪一类,再决定这个结论只能覆盖哪些页面、哪些时段、哪些渠道。补齐不了的数据不参与推断,只作为限制条件写进结论。
面对一份有缺口的检测资料,第一步不是找工具补数,而是判断缺口是怎么产生的。常见的有三类,处理方式完全不同。
把缺口归到哪一类,直接决定结论的措辞。采集缺失要写时段边界;口径差异要写“本结论只基于某一套口径”;归因缺失要写“总量可用,渠道拆分不成立”。
假设你手上是一个产品详情页的检测资料:站内统计显示该页近三十天访问下降,但其中约一周的日志因部署调整没有完整记录,第三方估算的曲线却相对平稳。这是一个典型的采集缺失叠加口径差异的场景。
可执行的处理顺序是:
做完这三步,结论的适用范围就自然浮现:“在可记录的时段内,该页访问呈下降方向;下降幅度因口径不同无法给出统一数值;断档时段不做判断。”这句话比“该页流量下降”更弱,但它可被复核,也不会在下一份资料出现时被推翻。
限定词不是免责声明,而是结论的组成部分。缺了它们,结论就超出了证据能支撑的范围。
一个可直接套用的句式是:“在〔口径〕下,〔对象〕于〔时段〕呈现〔方向〕;〔缺口类型〕导致〔哪部分〕无法判断。”把方括号内容替换成你实际核验过的事实,结论就既诚实又可用。
补齐历史数据往往不现实,但有几件事能提高后续结论的可信度,且不需要回填过去。
这些动作的结果会直接影响下一步:口径固定后,新结论可以与旧结论做方向对比而不必做数值对比;独立通道建立后,缺口再次出现时你能更快区分是采集故障还是流量真的变了。反过来,如果继续混用口径、继续用插值填断档,下一份结论仍然无法与这一份对齐,诊断就一直在原地打转。
假设某栏目页在站内统计中显示四周访问为 1000、980、1010、990,中间第二周有两天日志缺失;第三方估算同期给出 800、810、805、815。重叠的完整周里,站内统计基本持平,第三方估算缓慢上升。此时合理的结论是:“站内统计口径下该栏目页四周访问基本持平;第三方估算口径下呈小幅上升;两种口径方向不一致,说明该页变化幅度小于口径差异,不宜据此判断趋势。” 这个例子里没有推算收益,也没有把两组数字相加,只是用重叠时段的一致性来判断结论能走多远。数字仅用于说明比较方法,换成你手上的真实记录同样适用。
当缺口确实无法补齐时,结论的价值不在于覆盖全部事实,而在于让读者清楚知道哪部分事实被覆盖了、哪部分没有,以及下一次核对时应该从哪里接上。