确定异常开始时间,不能只看“今天流量掉了”这个感觉,而要找到第一个可验证的偏离点:把站内统计、第三方估算和服务器日志按同一时间粒度对齐,逐个时段比对基线,最早出现稳定偏离且后续不再回到正常区间的那个时段,就是异常开始时间。单看某一个指标容易误判,必须用多条证据交叉确认。
在动手查之前,先把“正常”定义清楚,否则任何波动都会被当成异常。需要明确三件事:
多人协作时,把口径写成一句话放进交付文档,例如“对比口径:站内统计会话数,按天,基线为前四周同星期几中位数”。后续所有人用同一口径,能减少大量返工。
关键是不要只盯一个数字。把下面三类数据放在同一时间轴上:
具体操作:把三条曲线画在同一张按天排列的表里,从异常当天往前逐日回溯,找到第一个三条同时开始偏离的日期。如果只有一条偏离,先怀疑该数据源本身的问题,而不是站点流量问题。
短例子(假设):某站点发现周三流量下降。逐日回溯后,站内统计从周一开始低于基线,服务器日志从周一开始同步下降,第三方估算周二才出现下降。此时异常开始时间应定为周一,周二只是第三方数据更新滞后造成的表象。
找到候选时间点后,还要验证它是不是真的异常起点,而不是被其他因素干扰。逐项检查:
只有排除了口径变化和已知外部因素后,剩下的稳定偏离点才能作为异常开始时间写进结论。判断结果分两种:三条证据一致偏离,可确认;只有一条偏离,标记为“待核实”,继续查该数据源。
确定开始时间后,交付文档里应写清四件事:异常开始时间、对比基线、使用的数据源与口径、排除项。这样接手的人不用重新推导。后续每天用同一口径更新曲线,观察是否回到基线;如果持续偏离,再向下拆解到具体页面、来源或设备。
多人协作时,建议固定一个记录格式,例如按“日期—站内会话—日志请求量—第三方估算—备注”逐行填写,备注里写明当天是否有投放、改版或抓取异常。这样下一次出现波动时,可以直接复用同一套表定位起点,减少重复沟通。
下一步:打开站内统计和服务器日志,按天导出最近八周数据,先算出前四周同星期几的中位数作为基线,再逐日比对,标出第一个偏离点。