暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

万字长文|抽样技术的奇幻漂流:从买菜砍价到A/B测试

332
作者:韩云飞


为什么不能全部尝试?

——抽样的艺术



 菜市场砍价为何能让你省钱?

 —— 砍价中的抽样智慧  


想象一下:周末早晨,你走进菜市场,准备买些新鲜蔬果。整个市场摊位林立,价格高低不一。如何用有限的时间找到 最实惠的价格?这是一个需要积极主动收集样本的场景,而非被动等待信息送上门来!


老练的主妇从不会坐等一个摊位,而是主动走访多个摊位,对比询价,建立自己的"价格地图"。


这种主动收集样本的过程就像数据科学家构建数据集一样——从各个来源获取信息,而非依赖单一渠道。通过探索性的抽样,她们可以全面了解市场行情,为后续的砍价谈判做好准备。


图1:菜市场砍价中的抽样


而砍价的艺术更是抽样建立参考系统的典范。当商贩喊出"这青菜 10 块钱一斤"时,经验丰富的顾客会立刻判断这是否合理。


他们凭什么判断?正是基于他们主动构建的"价格参考系统"——通过持续周期性地在不同市场、不同时段抽样收集的各类蔬菜价格信息。根据消费者行为研究,熟练买家会逐渐建立完善的价格参考框架,这个动态更新的参考系统就是科学抽样与数据积累的生活应用。


砍价高手的抽样技巧:

1. 多点取样:不同摊位询价,建立参考系,就像科学实验不会只测一次

2. 分时抽样:知道不同时段(早市 vs 晚市)价格有差异,选择最佳时机,这正是分层抽样的体现

3. 假设检验:当商家说这是最低价了,砍价高手会说隔壁摊便宜两块来检验这个假设是否成立

4. 持续更新:每次购物都更新价格数据库,提高未来判断的准确性,这就是贝叶斯学习的实际应用


让我们继续我们的抽样之旅,看看更多生活中隐藏的抽样智慧。



为什么厨师不会品尝整锅汤?

—— 小样本的强大效率


如果说菜市场砍价展示了主动收集样本构建参考系统的艺术,那么厨师尝汤则完美诠释了最小样本推断整体的效率原则。


想象一下:一位厨师在烹饪一大锅汤。他需要知道汤的味道如何,但他不可能(也没必要)喝完整锅汤来判断—— 这不仅浪费时间,还会让顾客饿肚子!而仅凭一小勺汤,熟练的厨师就能准确判断整锅汤的味道,体现了最小量抽样的惊人效率。


图2:厨师尝汤判断整锅味道


这种"一滴知海"的抽样效率是大数据时代的核心智慧。


即使在海量数据面前,我们也不需要分析所有数据,而是通过精心设计的最小样本量获取最大信息量。根据现代抽样理论,当样本抽取方法得当时,仅需总体的极小部分就能获得具有统计代表性的结论,就像厨师用一小勺就能掌握整锅汤的味道。


这种"小中见大"的效率是抽样科学最迷人的特质之一。


从菜市场砍价、厨师尝汤,到互联网公司的 AB 测试,核心思想惊人地相似:通过有限样本推断整体,通过部分接触获取全局信息。我们的砍价高手、饭店厨师和数据科学家都在用抽样的艺术解决实际问题,只是规模和工具不同罢了。



  采样有几种花式玩法?


1. 简单随机抽样:就像抽奖一样,每个人都有平等的机会被抽中。这是最公平但也最"朴素"的抽样方法。想象一 个巨大的彩票桶,所有号码平等地翻滚着。


2. 分层抽样:先把人群分成不同"帮派",再从每个帮派中随机抽人。就像选班干部,要确保男生女生都有代表, 不能全是一个性别。


3. 整群抽样:把总体划分为自然形成的"村落",然后随机选几个村子查访。这就像调查某个城市,你不会挨家挨 户敲门,而是选几个社区代表整座城市。


4. 系统抽样:按固定节奏抽人,如"每第 10 个进店的顾客"。想象排队时数"1、2、3...",每当数到 10 就抽查一 位幸运顾客。


5. 自适应抽样:根据已获得的情报,动态调整抽样策略。这就像侦探办案,根据线索不断调整搜查方向。



  如何确定真相还是巧合?

  —— 假设检验  


这里我们要感谢一位叫罗纳德·费舍尔的天才,他在20世纪20年代就搞明白了区分巧合和真相的科学方法。想象一下法庭审判:我们假设被告"无罪"(原假设),然后寻找证据。


如果证据足够强烈反对"无罪"假设,我们才会推翻它,判定"有罪"。同样,在 AB 测试中,我们假设两个版本没有差异,然后用数据来检验这个假设是否成立。根据假设检验理论,这种方法能有效控制我们错误拒绝真相的概率。


一、假设检验:科学界的"法庭审判"


1.  提出"嫌疑人无罪"(原假设)和"嫌疑人有罪"(备择假设)。比如:"新设计和旧设计点击率一样"vs"新设计点击率 更高"


2. 收集"证据"(数据)并计算关键统计量(如点击率差异)


3. 设定"定罪标准"(显著性水平,通常为 0.05,即有 5% 的可能性冤枉好人)


4. 比较证据强度(p 值)与定罪标准


5. 如果证据足够强(p 值小于 0.05),则推翻原假设;否则保留原假设


二、统计学的两大法宝


AB 测试依赖两个关键的统计学原理:


1. 大数定律:样本量越大,真相越清晰。就像看电影的像素——像素太少时一片模糊,像素越多,画面越清晰。


2. 中心极限定理:不管对象有多怪异(总体分布),只要样本足够多,样本均值的分布就会变得像钟形曲线一样优雅。 这就像是魔法——无论素材多么混乱,最终都能调和成和谐的形状。


这些神奇法则确保了我们的抽样之旅不会迷路。不过,船票可不便宜——根据科学研究,你的样本至少需要30 个单位才能启航,而要抵达"可靠结论岛",往往需要成千上万的样本。


让我们继续我们的抽样冒险,看看如何将这些抽样原理 应用到实际的 AB 测试中,进一步发展我们的抽样技能。


图3:假设检验的统计原理




如何科学的“扳手腕”

——AB测试基础



  两个设计怎么分高下? 


想象一下,你和朋友开了家咖啡店,但无法决定店门应该漆成红色还是蓝色来吸引更多顾客。与其争论不休,不如做个实验:周一周三周五用红门,周二周四周六用蓝门,周日休息,然后比较哪种颜色带来更多顾客。


这就是 AB 测试的雏形——通过对比不同设计在真实环境中的表现,让数据说话。


但等等,这个方法有个明显漏洞:周末和工作日的客流本来就不同!这种抽样方式会导致结果偏差。


更好的方法是什么?没错,同一时间随机分配顾客——让一半人看到红门,一半人看到蓝门。根据行业研究,这种随机分配能有效消除时间、天气等外部因素的干扰,让抽样更具代表性,测试结果更加可靠。


AB 测试的三大超能力:


1. 预知未来:小范围测试新想法,避免把"毒药"喂给所有用户——就像电影试映会,先让小部分观众尝鲜,收集反馈后再决定是否全球上映


2. 分身术:同时测试多个方案,节省宝贵时间——就像复制出多个平行宇宙,看看每个宇宙中的决策会带来什么


3. 结果思维净化:用数据代替直觉和拍脑袋——就像用显微镜代替猜测,让你看清事物的本质而非表象



  如何设计一场完美的 AB 测试? 


1.  找到真正痛点:

就像侦探找嫌疑人,先要确定案发现场和作案动机。你的"案发现场"在哪?是用户注册流程太复杂?还是购物车放 弃率太高?找准问题,才能对症下药。


2.  设计实验方案:

这是你的"侦查计划"——确定要测试的变量。比如,测试蓝色 VS 绿色按钮,或长文本 VS 短文本。记住:好的测试 只有一个变量,否则就像同时审问多个嫌疑人,无法确定谁在说谎!


3.  选择关键指标:

确定你的"定罪证据"——是点击率?转化率?平均订单金额?这些指标应直接反映你的业务目标,就像 DNA 证据直 接链接嫌疑人和犯罪现场。


4.  样本量计算:

这是确定"侦查规模"的关键步骤。太小的样本就像证据不足,可能导致无辜者被定罪;太大又浪费警力资源。根据行业最佳实践,你需要基于基线转化率、最小期望提升和显著性水平计算所需样本量。


5.  执行实验:

现在开始你的侦查行动!启动实验,监控进展,但切记不要过早下结论——就像侦探不会在收集到第一条线索就宣布破案。


6.  数据分析:

这是你的"案件陈述"环节——分析证据,判断是否达到定罪标准(统计显著性)。记住,p 值小于 0.05 意味着你有 95% 的把握认为差异是真实存在的。


7.  行动决策:

根据分析结果,决定是推广获胜版本,还是设计新实验?就像法官根据证据做出"判决"——有罪、无罪或需要进一步调查。


  样本要多大才靠谱? 


一、样本量计算


这就像问"钓多大的鱼才能吃饱?"——答案取决于很多因素。样本量计算是 AB 测试中最科学也最容易被忽视的环节, 涉及以下关键要素:


1. 基线转化率:你的起点在哪里?一个 1% 的基线转化率和 10% 的基线转化率需要的样本量差异巨大


2. 最小可检测效应 (MDE):你想检测多小的变化?想发现 0.1% 的差异比发现 1% 的差异需要大得多的样本


3. 统计显著性水平:你的"定罪标准"多严格?通常设为 95%,即允许 5% 的误判率


4. 统计检验力度:你发现真实差异的能力多强?通常设为 80%,即有 80% 的几率发现真实存在的差异


想象你正在尝试改进网站按钮,希望提高点击率。现在的点击率是 2%,你期望新设计能提高到 2.5%。该用多大样本? 这里有个"魔法公式":


n = 16 * (p1(1-p1) + p2(1-p2)) (p2-p1)²


带入 p1=2%,p2=2.5%,我们得到每组需要约 12,264 个样本!这意味着总共需要约 24,528 个访问者才能可靠地检测这个差异。


二、实验要跑多久?时间与样本的平衡艺术


想象你在做一项关于人们饮食习惯的研究,但只在感恩节那天收集数据——你认为结果会有代表性吗?当然不会!


同样,AB 测试也需要覆盖足够长的时间周期,捕捉用户行为的自然变化。根据行业标准,一个完整的实验至少应覆盖一个 业务周期(通常 1-2 周),确保包含工作日和周末的行为差异。


三、AB 测试中的"七宗罪"


罪名

忏悔指南

偷看罪

莫要因为半途看到"有利"结果就提前结束测试——这就像考试作弊,会让你的决策建立在幻觉上

小样本罪

别像捡了几颗贝壳就宣称理解了整个海洋——预先计算所需样本量,确保数据充分

多变量混乱罪

一次只测一个变量,否则就像同时吃了十种药,不知道哪种起了作用

短视罪

别忘了关注长尾效应——有些药效慢,有些变化需要时间才能显现

分流不均罪

确保公正抽签,让贫富、老幼、男女都有均等机会进入各组——科学的随机分配是实验的基石

单一指标崇拜罪

不要只关注一个指标而忽视整体——这就像只看体重不看健康指数,可能让你错失真正的改进机会

忽视季节性罪

没有考虑时间、节假日等外部因素——就像在冬天测试空调效果,再惊讶为何销量不佳



流量分身术:

重叠正交流量框架



 当实验需求爆炸时,

 传统 AB 测试遇到了瓶颈 


在上一章中,我们了解了传统 AB 测试的基本原理和流程——将用户随机分为两组,一组看到新版本,一组看到旧版本,然后比较结果。


这种方法在小规模测试中运行良好,就像我们的咖啡店例子,测试门的颜色就足够了。但当我们把目光转向谷歌、Facebook、亚马逊这样的互联网巨头,情况就完全不同了。


想象一下:作为产品经理,你每周收到来自 20 个团队的实验请求,每个团队都想测试自己的新功能或优化方案。如果按照传统 AB 测试方法,每个实验需要 10% 的用户流量,那么你每周最多只能运行 10 个实验(100%÷10%=10)。


剩 下的团队只能排队等待,这会严重拖慢产品迭代和创新速度。根据微软的研究,实验速度直接影响着公司的创新能力和市场竞争力。


具体来说,想象你经营一家美食评测机构,每天只有 100 位尝鲜顾客。如果每次测试一种新菜品需要 50 位顾客,那么一天最多只能测试两种新菜。


但如果同时有 10 种新菜等待测试,按传统方法可能需要 5 天才能完成!这就是大型互联网公司面临的困境:实验需求多,但流量有限。


聪明的厨师会怎么做?也许可以让每位顾客同时品尝主菜和甜点,这样就能同时测试两种不同类型的菜品。根据Google 的研究,通过巧妙设计的重叠流量框架,可以让同一批用户同时参与多个互不干扰的实验,大幅提高实验效率。


这就像在厨师尝汤的基础上,发展出了更高效的抽样策略——一小勺汤能同时测试多种调料的效果。


图 4:重叠正交流量框架的结构与原理



  正交与互斥是什么魔法?


一、三个关键概念


1. 正交:不同实验层之间像平行宇宙,互不干扰。当一个用户穿越每层实验时,都会重新随机分配,就像每进入一个新游戏都重新掷骰子决定角色,之前的结果不会影响新的分配。


2. 互斥:同一层内的实验像争夺同一块领地的军队,不共享地盘。一个用户在同一层只能参与一个实验,就像你不能同时穿两条裤子。


3. 实验层:一个逻辑上的流量容器,就像一个游戏服务器,可以容纳多个互不相容的游戏模式。每个服务器都有完整的玩家池,但按不同规则分配玩家。


用一个有趣的比喻来说明:假设有 100 个乒乓球(代表用户),我们想同时做两项实验。第一项测试球的颜色(红 vs蓝),第二项测试球的形状(方 vs 圆)。


如果使用正交设计,我们会先随机将球分成红蓝两组。然后,不管球的颜色,再随机分配形状,这样红球和蓝球都会被均匀地分到方形和圆形组。这就确保了颜色实验和形状实验互不干扰,都能得到准确结果!



  流量分层是如何工作的?


在重叠正交流量框架中,分层就像魔术师的核心技巧,让一位观众同时参与多个互不相关的魔术。每个独立实验是一层,层与层之间的流量是正交的,就像平行世界。


一、分层实验:魔术师的分身术


1.  将总流量想象成 1000 张扑克牌(哈希桶),每张牌代表流量的千分之一

2.  每个实验根据需要抽走一定数量的牌,比如要 20% 流量就拿走 200 张牌

3.  用户通过魔法算法(哈希函数)与特定牌相关联,决定是否参与实验

4.  同一层的不同实验拿走不同的牌,确保互斥

5.  不同层的哈希计算相互独立,就像每层都重新洗牌


魔术背后的技术秘密:


分流服务使用"用户 ID+ 层名称"或"设备 ID+ 层名称"作为魔术咒语(哈希键)

咒语产生一个 0-999 的数字,决定用户落入哪个流量桶

同一用户在不同魔术(层)中的分配完全独立

分流服务确保同一用户在每次访问时看到一致的魔术效果,避免混淆


  还能变出更复杂的魔术吗? 


基于正交实验的魔法,我们可以构建更复杂的嵌套实验结构,就像魔术师的套娃把戏。这种结构允许:


1. 将总流量先划分为几个大池子,称为"域"(相互不重叠)

2. 在每个域内再设置多个"层"(正交关系),就像每个水池都有多层鱼

3. 层内可以继续嵌套域,形成复杂的俄罗斯套娃结构

4. 轻松应对各种复杂需求,让有限流量产生最大价值



  这魔术能用在哪里? 


魔术场景

如何变魔术

揭秘魔术

保留 1% 观众不看魔术,用于对比其他 99% 看了魔术的观众反应,长期观察魔术效果

魔术组合

评估多个魔术同时表演的效果,看是相互增强还是互相干扰

功能魔术

多位魔术师同时表演不同魔术,但不希望彼此干扰观众体验

反转魔术

在原本不看魔术的观众中抽一小部分让他们看魔术,观察长期效果


这种抽样魔法框架适用于各种互联网产品,特别是在谷歌、Facebook、亚马逊等用户规模庞大、实验需求繁多的巨头中尤为常见。


根据行业实践,这种方法已在推荐系统、广告、内容分发、电商等领域大展魔力。但随着抽样场景越来越复杂,我们面临的不仅是如何有效利用有限流量的挑战,还有更多独特的抽样困境。


比如,当我们需要在海量数据中寻找 极其罕见的事件时,该怎么办?让我们探索这些特殊环境下的抽样技术。



大海中的几滴墨水:

稀疏场景的抽样困境



  当大海里只有几滴墨水? 

  —— 稀疏场景的抽样困境  


在上一章节,我们探索了如何在资源有限的情况下高效开展多个实验。但有些时候,我们面临的不是资源不足,而是信号太稀疏!


想象一下,你在寻找海洋中的几滴墨水,或是在繁星点点的夜空中寻找特定的一颗新星。这就是稀疏场景抽样的本质挑战——目标过于稀少,常规抽样方法难以捕捉。


稀疏场景在互联网产品中无处不在:反欺诈系统需要检测极少数的欺诈行为;安全系统需要发现罕见的漏洞利用;推荐系统需要为小众兴趣用户提供合适内容。


根据Cornell University 的研究,在这些场景中,传统随机抽样往往捕获不到足够的"稀有物种",就像在大海捞针,很可能一无所获。


稀疏场景的三大抽样陷阱:


1. 无效样本陷阱:随机抽样可能抓取大量无目标样本,就像钓鱼时可能一整天都钓不到鱼


2. 类别不平衡陷阱:正常样本与异常样本比例严重失衡,导致模型"懒惰"地预测全部为正常也能获得高准确率


3. 统计显著性陷阱:稀有事件太少,难以达到统计学上的可靠结论,就像只见过一个外星人就试图描述整个外星文明



  如何在干草堆中高效找到针?

  —— 稀疏抽样的妙招  


面对这些挑战,数据科学家们开发了一系列专门的抽样技术:


一、过采样与欠采样魔法


想象你是魔术师,需要在魔术表演中展示稀有的黑色纸牌。为确保观众能看到它们,你可以使用两种策略:


1. SMOTE过采样法:不是简单复制稀有样本,而是在稀有样本之间创造出"人造双胞胎"。根据机器学习研究,这种方 法能增加稀有样本多样性,避免过拟合。


2. 随机欠采样法:减少常见样本数量,就像从一副牌中移除部分红色纸牌,使黑色纸牌占比增加。


3. 组合采样法:同时使用过采样和欠采样,既增加稀有事件,又减少常见事件,达到最佳平衡。


二、异常检测雷达


有时,我们不是寻找已知类型的稀有情况,而是想发现"看起来不对劲"的异常。这就需要异常检测技术:


1. 密度探测器测量样本所在区域的"拥挤程度",孤立的点被视为异常。就像在拥挤的派对中独自站着的人更容易被注意到。


2. 距离分析仪计算每个样本到其邻居的距离,离群点被识别为异常。就像测量每个人与周围人的社交距离。


3. 集成侦探队多种异常检测方法投票,只有获得多数"怀疑票"的样本才被标记为异常,减少误报率。


根据异常检测研究,这些方法在网络安全、金融欺诈和产品质检等领域表现出色,能在海量数据中找出值得关注的"异常针"。


图 5:稀疏场景的特殊抽样方法示意图




  稀疏场景中的渐进式分析方法  


面对稀疏场景,我们可以采用渐进式分析方法——就像登山时先俯瞰全景,再关注特定稀有目标:


1. 全局视角:先用传统方法看整体趋势,获得大致方向

2. 稳健分析:使用中位数、百分位数等抗干扰指标,减小极端值影响

3. 分层深入:将数据按特征分层,分别分析不同层级的稀有事件

4. 针对性聚焦:对稀有事件单独设计实验,使用特殊抽样技术


  真实案例:

  电商平台的稀有宝石探秘  


任务简报:

某电商平台需要研究网站中罕见但极高价值的——$1000+ 高价订单。这类订单只占总数的 0.1%,但贡献了 15% 的收入。平台想测试新的高端商品推荐算法,面临两大挑战:高价订单太少且波动大。


行动方案:

部署分层抽样,确保各价格段订单在实验组和对照组分布均衡

对高价订单进行 SMOTE 过采样,增加稀有样本数量

设计特殊归因模型,追踪推荐引擎对高价订单的贡献

延长实验周期至 60 天,提高统计可靠性

使用对数转换处理订单金额,减小极端值的扭曲效应


任务结果:

新算法成功提升高价订单比例 18%,保持转化率稳定。特殊抽样技术使实验周期缩短 40%,加速产品迭代。


稀疏场景的抽样技术,极大拓展了我们的抽样工具箱。从过采样到异常检测,这些技术帮助我们在信号稀少的数据海洋中更准确地捕捉关键信息。


但即使能够有效处理稀疏场景,我们仍然面临另一类挑战——如何处理数据中的"巨无霸", 即那些可能完全扭曲整体结果的超级用户。这些数据巨鲸需要特殊的捕获和驯服技术。



驯服数据巨鲸

超级用户的抽样技术



 当巨鲸搅动海水:

 超级用户如何颠覆 AB 测试


想象一片平静的数据海洋,突然几头巨型蓝鲸闯入,掀起滔天巨浪,扰乱整个生态系统。


这就是超级用户在 AB 测试中 的真实写照——它们虽然数量稀少(通常不到总用户的 5%),却能产生不成比例的影响力,有时贡献超过 50% 的活动量或收入。


根据AB测试研究,一个拥有 100 万日活的应用,可能存在几百个用户的行为量是平均水平的 100 倍以上!


图 6:数据海洋中的"巨鲸效应" 

- 少数超级用户如何影响整体分析结果



这些"数据巨鲸"对 AB 测试构成了独特挑战:假设你在测试新版电商页面对平均订单价值 (AOV) 的影响,如果几个超级用户恰好随机分配到了实验组,他们的巨额订单可能完全掩盖了普通用户的真实反应模式。


这就像天文学家观测恒星时,突然有几颗超新星爆发,其亮度掩盖了其他所有恒星的光芒。根据统计学研究,含有超级用户的样本往往导致方差异常膨胀,使得统计显著性难以达成,或者得出误导性结论。


超级用户如何破坏 AB 测试的四种方式:

均值扭曲:少数超级用户拉高整体平均值,掩盖普通用户的真实反应。例如,电商平台测试中,一个实验组多了几笔万元大单,平均订单金额立刻飙升,即使 99% 的普通用户行为没有实质变化


方差膨胀:超级用户导致数据分布极度不均,标准差暴增,这会导致 AB 测试需要收集多达 5-10 倍的样本量才能达到统计显著性


随机分配失衡:由于超级用户稀少,在实验组和对照组的分布很容易失衡。想象有 10 个超级用户,随机分组后可能 7 个进入实验组,3 个进入对照组,立刻造成巨大偏差


真实信号淹没:对大多数普通用户有效的产品改进,可能被超级用户的行为波动完全淹没。就像尝试听到轻柔的小提琴声,却被突如其来的雷鸣掩盖



  捕鲸前的准备:

  如何精准识别数据中的巨鲸?


要开始驯服这些数据巨鲸,第一步是精确识别它们的存在。这就像天文学家需要先找出夜空中最亮的恒星,才能研究它们的特性。


在 AB 测试实践中,有多种科学方法可以识别超级用户:


1. 绝对阈值法:根据业务知识设定明确阈值,例如"月消费超过 10000 元的用户"或"日均活动超过 100 次的用户"。这种方法简单直接,但缺乏科学依据,且难以适应不同业务场景


2. 百分位数法:将用户按活跃度或价值排序,取前 1% 或 5% 为超级用户。根据AB 测试最佳实践,这是业界最常用的识别方法,兼具简便性和有效性


3. MAD 法:中位数绝对偏差 (Median Absolute Deviation) 方法,找出偏离中位数超过一定倍数 MAD 的用户。该方法对 数据分布假设较少,比基于均值的方法更稳健,特别适合偏斜严重的数据


4. 多维聚类法:不只看单一指标,而是综合考虑用户的多维特征(消费频率、单次金额、使用时长等),通过机器学习 算法如 K-means 聚类识别特殊用户群体。这种方法能够发现更复杂的超级用户模式



  七种专业驯鲸技术:

  AB 测试中的超级用户处理方法  


识别出超级用户后,我们需要特殊的"捕鲸设备"来妥善处理它们的影响。这里介绍七种在 AB 测试中处理超级用户的专业技术,从简单到复杂:


1. 完全排除法在 AB 测试分析中完全排除超级用户数据。优点是简单直接,缺点是可能丢失有价值信息,这种方法适合当你主要关注普通用户体验,且超级用户行为确实属于异常值的场景


2. 分群对比分析将用户按活跃度或价值分组(如低、中、高价值用户),分别进行 AB 测试分析。这种方法不仅避免了超级用户的干扰,还能揭示产品变化对不同用户群体的差异化影响,提供更丰富的洞察


3. 预实验分层在实验开始前识别超级用户,确保它们在实验组和对照组中均匀分布。这种分层抽样技术可以显著降低方差,提高实验的统计检验力


4. 修剪/截尾技术保留超级用户,但将其极端值"修剪"到更合理范围内。例如,将超过第 99 百分位的值统一替换为第 99 百分位值。这种方法保留了用户存在,但限制了其极端影响


5. 对数/开方变换对指标应用数学变换(如对数、平方根),压缩数值范围,减小超级用户与普通用户间的差距。例如,订单金额从 [1,100,000] 的范围经对数变换后变成约 [0,5] 的范围,极大降低了离群值的影响


6. 稳健统计量替代使用对异常值不敏感的统计指标,如使用中位数代替均值、四分位差代替标准差。中位数是存在超级用户时最稳健的集中趋势度量


7. CUPED方差缩减利用实验前的历史数据作为协变量,构建更精确的实验估计器。这种高级技术可以显著降低超级用户引起的方差膨胀,根据研究,可以减少高达 50% 的所需样本量



  超级用户的双面性:

  AB 测试的挑战与机遇并存  


在处理 AB 测试中的超级用户时,我们需要认识到它们的双面性。


一方面,它们可能扭曲实验结果;另一方面,它们往 往是最有价值的用户群体,可能提供关键业务洞察。


根据哈佛商业评论的研究,顶级 5% 的客户通常贡献了 30-40% 的 收入,并且是品牌的重要拥护者。


超级用户在 AB 测试中的特殊价值:


1. 关键收入来源超级用户通常贡献不成比例的高收入,特别是在游戏、订阅服务和高端电商领域。新功能对这一群体的影响可能直接决定产品的财务成败


2. 早期采用者超级用户往往是功能早期尝鲜者,他们的使用模式可能预示着普通用户未来的行为趋势,为产品演进提供前瞻性指引


3. 产品反馈源泉超级用户对产品的了解最深入,能提供最详细、最有价值的反馈。超级用户的意见往往比随机调查更具洞察性


4. 特征敏感检测器由于使用频率高,超级用户往往能更快发现产品微小变化带来的影响,使 AB 测试对微小效应更敏感



  现实战场:

  金融科技平台的数据巨鲸驯服实战  


一、任务简报:

某领先金融科技平台在 AB 测试新交易界面时遇到了棘手问题:即使内部使用反馈一致好评,A/B 测试数据却没有显示统计显著的改进。深入调查发现,平台 1% 的交易员贡献了 45% 的交易量——这些"交易巨鲸"的随机分布严重影响了测试结果的可靠性。


二、行动方案

部署"巨鲸雷达"——使用交易量分位数分析 (基于 MAD) 识别超级交易员,发现了约 200 名交易量异常高的用户;

采用分层抽样技术,确保超级交易员在实验组和对照组的比例完全一致,消除随机分配不均的风险;


实施多元分析策略:

对全体用户数据应用对数变换后分析

对排除超级交易员后的普通用户单独分析

对超级交易员群体单独进行深入分析

使用中位数交易量和交易频率作为主要度量指标,减少极端值的影响

应用 CUPED 技术,利用用户历史交易行为作为协变量,进一步降低数据方差


三、分析结果

改进的分析方法揭示了惊人事实:新界面显著提升了绝大多数普通用户 (占比 99%) 的交易体验,交易频率平均提高 15%。


而超级交易员由于已熟悉旧界面流程,反而体验略有下降 (-3%)。这解释了为何初始 AB 测试未显示显著效果——超级用户的微小负面反应掩盖了大量普通用户的正面体验。


四、最终决策

平台为普通用户推出新界面,同时为超级交易员提供了保留旧界面的选项。这个差异化策略在上线后的三个月内,整体平台活跃度提升 12%,新用户留存率提高 18%,证实了处理超级用户数据的价值。


超级用户抽样技术的前沿应用


随着数据科学和实验设计的发展,处理 AB 测试中超级用户的方法也在不断演化。以下是一些前沿应用:


1. 自适应分层实验:系统在实验过程中动态识别超级用户特征,并实时调整分层策略,确保实验组和对照组持续保持平衡。根据Twitter 工程博客,这种方法能显著提高长周期实验的可靠性


2. 分位数回归分析:不只关注均值差异,而是分析产品变化对用户行为分布不同分位点的影响,全面了解超级用户、普通用户和低活跃用户的不同反应模式


3. 超级用户细分实验:专门针对超级用户设计的 A/B 测试,采用更高精度的指标和更长的观察周期,深入了解高价值用户的偏好


4. 超级用户成长路径分析:研究普通用户如何逐步发展为超级用户的轨迹,为用户成长策略提供数据支持。根据Google研究,这种分析能指导更精准的用户生命周期管理


在数据海洋中驯服这些"巨鲸"不仅是 AB 测试技术问题,更是产品思维的体现。


通过科学识别和处理超级用户,我们能获得更准确的实验结果,发现不同用户群体的独特需求,最终打造更符合各类用户期望的产品体验。成功驯服这些"数据 巨鲸",是迈向高级 AB 测试实践的关键一步。


随着我们继续探索抽样的奥秘,下一章我们将面对更复杂的挑战——当用户不再是孤立的个体,而是相互关联、相互影响的网络节点时,AB 测试又该如何设计?让我们一起探索社交网络测试的独特魅力。




好友间的蝴蝶效应

社交网络测试技术



  朋友圈测试为何如此棘手?

  —— 社交网络的抽样挑战  


我们已经探讨了基础抽样和重叠正交抽样,还了解了稀疏场景和超级用户的特殊抽样方法。但现实世界中还有更复杂的场景。


想象你在测试一个新的朋友圈功能:A 组可以给好友点"超级赞",B 组只能普通点赞。


问题来了:如果张三(A 组)给李四(B 组)点了"超级赞",李四会看到什么?这就是社交网络测试的典型困境——用户不是孤立的,而是相互关联的,传统抽样方法在这里遇到了挑战。


图 7:社交网络互动场景



社交网络测试违反了 AB 测试的基本假设——SUTVA(Stable Unit Treatment Value Assumption,稳定单元处理值假设),即假设用户之间相互独立。


根据行业研究,当用户 A 的体验会影响用户 B 的行为时,传统 AB 测试就会出现问题,就像调查人们是否会打喷嚏,却忽略了打喷嚏本身会传染!



  如何在社交网络中正确抽样? 


面对社交网络的特殊性,科学家们开发了一系列专门的抽样"武器":


武器一:社交预测雷达


这种方法就像未卜先知,通过分析历史互动数据,预测用户之间未来可能的互动强度。想象你有一台雷达,可以预测谁和谁可能成为好友。步骤如下:


1. 收集用户历史互动数据(如私信、点赞、评论)

2. 训练一个"友谊预测机"(逻辑回归模型)

3. 用这台机器识别最可能互动的用户对

4. 验证预测准确度(通过召回率、准确率等)


武器二:社交聚类护盾


根据实战研究,好的社交隔离能将"实验泄漏"控制在最低水平,就像优秀的疫情防控,将传染风险降到最低。


这是社交网络实验的防护罩,它能阻止实验"污染"扩散。想象你在生物实验中建立隔离区,防止不同样本相互污染。关键步骤:


1. 绘制全息社交地图,看清所有人之间的联系

2. 使用特殊算法(如 Ego-clustering)将紧密联系的用户分到同一"隔离区"

3. 确保好友圈整体进入同一实验组,避免跨组污染

4. 持续监控"防护罩"完整性,防止实验污染

5. 用特殊仪器(饼图分析和串组率指标)评估隔离效果


图 8:社交网络随机化抽样过程



  如何评估社交网络实验的效果? 


社交实验需要特殊的测量仪器和指标:


1. 串组率扫描仪:测量不同实验组用户之间互动的比例,低串组率表示良好的社交隔离效果

2. 饼图分析器:直观显示用户分布情况,帮助实验者一眼看出"泄漏"状况

3. 网络溢出探测器:量化实验对非实验用户的"涟漪效应"

4. 群体雷达:不仅关注个体变化,还要监测整个社区的活跃度、信息流动速度等宏观指标



  真实案例:私信实验的隐形战役  


任务简报:

某社交平台面临一个棘手任务:测试新的私信快捷回复功能。挑战在于私信需要两个人——如果张三能用快捷回复,而李四看不到,这体验就像对牛弹琴,极其怪异!


特工行动方案:

部署高级 AI 模型(LR 模型)预测用户间私信概率

根据情报构建完整社交地图

启动特殊聚类算法,将经常私信的用户分入同一阵营

在隔离区内进行实验,监测私信互动指标

持续监控"防护罩"完整性,防止实验污染


任务结果:

行动成功!实验"泄漏"大幅减少,数据可靠性显著提升,为产品迭代提供了可靠情报。


值得注意的是,社交网络实验需要格外关注用户隐私和体验伦理。根据研究,实验设计应平衡科学严谨性和用户体验一致性,避免造成"信息孤岛"和用户困惑。


随着我们探索的场景复杂性不断提升,让我们继续深入另一类高度互动的场景——双边市场,看看当买家与卖家这两个不同群体相互影响时,抽样技术如何进一步演化。




买家和卖家的双人舞

双边市场的抽样技术



  当两方都重要时如何测试? 


从社交网络的互联用户,我们来到另一个抽样挑战——双边市场。


想象一个交友应用:有男生也有女生。如果你改进了 女生界面,可能吸引更多女生;更多女生又会吸引更多男生;更多男生又反过来吸引更多女生...


这就是典型的双边市场——两类用户相互依赖、相互影响,抽样变得更加复杂。根据行业分析,电商平台(买家 - 卖家)、约车服务(乘客 - 司机)、内容平台(创作者 - 读者)都属于这类市场。


图 9:双边市场反馈循环



双边市场的 AB 测试面临四大挑战:


1. 资源争夺战:好司机是稀缺资源。如果实验组乘客能看到特价优惠,他们可能抢走好司机,让对照组乘客只能等待更长时间


2. 涟漪效应:一边的实验会像石头投入水中,产生波纹影响到另一边


3. 跨边迷雾:实验在卖家端进行,但我们可能更关心买家的反应,这中间有层"黑盒"


4. 多边连锁反应:一个变化可能引发连锁反应,A 影响 B,B 又影响 C...



  多重随机化设计是什么神器? 


多重随机化设计(Multiple   Randomization   Design,   MRD)是专为双边市场打造的实验神器,特别是其简化版——简单多重随机化设计(SMRD)。这就像同时在两组人中掷骰子,而不是只在一组人中。


SMRD 的神奇配方:

把"对"作为研究单位,如(买家 i,卖家 j)这个购物对

分别在买家和卖家中随机抽样,产生四种组合状态

只有当买家和卖家都在实验组时,才使用新功能(比如新的评价系统)

通过比较四种状态的表现差异,拆解出直接效应和溢出效应

即使不能完全隔离买卖双方,也能科学评估效果


根据最新研究,SMRD特别适合内容平台、推荐系统和电商平台,能有效应对两方用户互相影响的复杂场景。



  如何区分直接效应和连锁反应? 


在双边市场实验中,我们需要像侦探一样,区分和追踪两类不同的"线索"——直接效应和溢出效应。这些线索进一步细分为以下四种具体效应:


1. 直接效应 

这就像直接命中目标。测量策略对直接接收者的影响,比如新的卖家页面设计对卖家销量的直接影响。通过特定组合状态的精确对比来估计。


2. 买方溢出效应 

这是间接的连锁反应。卖家策略变化如何影响到买家之间的竞争或协作?比如更好的卖家服务让买家竞争更激烈。


3. 卖方溢出效应 

另一种连锁反应。买家行为变化如何影响卖家群体?比如买家更愿意给差评导致卖家整体服务提升。


4. 平均处理效应

全局视角。综合以上所有效应,预测策略全面实施后的总体效果。这就像预测投

石入池后的所有涟漪效应总和。


需要注意的是,SMRD 依赖"局部干扰假设"(Local Interference) 这个魔法咒语。这个假设要求结果只依赖三个因素:是否接受处理、接受处理的买家比例、接受处理的卖家比例,而不关心具体是哪些买家或卖家接受了处理。



  还有哪些双边测试黑科技? 


除了SMRD,双边市场还有其他几种强力工具:


1. 时间切换实验 (Switchback):在时间而非用户维度随机化。想象早上 8-9 点用策略 A,9-10 点用策略 B,如此往复。适用于打车平台等空间效应强而时间效应弱的场景。


2. 图聚类实验:类似社交网络的方法,基于买卖双方的互动网络进行聚类,将频繁交易的买卖双方分在同一组,减少跨组干扰。


3. 反事实交叉展示:特别适用于推荐系统,在服务器端"预演"不同条件下的结果,减少用户群体间的资源争夺。


  谜题现场:电商推荐算法大改造  


案发现场:

某电商平台算法团队研发了全新推荐算法,可能改变买家浏览商品顺序,从而影响卖家曝光和销售。测试这个算法就像在十字路口改变交通规则——一不小心就会引发连锁反应!


三大疑点

爆款商品有限,实验组买家可能抢光好货,让对照组只能看到冷门商品

聪明的卖家可能察觉到流量变化,改变定价策略,间接影响对照组体验

需要同时评估对买家满意度和卖家收益的双重影响


破案方案

启用 SMRD 方案,同时在买家和卖家群体中进行随机分组

只有当买家和卖家都在实验组时,才启用新算法

监控四种组合状态的表现差异

使用统计魔法解析出直接效应和各种溢出效应


最终结果

成功破解了算法效果之谜,精确量化了市场两侧的连锁反应,为算法迭代提供了清晰方向。


双边市场实验设计如同平衡艺术,需要兼顾科学严谨和实用性。根据实战经验,应在规划阶段充分考虑样本量、测试周期和分析方法,确保收集到有价值的数据。


我们已经探索了稀疏场景、超级用户、社交网络和双边市场等复杂场景下的抽样技术,但这仅仅是开始。


在数据科学的武林中,还有更多高级的抽样技法等待我们掌握,让我们进入抽样世界的最高境界,学习一些大师级的进阶绝技。



武林秘籍:

抽样大师的进阶技法



  如何让信号穿越噪音?

  —— 方差缩减技术  


在我们的抽样之旅中,我们已经从最基础的菜市场砍价,到复杂的社交网络和双边市场场景。


但即使掌握了这些技术,我们仍然面临一个普遍挑战:如何从嘈杂数据中提取真实信号?


想象你在嘈杂的音乐节上接电话——周围的噪音让你很 难听清对方说话。在 AB 测试中,同样存在"噪音",干扰我们发现真正的"信号"。方差缩减技术就像降噪耳机,能帮助 我们更容易听到重要信息,是高级抽样的必备技能。


降噪秘籍大全:


1. CUPED 降噪法:利用实验前的历史数据作为降噪基准。就像用你平时的说话声音作为参考,更容易分辨出在噪音环境中的变化。Netflix、Booking等巨头都在用这招。


2. 分层降噪术:把用户分成相似的小组,确保实验组和对照组在各层分布一致。这就像分别在安静的房间和嘈杂的街道测试,而不是混在一起比较。


3. 控制变量法:利用其他相关指标来消除干扰。就像知道某个噪音来自空调,就可以专门过滤掉它。


4. 重点采样术:针对关键用户群体进行精确实验。就像在人群中找出专家,他们的意见价值可能更高。


据实战经验,CUPED技术可以将所需样本量砍掉一半!这就像你只需要一半的时间就能听清电话内容,效率翻倍。



  如何挖掘更深层的因果? 


传统 AB 测试回答的是"这个变化会带来什么效果?"(effect of cause)。但在复杂场景下,我们可能需要问"这个效果是由 什么原因造成的?"(cause of effect)。这就需要更强大的因果推断工具。


根据因果推断研究,当传统 AB 测试遇到限制时,可以使用这些高级工具:


1. 双重差分法:同时利用时间和组别两个维度的变化。比如同时比较"今年 VS 去年"和"北京 VS 上海"的差异,来消除 季节因素和地域因素。


2. 倾向得分匹配:找到特征相似的用户进行比较。比如找双胞胎做实验,一个吃药一个不吃,尽量排除其他因素干扰。


3. 工具变量法:利用间接影响因素来推断因果关系。比如无法直接测量某人智商,但可以通过解题速度间接估计。


4. 因果图模型:通过可视化因果链路,识别复杂关系网络。比如绘制犯罪网络图,理清各个嫌疑人之间的关系。



  如何让资源自动流向最优方案? 


传统 AB 测试像是两支队伍平分资源打比赛,即使一方明显领先,也要等比赛结束才能宣布胜负。多臂老虎机 (Multi- Armed Bandit, MAB) 算法则像是聪明的教练,会逐渐增加表现好的队员上场时间。


MAB 的四大超能力


1. 会学习的流量分配——看到 A 方案效果好,自动给 A 更多流量,就像餐厅发现某道菜特别受欢迎,会增加该菜的供应


2. 探索与利用平衡——不会因为短期领先就完全押注一方,仍会保留一些资源继续探索,就像餐厅会保留新菜试验的机会


3. 多方案并测——可同时测试多个创意,自动找出最佳方案,就像同时尝试 5 种调料配方,找出最受欢迎的那个


4. 加速获利——不用等到实验结束,就能开始享受好方案带来的收益,就像边比赛边获奖


MAB 特别适合"赛马"场景,如测试多个广告文案、邮件主题行或着陆页设计。它能在保持科学性的同时,提高测试速度和商业回报,就像既要公平竞争,又要最大化获胜。


图 10:进阶优化决策过程



  终极锦囊:实验大师避坑指南 


大师秘诀

实战口诀

问题先行,实验后至

每个实验都应先明确要解决什么问题,就像侦探先确定案件性质再搜集证据

算好样本再动手

就像出远门前先计算油量和路程,确保不会半路抛锚

测试周期要完整

覆盖一个完整的业务周期,就像品尝一整年的葡萄酒,而不是只喝一个季节的

多指标全景观察

同时关注核心指标和副作用指标,就像医生不仅看病情好转,还要关注药物副作用

深入分群细分析

不要只看平均值,要看不同用户群体的反应,就像餐厅要分析不同年龄段顾客的口味偏好


AB 测试不是简单的"赢/输"游戏,而是持续学习的旅程。真正的智慧在于"大胆假设,小心求证"——既有探索的勇气,又有严谨的态度。


从菜市场砍价的日常智慧,到社交网络与双边市场的复杂技术,我们已经掌握了应对各类场景的抽样武器,这些都是我们在数据海洋中航行的必备工具。随着我们抽样之旅接近尾声,让我们回顾 这段旅程,并展望未来的可能性。



  结语:抽样之旅的终点与新起点  


从菜场砍价、厨师尝汤的简单抽样,到跨越社交网络和双边市场的复杂实验设计,我们的抽样之旅已经走过了漫长的道路。


抽样并不只是从总体中取一小部分那么简单,它是一门融合了统计学、心理学、计算机科学甚至经济学的深奥艺术。


图 11:抽样是一门跨领域融合的艺术



在这个数据爆炸的时代,学会科学抽样比拥有全部数据更重要。


就像医生不需抽干病人全部血液才能诊断,一小瓶血样,加上正确的检测方法,就能揭示健康真相。同样,AB测试凭借科学的抽样方法,让有限数据揭示了无限洞察。


未来,人工智能将与 AB 测试深度融合,带来更智能的实验设计、更精准的用户分群和更高效的资源分配。


从菜市场砍价的朴素智慧,到社交网络和双边市场的复杂抽样技术,抽样的本质始终如一——通过部分了解整体,以小见大。


在不久的将来,我们可能会看到自适应实验系统,它能根据实时数据自动调整实验参数,最大化学习效率。


至此,本次抽样研究之旅暂时告一段落。数据仿若旅途中抬眸凝望的满天繁星,浩瀚无边又难以捉摸。


抽样就是我们的望远镜,帮助我们聚焦最重要的那几颗星,从中读取宇宙的奥秘。在这个充满不确定迷雾的世界里,科学的抽样和实验,是我们触摸真相的最可靠指南针。






   往期推荐   


点击阅读原文,领取《A/B测试消费行业实践指南》

文章转载自字节跳动数据平台,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论