邮件 A/B 测试,是“猜什么有效”和“知道什么有效”之间的分水岭。表现最好的邮件营销人一直在测试,用一次次微小的改进,随时间累积成显著的表现提升。
在这份完整指南里,我们会讲清邮件 A/B 测试的方方面面:测什么、如何设计规范的测试、如何计算统计显著性,以及如何把结果变成可执行的改进。
什么是邮件 A/B 测试
邮件 A/B 测试(也叫拆分测试)是一种比较两个邮件版本、判断哪个表现更好的方法。你把版本 A 发给一部分受众,把版本 B 发给另一部分,然后衡量哪个版本的结果更好。
A/B 测试如何运作
流程遵循一个简单框架:
- 假设:明确你要测什么,并预测结果
- 变体:制作两个只有一处不同的版本
- 拆分:把受众随机分成两组
- 发送:把各自的版本发给对应的组
- 衡量:追踪核心指标(打开、点击、转化)
- 分析:在统计置信的前提下判定胜者
- 落地:把结论应用到后续活动
A/B 测试与多变量测试的区别
| 方法 | 测什么 | 所需样本量 | 复杂度 |
|---|---|---|---|
| A/B 测试 | 一个变量 | 中等 | 简单 |
| A/B/C 测试 | 一个变量,3 个版本 | 更大 | 简单 |
| 多变量测试 | 多个变量 | 非常大 | 复杂 |
对大多数邮件营销人来说,A/B 测试在洞察和可操作性之间取得了最好的平衡。多变量测试需要大得多的受众规模才能达到统计显著。
邮件 A/B 测试为什么重要
复利效应
微小的改进会随时间产生惊人的累积效果:
- 打开率提升 10%
- 点击率提升 15%
- 转化提升 20%
- 结果: 同一份名单带来的转化多出 52%
用数据做决策
A/B 测试消除了猜测:
- 不必在会上争论谁的偏好更好
- 让受众告诉你什么有效
- 沉淀关于订阅者的组织知识
- 建立推动持续改进的测试文化
真实的业务影响
坚持做测试的公司会看到:
- 邮件营销 ROI 高出 37%
- 退订率下降 28%
- 客户互动提升 23%
- 归因到邮件的收入增长 18%
测什么:按影响力排序的元素
不是所有测试的价值都一样。优先测那些对目标潜在影响最大的元素。
主题行(影响最大)
主题行决定了邮件会不会被打开。可以测这些维度:
长度:
- 短(30 个字符以内):“闪购:全场 6 折”
- 中(30 到 50 个字符):“闪购:全场 6 折,今晚截止”
- 长(50 个字符以上):“闪购:全站 6 折,今晚零点结束”
个性化:
- 无个性化:“你的专属优惠在这里”
- 姓名个性化:“Sarah,你的专属优惠在这里”
- 行为个性化:“Sarah,你看过的那条裙子正在打折”
语气:
- 紧迫型:“最后机会!促销 3 小时后结束”
- 好奇型:“我们发现了一件有意思的事”
- 直接型:“下一单立省 30%”
- 俏皮型:“这次促销,我们可能做过头了”
表情符号的使用:
- 不用表情符号:“新品刚刚上架”
- 用一个表情符号:“新品刚刚上架”
- 用多个表情符号:“新品刚刚上架”
疑问句还是陈述句:
- 疑问句:“准备好过夏天了吗?”
- 陈述句:“为夏天做好准备”
预览文本
预览文本在收件箱里是主题行的延伸:
- 互补型: 主题行制造好奇,预览文本揭示收益
- 补充紧迫感: 主题行给出优惠,预览文本补上截止时间
- 社会认同: 主题行给出主张,预览文本提供佐证
- CTA 预告: 主题行激发兴趣,预览文本说明下一步
行动号召(CTA)
CTA 直接影响点击率:
按钮文案:
- 通用型:“立即选购”对比“点击这里”
- 具体型:“选购夏季连衣裙”对比“浏览合集”
- 收益导向:“立减 30%”对比“马上省钱”
- 紧迫型:“领取你的折扣”对比“选购特惠”
按钮设计:
- 颜色:品牌色对比高对比度色
- 尺寸:标准对比加大
- 形状:圆角对比直角
- 位置:首屏内对比正文之后
CTA 数量:
- 单个 CTA(聚焦)
- 多个 CTA(同一个动作,不同位置)
- 多个 CTA(不同动作)
发送时间与星期
时机会明显影响打开率:
星期几:
- 周二对比周四
- 工作日对比周末
- 周初对比周末
一天中的时段:
- 早晨(6 到 9 点)
- 上午(9 到 12 点)
- 下午(12 到 15 点)
- 傍晚(18 到 21 点)
相对时机:
- 立即发送对比延迟数小时发送
- 按订阅者所在时区发送对比固定时间发送
邮件内容与文案
长度:
- 短而易扫读
- 长而详尽
- 混合(易扫读,附可展开的段落)
语气:
- 正式对比口语化
- 功能导向对比收益导向
- 教育型对比促销型
内容结构:
- 文字为主对比图片为主
- 单栏对比多栏
- 商品网格对比主推单品
图片与视觉设计
主视觉图:
- 商品图对比生活场景图
- 静态图对比动图 GIF
- 不放主视觉对比通栏主视觉
图片风格:
- 专业摄影对比用户生成内容
- 有人出镜对比只拍商品
- 单件商品对比多件商品
版式:
- 极简设计对比信息密集的设计
- 品牌色主导对比中性色调
- 定制插画对比只用照片
发件人名称与地址
发件人名称:
- 公司名:“Acme Store”
- 人名:“Sarah from Acme”
- 组合:“Sarah at Acme Store”
- 创始人或 CEO:“John Smith, CEO”
回复地址:
- no-reply 对比有人查看的邮箱
- 通用地址对比个人地址([email protected])
优惠与激励
折扣形式:
- 按百分比:“立减 25%”
- 按金额:“立减 $25”
- 免运费:“全场免运费”
- 满赠:“满 $50 送好礼”
紧迫感元素:
- 倒计时器对比文字截止时间
- 限量对比限时
- 专属对比全员可享
样本量与统计显著性
合适样本量的重要性
收件人太少的测试会得出不可靠的结论。小规模测试里的“胜者”,可能只是随机波动。
计算最小样本量
用下面这张表判断每个版本需要多少收件人:
在 95% 置信度和 80% 统计效力下:
| 基准率 | 预期提升 | 每个版本的最小样本量 |
|---|---|---|
| 15% 打开率 | 提升 10% | 3,000 |
| 15% 打开率 | 提升 20% | 800 |
| 20% 打开率 | 提升 10% | 2,300 |
| 20% 打开率 | 提升 20% | 600 |
| 3% 点击率 | 提升 10% | 15,000 |
| 3% 点击率 | 提升 20% | 4,000 |
| 3% 点击率 | 提升 50% | 700 |
关键结论: 预期改进越小,想要有把握地检测出它所需要的样本量就越大。
统计显著性到底是什么
统计显著性意味着两个版本之间的差异很可能是真实的,而不是随机造成的。
95% 置信度意味着观察到的差异由随机波动造成的概率只有 5%。
如何检查显著性:
- 用计算器:很多邮件服务商内置了显著性计算器
- 等数据足够:不要过早宣布胜者
- 看置信区间:区间重叠说明可能并不存在真实差异
过早宣布胜者的危险
过早宣布胜者是 A/B 测试中最常见的错误:
- 第 1 天: 版本 A 领先 15%,但每个版本只有 200 次打开
- 第 3 天: 两个版本打平,样本量还在增长
- 第 5 天: 版本 B 反超 8%,达到统计显著
经验法则: 等到达到你算出来的最小样本量,再做决定。
名单较小时怎么办
如果名单规模不足以达到统计显著:
- 跨多次活动测试:把多次发送的数据汇总
- 测更大的改动:测那些预期提升 50% 以上的方案
- 拉长观察周期:让活动跑得更久一些
- 接受方向性洞察:虽未被统计证明,但仍有参考价值
A/B 测试方法论:分步执行
第 1 步:明确目标
这次测试最看重哪个指标?
| 目标 | 主要指标 | 次要指标 |
|---|---|---|
| 认知 | 打开率 | 点击率 |
| 互动 | 点击率 | 页面停留时长 |
| 转化 | 转化率 | 每封邮件收入 |
| 留存 | 回复率 | 退订率 |
第 2 步:提出假设
把假设写清楚:
格式: “如果我们[做出某项改动],那么[某个指标]会[上升或下降],因为[原因]。”
示例:
- “如果我们在主题行里加上订阅者的名字,打开率会提升 15%,因为个性化让邮件更相关。”
- “如果我们把 CTA 按钮从蓝色改成红色,点击率会提升 20%,因为红色更能制造紧迫感。”
- “如果我们把发送时间从 10 点改到 7 点,打开率会提升 10%,因为订阅者会在上班前查看邮件。”
第 3 步:隔离变量
关键原则: 每次只测一个元素。
错误做法:
- 版本 A:“闪购!”加红色按钮加早晨发送
- 版本 B:“今天立省 30%”加蓝色按钮加下午发送
如果 B 赢了,你并不知道原因。
正确做法:
- 版本 A:“闪购!”加蓝色按钮加早晨发送
- 版本 B:“今天立省 30%”加蓝色按钮加早晨发送
这样你测的就只有主题行。
第 4 步:搭建测试
随机分配: 确保订阅者是被随机分配到各个版本的。
均分流量: 两个版本按 50/50 拆分(三个版本则按 33/33/33)。
排除其他测试: 不要把同一批订阅者同时放进多个测试。
第 5 步:跑测试
时间安排的考量:
| 指标 | 最短等待时间 |
|---|---|
| 打开率 | 24 到 48 小时 |
| 点击率 | 48 到 72 小时 |
| 转化率 | 72 小时以上(取决于销售周期) |
| 退订率 | 72 小时 |
不要频繁偷看: 每小时都去看结果,容易得出过早的结论。
第 6 步:分析结果
分析时要考虑:
- 统计显著性:这个差异是真实的还是随机的?
- 实际意义:这个差异对业务是否有意义?
- 次要指标:主指标赢了,会不会拖累其他指标?
- 细分表现:不同受众细分的结果是否不同?
第 7 步:记录与落地
把一切都记下来:
- 测了什么
- 假设是什么
- 结果如何(附置信度)
- 关键结论
- 下一步的测试想法
把结论落地:
- 用胜出元素更新模板
- 把发现同步给团队
- 规划后续测试来验证
按活动类型准备的测试点子
欢迎邮件
| 元素 | 方案 A | 方案 B |
|---|---|---|
| 主题行 | “欢迎来到 [品牌]!” | “这是你的 15% 欢迎礼” |
| 折扣形式 | 立减 15% | 立减 $15 |
| CTA 重点 | 立即选购 | 做个小测验 |
| 邮件长度 | 简短欢迎 | 详细的品牌介绍 |
| 跟进时机 | 第 2 天 | 第 3 天 |
弃购挽回邮件
| 元素 | 方案 A | 方案 B |
|---|---|---|
| 主题行 | “你落下了点东西” | “你的购物车还在等你” |
| 首封发送时机 | 1 小时 | 4 小时 |
| 折扣 | 不给折扣 | 立减 10% |
| 商品展示 | 只展示主商品 | 展示购物车全部内容 |
| 紧迫感 | 库存不足提示 | 购物车即将失效提示 |
促销活动
| 元素 | 方案 A | 方案 B |
|---|---|---|
| 主题行 | “全场 7 折” | “本季最大力度促销” |
| 主视觉图 | 商品网格 | 生活场景照片 |
| 优惠结构 | 全站折扣 | 分品类特惠 |
| CTA 位置 | 只放顶部 | 顶部和底部都放 |
| 倒计时器 | 有 | 无 |
新闻邮件与内容邮件
| 元素 | 方案 A | 方案 B |
|---|---|---|
| 主题行 | 内容导向 | 好奇心导向 |
| 形式 | 单篇长文 | 多条简讯 |
| CTA 样式 | 文字链接 | 按钮 |
| 个性化 | 问候语中带名字 | 商品推荐 |
| 社交元素 | 有分享按钮 | 无分享按钮 |
唤醒沉睡客户的活动
| 元素 | 方案 A | 方案 B |
|---|---|---|
| 主题行 | “好久不见!” | “我们变了不少” |
| 激励 | 折扣 | 免运费 |
| 内容重点 | 最新动态 | 热销商品 |
| 语气 | 感性 | 直接 |
| 退订入口 | 低调 | 显眼 |
解读结果并采取行动
读懂你的结果
情形 1:明确胜者
- 版本 B 的点击率高出 25%
- 统计显著性:98%
- 行动:把版本 B 的做法落地
情形 2:没有显著差异
- 版本 A 和 B 的表现相差不到 3%
- 统计显著性:45%
- 行动:两种做法都行,去测别的东西
情形 3:结果互相矛盾
- 版本 A 在打开率上胜出
- 版本 B 在转化率上胜出
- 行动:先分清目标优先级,也可以测一个混合方案
常见的解读错误
- 忽略次要指标:一个抬高打开率却拖垮转化的主题行不算胜者
- 过度外推结论:某种胜出的主题行风格未必适用于所有活动类型
- 忽略细分差异:整体的胜者,对你最好的客户可能反而是败笔
- 过早宣布胜者:统计显著性需要足够的样本量
建立行动框架
每次测试之后,把结果归类:
| 结果 | 行动 |
|---|---|
| 强胜(置信度高于 95%,提升超过 10%) | 立即落地,更新模板 |
| 中等胜出(置信度高于 90%,提升 5% 到 10%) | 落地,并继续测试更多变体 |
| 弱胜(置信度低于 90% 或提升不足 5%) | 记下趋势,用更大样本复测 |
| 无差异 | 两种做法都不占优,换一个变量测 |
| 明显更差 | 避免这种做法,并写清原因 |
制定测试日历
有策略地安排你的测试:
第 1 个月:打基础
- 第 1 到 2 周:主题行个性化测试
- 第 3 到 4 周:CTA 按钮颜色测试
第 2 个月:时机
- 第 1 到 2 周:发送时间优化(上午对比下午)
- 第 3 到 4 周:发送日优化(周二对比周四)
第 3 个月:内容
- 第 1 到 2 周:邮件长度测试
- 第 3 到 4 周:图片风格测试
第 4 个月:优惠
- 第 1 到 2 周:折扣形式(百分比对比金额)
- 第 3 到 4 周:紧迫感元素测试
进阶 A/B 测试策略
序贯测试
与其做一次性的测试,不如用序贯测试逼近最优表现:
- 第 1 轮: 测 4 种主题行思路(A 对比 B 对比 C 对比 D)
- 第 2 轮: 用胜出方案对阵 2 个新变体
- 第 3 轮: 对胜出方案做细节微调
针对细分的测试
不同细分的反应可能截然不同:
- 新订阅者可能更喜欢教育型内容
- VIP 客户对专属感的反应可能更好
- 不活跃订阅者可能需要更强的激励
条件允许时,在细分内部跑测试。
自动化发送时间优化
很多邮件服务商提供由机器学习驱动的发送时间优化:
- 学习每个订阅者的行为
- 在对每个收件人最合适的时间发送
- 根据互动数据持续自我改进
先用手动测试建立基线,再考虑启用自动优化。
对照留出组
用来衡量长期影响:
- 建立一个只收到版本 A 的留出组
- 用剩下的受众测试版本 B
- 30 到 90 天后,比较长期指标
- 理解这次改动的长期效果
贝叶斯方法与频率派方法
大多数 A/B 测试用的是频率派统计(p 值和置信区间)。贝叶斯方法提供了另一种选择:
频率派方法:
- 需要固定样本量
- 给出“是或否”的显著性结论
- 更容易向相关方解释
- 反复查看结果时有 p 值操纵的风险
贝叶斯方法:
- 随时都可以查看结果
- 给出一个版本胜过另一个版本的概率
- 决策更有层次
- 需要更强的统计理解
对多数邮件营销人来说,配合正确样本量计算的频率派测试已经足够,而且更容易落地。
真实的 A/B 测试案例
案例 1:主题行个性化
公司: 电商时装零售商 测试: 姓名个性化对比通用主题行
| 版本 | 主题行 | 打开率 | 样本量 |
|---|---|---|---|
| A(对照组) | “你会喜欢的新品” | 18.2% | 25,000 |
| B(实验组) | “Sarah,你会喜欢的新品” | 22.4% | 25,000 |
结果: 打开率提升 23%,统计置信度 99% 落地: 把个性化应用到所有促销邮件 收入影响: 每月邮件收入增加 $47,000
案例 2:CTA 按钮优化
公司: 订阅礼盒服务 测试: 按钮文案与颜色的组合变体
| 版本 | CTA | 颜色 | 点击率 |
|---|---|---|---|
| A | “立即订阅” | 蓝色 | 3.2% |
| B | “开启我的订阅” | 橙色 | 4.1% |
结果: 点击率提升 28% 关键结论: 第一人称表述(“我的”)加上带紧迫感的颜色,效果最好 后续测试: 继续测试更多第一人称的表述变体
案例 3:发送时间优化
公司: B2B SaaS 公司 测试: 周二 9 点对比周四 14 点
| 星期与时段 | 打开率 | 点击率 | 演示申请数 |
|---|---|---|---|
| 周二 9 点 | 24.8% | 4.2% | 12 |
| 周四 14 点 | 21.3% | 5.8% | 18 |
结果: 周四的打开率更低,但互动和转化更高 关键结论: 打开率并不总是与转化正相关 落地: 把所有促销邮件都改到周四下午发送
案例 4:折扣的呈现方式
公司: 家居用品零售商 测试: 在平均订单 $100 的场景下,百分比对比具体金额
| 版本 | 优惠 | 转化率 | 平均订单价值 |
|---|---|---|---|
| A | “立减 20%” | 4.8% | $95 |
| B | “立减 $20” | 5.2% | $112 |
结果: 具体金额多带来 8% 的转化,平均订单价值高出 18% 洞察: 在中等价位的购买中,具体金额让人感觉更实在 注意: 在价格极高或极低的场景下,结论会反过来
常见错误及规避方法
错误 1:一次测太多变量
问题: 同时测主题行、CTA 和图片,就无法知道差异到底由什么造成。
解法: 每次只测一个元素。如果确实要测多个元素,就跑序贯测试。
错误 2:样本量不足
问题: 需要 3,000 次打开才够,却在每个版本 500 次打开时就宣布了胜者。
解法: 测试前先算出所需样本量。用在线计算器,或者用本文前面给出的表格。
错误 3:提前中止测试
问题: 第一天就去看结果,发现一个“胜者”,然后停掉测试。
解法: 事先约定好测试时长和样本量。在达到最低门槛之前不看结果。
错误 4:测试频率太低
问题: 一个季度只跑一次测试,而不是持续进行。
解法: 制定测试日历,让每个主要活动类型每月至少有一次测试。
错误 5:测了无关紧要的元素
问题: 花几周时间测页脚字体颜色,而它根本不影响核心指标。
解法: 按潜在影响给测试排优先级。先从主题行、CTA 和优惠开始。
错误 6:忽略细分差异
问题: 把一个“胜者”推上线,结果反而拖累了最优质客户的表现。
解法: 按细分分析测试结果(新客与老客、高价值与普通,等等)。
错误 7:不记录结果
问题: 因为没人记得当初学到了什么,同样的测试被反复跑了一遍又一遍。
解法: 维护一份测试日志,记录假设、结果、结论和影响。
错误 8:在非典型时段做测试
问题: 在黑五或重大节日期间跑测试,却把结论套用到平常时段。
解法: 在测试日志里注明背景。全面推广之前,先在正常时段复测一次。
建立测试文化
争取相关方的支持
要建立测试优先的文化:
- 先拿下速赢:跑一个影响大、结果清晰的测试
- 量化收入影响:把提升百分比换算成金额
- 广泛分享结论:每月开一次测试复盘会
- 为意外结果喝彩:推翻假设的测试同样有价值
- 建立测试路线图:展示的是策略打法,而不是零散的测试
编写你的测试手册
把组织内部的测试标准写成文档:
测试规划:
- 最小样本量要求
- 要求的置信度(通常是 95%)
- 测试时长指引
- 测试的审批流程
测试执行:
- 如何在邮件服务商后台搭建测试
- 各版本的命名规范
- 发送前的质检清单
分析标准:
- 什么时候可以看结果
- 如何计算显著性
- 结论不明确时该怎么办
文档记录:
- 测试记录在哪里
- 必填字段(假设、结果、结论)
- 如何分享发现
衡量测试体系本身的成效
追踪你的测试体系是否有效:
| 指标 | 目标 |
|---|---|
| 每月跑的测试数 | 4 到 8 个 |
| 达到显著性的测试占比 | 60% 以上 |
| 有明确胜者的测试占比 | 40% 以上 |
| 已落地的结论占比 | 80% 以上 |
| 表现的累计改进 | 按季度追踪 |
A/B 测试工具与平台
该看哪些能力
必备的 A/B 测试功能:
| 功能 | 为什么重要 |
|---|---|
| 便捷的变体创建 | 快速搭建测试 |
| 随机分配 | 保证结果有效 |
| 统计显著性计算器 | 知道结果什么时候可信 |
| 自动选出胜者 | 把最佳版本发给剩余名单 |
| 结果可视化 | 便于解读 |
| 历史测试记录 | 在过往经验上继续积累 |
用 Brevo 和 Tajo 做测试
Tajo 与 Brevo 的集成让更复杂的测试成为可能:
- 同步的客户数据,支撑针对细分的测试
- 行为触发,用于测试自动化序列
- 多渠道测试,覆盖邮件、短信和 WhatsApp
- 统一的分析,追踪测试对整段客户旅程的影响
- 实时数据同步,确保测试用的是最新的客户信息
结语
邮件 A/B 测试把邮件营销从一门手艺变成了一门科学。系统地测试各个元素、计算统计显著性、把结论落地,你的邮件表现就能持续提升。
关键要点:
- 每次只测一个变量,才能得到清晰、可执行的洞察
- 等到统计显著再宣布胜者
- 把一切都记录下来,沉淀成组织知识
- 优先攻高影响元素,比如主题行和 CTA
- 制定测试日历,让改进持续发生
- 立刻把结论落地,并继续迭代
最成功的邮件营销人并不是直觉最准的那批人,而是测试做得最持续的那批人。
准备好用数据驱动的测试来优化你的邮件营销活动了吗?从 Tajo 开始,在邮件、短信和 WhatsApp 上使用集成的 A/B 测试,并用来自 Shopify 商店的实时数据同步来驱动个性化测试。