邮件 A/B 测试:营销活动拆分测试完整指南 [2026]

用 A/B 测试优化你的邮件营销活动。了解测什么、怎么测,以及如何解读结果并持续改进。

A/B testing
邮件 A/B 测试:营销活动拆分测试完整指南 [2026]?

邮件 A/B 测试,是“猜什么有效”和“知道什么有效”之间的分水岭。表现最好的邮件营销人一直在测试,用一次次微小的改进,随时间累积成显著的表现提升。

在这份完整指南里,我们会讲清邮件 A/B 测试的方方面面:测什么、如何设计规范的测试、如何计算统计显著性,以及如何把结果变成可执行的改进。

什么是邮件 A/B 测试

邮件 A/B 测试(也叫拆分测试)是一种比较两个邮件版本、判断哪个表现更好的方法。你把版本 A 发给一部分受众,把版本 B 发给另一部分,然后衡量哪个版本的结果更好。

A/B 测试如何运作

流程遵循一个简单框架:

  1. 假设:明确你要测什么,并预测结果
  2. 变体:制作两个只有一处不同的版本
  3. 拆分:把受众随机分成两组
  4. 发送:把各自的版本发给对应的组
  5. 衡量:追踪核心指标(打开、点击、转化)
  6. 分析:在统计置信的前提下判定胜者
  7. 落地:把结论应用到后续活动

A/B 测试与多变量测试的区别

方法测什么所需样本量复杂度
A/B 测试一个变量中等简单
A/B/C 测试一个变量,3 个版本更大简单
多变量测试多个变量非常大复杂

对大多数邮件营销人来说,A/B 测试在洞察和可操作性之间取得了最好的平衡。多变量测试需要大得多的受众规模才能达到统计显著。

邮件 A/B 测试为什么重要

复利效应

微小的改进会随时间产生惊人的累积效果:

  • 打开率提升 10%
  • 点击率提升 15%
  • 转化提升 20%
  • 结果: 同一份名单带来的转化多出 52%

用数据做决策

A/B 测试消除了猜测:

  • 不必在会上争论谁的偏好更好
  • 让受众告诉你什么有效
  • 沉淀关于订阅者的组织知识
  • 建立推动持续改进的测试文化

真实的业务影响

坚持做测试的公司会看到:

  • 邮件营销 ROI 高出 37%
  • 退订率下降 28%
  • 客户互动提升 23%
  • 归因到邮件的收入增长 18%

测什么:按影响力排序的元素

不是所有测试的价值都一样。优先测那些对目标潜在影响最大的元素。

主题行(影响最大)

主题行决定了邮件会不会被打开。可以测这些维度:

长度:

  • 短(30 个字符以内):“闪购:全场 6 折”
  • 中(30 到 50 个字符):“闪购:全场 6 折,今晚截止”
  • 长(50 个字符以上):“闪购:全站 6 折,今晚零点结束”

个性化:

  • 无个性化:“你的专属优惠在这里”
  • 姓名个性化:“Sarah,你的专属优惠在这里”
  • 行为个性化:“Sarah,你看过的那条裙子正在打折”

语气:

  • 紧迫型:“最后机会!促销 3 小时后结束”
  • 好奇型:“我们发现了一件有意思的事”
  • 直接型:“下一单立省 30%”
  • 俏皮型:“这次促销,我们可能做过头了”

表情符号的使用:

  • 不用表情符号:“新品刚刚上架”
  • 用一个表情符号:“新品刚刚上架”
  • 用多个表情符号:“新品刚刚上架”

疑问句还是陈述句:

  • 疑问句:“准备好过夏天了吗?”
  • 陈述句:“为夏天做好准备”

预览文本

预览文本在收件箱里是主题行的延伸:

  • 互补型: 主题行制造好奇,预览文本揭示收益
  • 补充紧迫感: 主题行给出优惠,预览文本补上截止时间
  • 社会认同: 主题行给出主张,预览文本提供佐证
  • CTA 预告: 主题行激发兴趣,预览文本说明下一步

行动号召(CTA)

CTA 直接影响点击率:

按钮文案:

  • 通用型:“立即选购”对比“点击这里”
  • 具体型:“选购夏季连衣裙”对比“浏览合集”
  • 收益导向:“立减 30%”对比“马上省钱”
  • 紧迫型:“领取你的折扣”对比“选购特惠”

按钮设计:

  • 颜色:品牌色对比高对比度色
  • 尺寸:标准对比加大
  • 形状:圆角对比直角
  • 位置:首屏内对比正文之后

CTA 数量:

  • 单个 CTA(聚焦)
  • 多个 CTA(同一个动作,不同位置)
  • 多个 CTA(不同动作)

发送时间与星期

时机会明显影响打开率:

星期几:

  • 周二对比周四
  • 工作日对比周末
  • 周初对比周末

一天中的时段:

  • 早晨(6 到 9 点)
  • 上午(9 到 12 点)
  • 下午(12 到 15 点)
  • 傍晚(18 到 21 点)

相对时机:

  • 立即发送对比延迟数小时发送
  • 按订阅者所在时区发送对比固定时间发送

邮件内容与文案

长度:

  • 短而易扫读
  • 长而详尽
  • 混合(易扫读,附可展开的段落)

语气:

  • 正式对比口语化
  • 功能导向对比收益导向
  • 教育型对比促销型

内容结构:

  • 文字为主对比图片为主
  • 单栏对比多栏
  • 商品网格对比主推单品

图片与视觉设计

主视觉图:

  • 商品图对比生活场景图
  • 静态图对比动图 GIF
  • 不放主视觉对比通栏主视觉

图片风格:

  • 专业摄影对比用户生成内容
  • 有人出镜对比只拍商品
  • 单件商品对比多件商品

版式:

  • 极简设计对比信息密集的设计
  • 品牌色主导对比中性色调
  • 定制插画对比只用照片

发件人名称与地址

发件人名称:

  • 公司名:“Acme Store”
  • 人名:“Sarah from Acme”
  • 组合:“Sarah at Acme Store”
  • 创始人或 CEO:“John Smith, CEO”

回复地址:

  • no-reply 对比有人查看的邮箱
  • 通用地址对比个人地址([email protected]

优惠与激励

折扣形式:

  • 按百分比:“立减 25%”
  • 按金额:“立减 $25”
  • 免运费:“全场免运费”
  • 满赠:“满 $50 送好礼”

紧迫感元素:

  • 倒计时器对比文字截止时间
  • 限量对比限时
  • 专属对比全员可享

样本量与统计显著性

合适样本量的重要性

收件人太少的测试会得出不可靠的结论。小规模测试里的“胜者”,可能只是随机波动。

计算最小样本量

用下面这张表判断每个版本需要多少收件人:

在 95% 置信度和 80% 统计效力下:

基准率预期提升每个版本的最小样本量
15% 打开率提升 10%3,000
15% 打开率提升 20%800
20% 打开率提升 10%2,300
20% 打开率提升 20%600
3% 点击率提升 10%15,000
3% 点击率提升 20%4,000
3% 点击率提升 50%700

关键结论: 预期改进越小,想要有把握地检测出它所需要的样本量就越大。

统计显著性到底是什么

统计显著性意味着两个版本之间的差异很可能是真实的,而不是随机造成的。

95% 置信度意味着观察到的差异由随机波动造成的概率只有 5%。

如何检查显著性:

  1. 用计算器:很多邮件服务商内置了显著性计算器
  2. 等数据足够:不要过早宣布胜者
  3. 看置信区间:区间重叠说明可能并不存在真实差异

过早宣布胜者的危险

过早宣布胜者是 A/B 测试中最常见的错误:

  • 第 1 天: 版本 A 领先 15%,但每个版本只有 200 次打开
  • 第 3 天: 两个版本打平,样本量还在增长
  • 第 5 天: 版本 B 反超 8%,达到统计显著

经验法则: 等到达到你算出来的最小样本量,再做决定。

名单较小时怎么办

如果名单规模不足以达到统计显著:

  1. 跨多次活动测试:把多次发送的数据汇总
  2. 测更大的改动:测那些预期提升 50% 以上的方案
  3. 拉长观察周期:让活动跑得更久一些
  4. 接受方向性洞察:虽未被统计证明,但仍有参考价值

A/B 测试方法论:分步执行

第 1 步:明确目标

这次测试最看重哪个指标?

目标主要指标次要指标
认知打开率点击率
互动点击率页面停留时长
转化转化率每封邮件收入
留存回复率退订率

第 2 步:提出假设

把假设写清楚:

格式: “如果我们[做出某项改动],那么[某个指标]会[上升或下降],因为[原因]。”

示例:

  • “如果我们在主题行里加上订阅者的名字,打开率会提升 15%,因为个性化让邮件更相关。”
  • “如果我们把 CTA 按钮从蓝色改成红色,点击率会提升 20%,因为红色更能制造紧迫感。”
  • “如果我们把发送时间从 10 点改到 7 点,打开率会提升 10%,因为订阅者会在上班前查看邮件。”

第 3 步:隔离变量

关键原则: 每次只测一个元素。

错误做法:

  • 版本 A:“闪购!”加红色按钮加早晨发送
  • 版本 B:“今天立省 30%”加蓝色按钮加下午发送

如果 B 赢了,你并不知道原因。

正确做法:

  • 版本 A:“闪购!”加蓝色按钮加早晨发送
  • 版本 B:“今天立省 30%”加蓝色按钮加早晨发送

这样你测的就只有主题行。

第 4 步:搭建测试

随机分配: 确保订阅者是被随机分配到各个版本的。

均分流量: 两个版本按 50/50 拆分(三个版本则按 33/33/33)。

排除其他测试: 不要把同一批订阅者同时放进多个测试。

第 5 步:跑测试

时间安排的考量:

指标最短等待时间
打开率24 到 48 小时
点击率48 到 72 小时
转化率72 小时以上(取决于销售周期)
退订率72 小时

不要频繁偷看: 每小时都去看结果,容易得出过早的结论。

第 6 步:分析结果

分析时要考虑:

  1. 统计显著性:这个差异是真实的还是随机的?
  2. 实际意义:这个差异对业务是否有意义?
  3. 次要指标:主指标赢了,会不会拖累其他指标?
  4. 细分表现:不同受众细分的结果是否不同?

第 7 步:记录与落地

把一切都记下来:

  • 测了什么
  • 假设是什么
  • 结果如何(附置信度)
  • 关键结论
  • 下一步的测试想法

把结论落地:

  • 用胜出元素更新模板
  • 把发现同步给团队
  • 规划后续测试来验证

按活动类型准备的测试点子

欢迎邮件

元素方案 A方案 B
主题行“欢迎来到 [品牌]!”“这是你的 15% 欢迎礼”
折扣形式立减 15%立减 $15
CTA 重点立即选购做个小测验
邮件长度简短欢迎详细的品牌介绍
跟进时机第 2 天第 3 天

弃购挽回邮件

元素方案 A方案 B
主题行“你落下了点东西”“你的购物车还在等你”
首封发送时机1 小时4 小时
折扣不给折扣立减 10%
商品展示只展示主商品展示购物车全部内容
紧迫感库存不足提示购物车即将失效提示

促销活动

元素方案 A方案 B
主题行“全场 7 折”“本季最大力度促销”
主视觉图商品网格生活场景照片
优惠结构全站折扣分品类特惠
CTA 位置只放顶部顶部和底部都放
倒计时器

新闻邮件与内容邮件

元素方案 A方案 B
主题行内容导向好奇心导向
形式单篇长文多条简讯
CTA 样式文字链接按钮
个性化问候语中带名字商品推荐
社交元素有分享按钮无分享按钮

唤醒沉睡客户的活动

元素方案 A方案 B
主题行“好久不见!”“我们变了不少”
激励折扣免运费
内容重点最新动态热销商品
语气感性直接
退订入口低调显眼

解读结果并采取行动

读懂你的结果

情形 1:明确胜者

  • 版本 B 的点击率高出 25%
  • 统计显著性:98%
  • 行动:把版本 B 的做法落地

情形 2:没有显著差异

  • 版本 A 和 B 的表现相差不到 3%
  • 统计显著性:45%
  • 行动:两种做法都行,去测别的东西

情形 3:结果互相矛盾

  • 版本 A 在打开率上胜出
  • 版本 B 在转化率上胜出
  • 行动:先分清目标优先级,也可以测一个混合方案

常见的解读错误

  1. 忽略次要指标:一个抬高打开率却拖垮转化的主题行不算胜者
  2. 过度外推结论:某种胜出的主题行风格未必适用于所有活动类型
  3. 忽略细分差异:整体的胜者,对你最好的客户可能反而是败笔
  4. 过早宣布胜者:统计显著性需要足够的样本量

建立行动框架

每次测试之后,把结果归类:

结果行动
强胜(置信度高于 95%,提升超过 10%)立即落地,更新模板
中等胜出(置信度高于 90%,提升 5% 到 10%)落地,并继续测试更多变体
弱胜(置信度低于 90% 或提升不足 5%)记下趋势,用更大样本复测
无差异两种做法都不占优,换一个变量测
明显更差避免这种做法,并写清原因

制定测试日历

有策略地安排你的测试:

第 1 个月:打基础

  • 第 1 到 2 周:主题行个性化测试
  • 第 3 到 4 周:CTA 按钮颜色测试

第 2 个月:时机

  • 第 1 到 2 周:发送时间优化(上午对比下午)
  • 第 3 到 4 周:发送日优化(周二对比周四)

第 3 个月:内容

  • 第 1 到 2 周:邮件长度测试
  • 第 3 到 4 周:图片风格测试

第 4 个月:优惠

  • 第 1 到 2 周:折扣形式(百分比对比金额)
  • 第 3 到 4 周:紧迫感元素测试

进阶 A/B 测试策略

序贯测试

与其做一次性的测试,不如用序贯测试逼近最优表现:

  1. 第 1 轮: 测 4 种主题行思路(A 对比 B 对比 C 对比 D)
  2. 第 2 轮: 用胜出方案对阵 2 个新变体
  3. 第 3 轮: 对胜出方案做细节微调

针对细分的测试

不同细分的反应可能截然不同:

  • 新订阅者可能更喜欢教育型内容
  • VIP 客户对专属感的反应可能更好
  • 不活跃订阅者可能需要更强的激励

条件允许时,在细分内部跑测试。

自动化发送时间优化

很多邮件服务商提供由机器学习驱动的发送时间优化:

  • 学习每个订阅者的行为
  • 在对每个收件人最合适的时间发送
  • 根据互动数据持续自我改进

先用手动测试建立基线,再考虑启用自动优化。

对照留出组

用来衡量长期影响:

  1. 建立一个只收到版本 A 的留出组
  2. 用剩下的受众测试版本 B
  3. 30 到 90 天后,比较长期指标
  4. 理解这次改动的长期效果

贝叶斯方法与频率派方法

大多数 A/B 测试用的是频率派统计(p 值和置信区间)。贝叶斯方法提供了另一种选择:

频率派方法:

  • 需要固定样本量
  • 给出“是或否”的显著性结论
  • 更容易向相关方解释
  • 反复查看结果时有 p 值操纵的风险

贝叶斯方法:

  • 随时都可以查看结果
  • 给出一个版本胜过另一个版本的概率
  • 决策更有层次
  • 需要更强的统计理解

对多数邮件营销人来说,配合正确样本量计算的频率派测试已经足够,而且更容易落地。


真实的 A/B 测试案例

案例 1:主题行个性化

公司: 电商时装零售商 测试: 姓名个性化对比通用主题行

版本主题行打开率样本量
A(对照组)“你会喜欢的新品”18.2%25,000
B(实验组)“Sarah,你会喜欢的新品”22.4%25,000

结果: 打开率提升 23%,统计置信度 99% 落地: 把个性化应用到所有促销邮件 收入影响: 每月邮件收入增加 $47,000

案例 2:CTA 按钮优化

公司: 订阅礼盒服务 测试: 按钮文案与颜色的组合变体

版本CTA颜色点击率
A“立即订阅”蓝色3.2%
B“开启我的订阅”橙色4.1%

结果: 点击率提升 28% 关键结论: 第一人称表述(“我的”)加上带紧迫感的颜色,效果最好 后续测试: 继续测试更多第一人称的表述变体

案例 3:发送时间优化

公司: B2B SaaS 公司 测试: 周二 9 点对比周四 14 点

星期与时段打开率点击率演示申请数
周二 9 点24.8%4.2%12
周四 14 点21.3%5.8%18

结果: 周四的打开率更低,但互动和转化更高 关键结论: 打开率并不总是与转化正相关 落地: 把所有促销邮件都改到周四下午发送

案例 4:折扣的呈现方式

公司: 家居用品零售商 测试: 在平均订单 $100 的场景下,百分比对比具体金额

版本优惠转化率平均订单价值
A“立减 20%”4.8%$95
B“立减 $20”5.2%$112

结果: 具体金额多带来 8% 的转化,平均订单价值高出 18% 洞察: 在中等价位的购买中,具体金额让人感觉更实在 注意: 在价格极高或极低的场景下,结论会反过来


常见错误及规避方法

错误 1:一次测太多变量

问题: 同时测主题行、CTA 和图片,就无法知道差异到底由什么造成。

解法: 每次只测一个元素。如果确实要测多个元素,就跑序贯测试。

错误 2:样本量不足

问题: 需要 3,000 次打开才够,却在每个版本 500 次打开时就宣布了胜者。

解法: 测试前先算出所需样本量。用在线计算器,或者用本文前面给出的表格。

错误 3:提前中止测试

问题: 第一天就去看结果,发现一个“胜者”,然后停掉测试。

解法: 事先约定好测试时长和样本量。在达到最低门槛之前不看结果。

错误 4:测试频率太低

问题: 一个季度只跑一次测试,而不是持续进行。

解法: 制定测试日历,让每个主要活动类型每月至少有一次测试。

错误 5:测了无关紧要的元素

问题: 花几周时间测页脚字体颜色,而它根本不影响核心指标。

解法: 按潜在影响给测试排优先级。先从主题行、CTA 和优惠开始。

错误 6:忽略细分差异

问题: 把一个“胜者”推上线,结果反而拖累了最优质客户的表现。

解法: 按细分分析测试结果(新客与老客、高价值与普通,等等)。

错误 7:不记录结果

问题: 因为没人记得当初学到了什么,同样的测试被反复跑了一遍又一遍。

解法: 维护一份测试日志,记录假设、结果、结论和影响。

错误 8:在非典型时段做测试

问题: 在黑五或重大节日期间跑测试,却把结论套用到平常时段。

解法: 在测试日志里注明背景。全面推广之前,先在正常时段复测一次。


建立测试文化

争取相关方的支持

要建立测试优先的文化:

  1. 先拿下速赢:跑一个影响大、结果清晰的测试
  2. 量化收入影响:把提升百分比换算成金额
  3. 广泛分享结论:每月开一次测试复盘会
  4. 为意外结果喝彩:推翻假设的测试同样有价值
  5. 建立测试路线图:展示的是策略打法,而不是零散的测试

编写你的测试手册

把组织内部的测试标准写成文档:

测试规划:

  • 最小样本量要求
  • 要求的置信度(通常是 95%)
  • 测试时长指引
  • 测试的审批流程

测试执行:

  • 如何在邮件服务商后台搭建测试
  • 各版本的命名规范
  • 发送前的质检清单

分析标准:

  • 什么时候可以看结果
  • 如何计算显著性
  • 结论不明确时该怎么办

文档记录:

  • 测试记录在哪里
  • 必填字段(假设、结果、结论)
  • 如何分享发现

衡量测试体系本身的成效

追踪你的测试体系是否有效:

指标目标
每月跑的测试数4 到 8 个
达到显著性的测试占比60% 以上
有明确胜者的测试占比40% 以上
已落地的结论占比80% 以上
表现的累计改进按季度追踪

A/B 测试工具与平台

该看哪些能力

必备的 A/B 测试功能:

功能为什么重要
便捷的变体创建快速搭建测试
随机分配保证结果有效
统计显著性计算器知道结果什么时候可信
自动选出胜者把最佳版本发给剩余名单
结果可视化便于解读
历史测试记录在过往经验上继续积累

用 Brevo 和 Tajo 做测试

Tajo 与 Brevo 的集成让更复杂的测试成为可能:

  • 同步的客户数据,支撑针对细分的测试
  • 行为触发,用于测试自动化序列
  • 多渠道测试,覆盖邮件、短信和 WhatsApp
  • 统一的分析,追踪测试对整段客户旅程的影响
  • 实时数据同步,确保测试用的是最新的客户信息

结语

邮件 A/B 测试把邮件营销从一门手艺变成了一门科学。系统地测试各个元素、计算统计显著性、把结论落地,你的邮件表现就能持续提升。

关键要点:

  1. 每次只测一个变量,才能得到清晰、可执行的洞察
  2. 等到统计显著再宣布胜者
  3. 把一切都记录下来,沉淀成组织知识
  4. 优先攻高影响元素,比如主题行和 CTA
  5. 制定测试日历,让改进持续发生
  6. 立刻把结论落地,并继续迭代

最成功的邮件营销人并不是直觉最准的那批人,而是测试做得最持续的那批人。

准备好用数据驱动的测试来优化你的邮件营销活动了吗?从 Tajo 开始,在邮件、短信和 WhatsApp 上使用集成的 A/B 测试,并用来自 Shopify 商店的实时数据同步来驱动个性化测试。

相关文章

常见问题

邮件营销中的 A/B 测试是什么?
A/B 测试(也叫拆分测试)把两个版本的邮件分别发给名单中的小部分人群,用来判断哪个版本表现更好。胜出的版本再发给剩下的订阅者。
邮件里应该测什么?
先从主题行开始(影响最大),再测发送时间、CTA、邮件设计与版式、个性化和内容长度。每次只测一个变量,结论才清晰。
一次 A/B 测试应该跑多久?
对邮件来说,用名单的 10% 到 20% 测 2 到 4 小时,再把胜出版本发出去。对落地页来说,测试至少跑 1 到 2 周,或者跑到达到统计显著(95% 置信度)为止。
应该让多大比例的名单参与测试?
如果要自动推送胜出版本,用名单的 20% 到 40% 做测试(每个版本 10% 到 20%),再把胜出版本发给剩下的 60% 到 80%。如果是纯粹为了学习,可以对整个名单做 50/50 拆分,把统计效力拉满。
可以同时跑多少个测试?
同一时间对同一个订阅者只跑一个测试,结果才有效。如果多个测试针对的是不同的受众细分,就可以并行。不要在同一封邮件里测多个元素。
如果名单太小,达不到统计显著怎么办?
对小名单(不足 5,000 人),把精力放在差异极大的方案上(预期提升 50% 以上),把多次发送的结果汇总起来,或者接受方向性洞察而不是被统计证明的结论。也可以按季度累积数据再做判断。
应该对所有活动都做测试,还是只测特定类型?
先测量最大、最重要的那些活动(欢迎系列、弃购挽回、促销邮件)。把这些优化好之后,再把测试扩展到较小的活动。发送量低的活动很难达到统计显著。
怎么判断一个结果是否具有实际意义?
如果改进带来的收益能配得上投入的精力,这个结果就具有实际意义。打开率提升 2% 在统计上显著,但可能不值得为此改模板;而转化率提升 2% 却可能意味着数千的额外收入。要看业务影响,而不只是统计上的有效性。
A/B 测试中最该避免的错误是什么?
在达到统计显著之前就过早宣布胜者。这会让你把并非真正改进的东西上线。做决定前,务必等到样本量足够并算出显著性。
胜出的元素多久该复测一次?
每 6 到 12 个月复测一次胜出方案,因为受众偏好会随时间变化。此外,当你看到表现下滑,或者名单大幅增长、受众构成可能已经改变时,也要复测。

申请抢先体验

请填写名字,以及邮箱或手机号。我们会与您联系,提供 Tajo 访问详情。

自动识别
获取Brevo