写作与内容 email-marketingab-testingmultivariate-testingsend-time-optimizationholdout-testingstatistical-significance

邮件实验设计师

为邮件营销设计可验证的 A/B、发送时间和留出组实验,并解读统计与实际效果。

FollowSkills 评估 · FSRS-2.0
不推荐
56/ 100 五分制 2.8 / 5
信任安全17 / 25 · 3.4/5

技能明确限制为实验设计和统计解读,要求预先承诺的规则、指定负责人,并将导出数据视为不可信输入;保存记忆前要求用户确认,也不直接决定业务动作。扣分原因是未提供该技能特有的敏感数据最小化、撤销/回滚和实际权限隔离证据,且脚本路径和外部数据流只能从文字声明推断。

可靠稳定8 / 20 · 2.0/5

流程覆盖模式选择、假设、样本量、持续时间、多重比较、显著性、护栏和缺失输入处理,失败时可返回 NEEDS_INPUT 或 UNDECIDED。扣分原因是本次材料未包含 experiment.py 或技能专属测试,依赖可用性、计算实现、异常输入行为和关键路径无法静态复现;按静态上限不超过10分。

适用触发10 / 15 · 3.3/5

触发场景、四种模式、输入字段、输出形态及“不负责写邮件/质量否决”的边界较清楚,并包含中英文描述;默认使用手工导出,降低对特定海外服务的依赖。扣分原因是对不同 ESP 数据格式、地区合规和中文用户实际环境的适配证据不足,触发排除条件仍主要依赖语义判断。

规范维护10 / 15 · 3.3/5

文档采用结构化 frontmatter、Quick Start、Skill Contract、Data Sources、Instructions、Save Results 和 Next Best Skill,提供版本、Apache-2.0 许可、示例及引用的共享协议。扣分原因是技能本身未说明维护责任人、更新路径或变更日志,引用的依赖文档未在材料中提供;仓库安全策略中的17.x与技能/README的18.0.0也存在版本治理不一致。

有效结果7 / 15 · 2.3/5

技能明确承诺生成假设、变量矩阵、样本量/MDE/功效/持续时间计划以及统计和实际效果解读,并要求同时报告护栏和决策状态;核心任务在设计层面完整。扣分原因是未执行或查看代表性输出,统计辅助脚本和实际 ESP 导出处理结果未得到文件证据,静态评估按上限最多7分。

证据核验4 / 10 · 2.0/5

文档给出了方法、输入、来源标注规则、公式方向和多重比较处理,仓库材料还显示存在一般性测试和CI。扣分原因是没有该技能关键路径的专属测试、真实运行记录或第三方复核证据,且引用的参考文件未提供;静态证据不足以超过5分。

证据充分度: 评估于 2026年7月20日 审查版本 ebd436747f8f
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 在采用结果前,应核验 experiment.py 的实际存在、参数语义、数值边界和输出格式,并用固定样例复算关键统计结果。
  • 不要把 ESP 自报收入或归因直接当作增量收入;应确认订单ID真值、去重、归因窗口和实验随机化完整性。
  • 邮件实验涉及用户行为数据;技能未明确规定脱敏、最小字段、保留期限或地区隐私合规要求。
  • 应解决安全策略17.x与技能/README 18.0.0之间的版本支持矛盾,并确认引用的共享协议文件与当前修订一致。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是一个面向邮件营销实验设计与结果解读的 Agent Skill,支持 A/B、多变量、发送时间和留出组四种模式。它根据自有 ESP 或分析导出数据制定假设、变量矩阵、样本量、最小可检测效果、运行时长和统计功效计划。完成实验后,它会报告效果、区间、不确定性、统计与实际意义以及退订、投诉和硬退信等护栏。它不会替用户撰写邮件,也不会在缺少预先承诺的负责人和行动规则时替用户选择商业决策。

读取测试模式、测试目标、邮件画像、基线结果、名单规模、显著性水平、统计功效、最小可检测效果、护栏、决策规则以及已完成的 ESP 结果导出;设计每个单元只改变一个变量的实验矩阵,并保留控制组;使用仓库提供的 experiment.py 计算比例比较、样本量、效果区间、p 值和统计/实际意义标记;规划运行时长、比较次数、多重比较规则和读取日期;输出测试设计文档或结果解读文档及 Handoff Summary。

  1. 邮件营销人员希望比较两个主题行,并已知基线打开率、名单规模和目标提升幅度。
  2. 生命周期营销团队希望测试不同发送日期或时段,同时保持主题、受众和创意不变。
  3. 增长团队计划进行主题 × CTA 的 2×2 多变量测试,需要判断每个单元是否有足够样本。
  4. 电商团队希望通过随机留出组测量发送邮件带来的增量转化或每收件人收入。
  5. 分析人员拿到包含投递数、打开数、点击数和转化数的 ESP 导出,想判断结果是否具有统计和实际意义。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 A/B、多变量、发送时间和留出组四类常见邮件实验。
  • 明确要求每个单元只隔离一个变量,并保留控制组。
  • 同时区分统计显著性、实际效果和发送护栏。
  • 默认支持用户手动提供的自有数据,不要求付费工具或 MCP。
  • 支持样本量、MDE、运行时长、功效和多重比较规划。
局限
  • 依赖用户提供准确的 ESP、GA4 或电商导出数据。
  • 不会撰写待测试的主题、正文或 CTA。
  • 不会计算 SEND/EQS,也不会执行 email-quality-auditor 的 veto 检查。
  • 没有负责人和预先承诺的行动规则时,不会自动选择推广或停止。
  • 多变量测试在名单规模不足时需要缩减为 A/B 或延长运行时间。

如何安装这个 Skill?

在 Claude Code 中运行 /plugin marketplace add aaron-he-zhu/aaron-marketing-skills,然后运行 /plugin install aaron-marketing@aaron。兼容 Agent Skills 的其他主机可运行 npx skills add aaron-he-zhu/aaron-marketing-skills -s send-experiment-designer,或克隆完整仓库:git clone https://github.com/aaron-he-zhu/aaron-marketing-skills

如何使用这个 Skill?

直接提出实验设计或结果解读请求,例如:Design an A/B subject-line test. Baseline open rate is 38%, I want to detect a 3-point lift. Goal is retention, list is 12,000. 也可以提供已完成的导出数据,并说明模式为 a-bmultivariatesend-timehold-out。设计至少需要基线率、流量或名单规模和目标检测提升;结果解读需要每个变体的投递数和结果数。缺少必要输入时,技能应返回 NEEDS_INPUT;缺少负责人和预先承诺的行动规则时,决策为 UNDECIDED

常见问题

必须连接 ESP 或 MCP 才能使用吗?
不需要。技能支持手动提供基线和实验结果导出;ESP API 或 MCP 只是可选的数据获取便利。
它会自动宣布哪个邮件版本获胜吗?
不会。只有在存在明确的负责人和预先承诺的行动规则,并且统计、实际效果和护栏条件都满足时,才会应用该规则;否则返回 `UNDECIDED`。
它能测试邮件内容本身吗?
它能设计主题、preheader、CTA 或创意的实验,但不负责撰写这些待测试内容。
小名单可以做实验吗?
可以尝试,但可能只能检测较大的效果,或需要跨多次发送累积样本;多变量设计还需要为每个单元提供完整样本。

同仓库的其他 Skills

均来自 aaron-he-zhu/aaron-marketing-skills

数据与分析

广告实验设计师

为付费广告设计严谨的A/B与增效实验,并解读结果是否既显著又有实际价值。

写作与内容

达人流量落地页优化器

让达人流量进入页面后更顺畅地完成转化。

写作与内容

邮件生命周期流程设计器

在撰写邮件前设计生命周期流程、节奏、分支与退出规则。

写作与内容

邮件主题行实验室

生成并预筛选主题行与预header,提前发现截断、垃圾词和预览问题。

自动化与运维

订阅同意台账

记录订阅同意依据,并即时执行退订、投诉与硬退信抑制。

写作与内容

Newsletter 变现规划器

为邮件 newsletter 设计订阅、赞助与增长循环的收入模型。

写作与内容

邮件偏好与降频管理器

设计邮件偏好中心和降频路径,降低疲劳退订。

写作与内容

邮件创意构建器

围绕落地页和已批准的主张,快速产出可测试的单封邮件文案。

写作与内容

邮件列表增长设计师

为自有邮件列表设计获客、激励、合规订阅和推荐增长方案。

写作与内容

流失召回专家

为沉默邮件用户设计召回、重新授权与最终抑制的闭环方案。

写作与内容

邮件质量审计员

在发送前审计邮件项目的安全性、合规性与可放行程度。

写作与内容

邮件列表分群器

从自有客户数据构建可复用的邮件受众与抑制名单。

写作与内容

消息测试设计器

在扩大投放前,用面板测试验证品牌消息是否清晰、相关且有差异化。

写作与内容

平台规范档案

为每个平台建立带来源、日期和过期标记的社交内容规范卡。

写作与内容

邮件收件箱落点监测

发送后定位邮件落点,追踪各邮箱服务商的收件箱、垃圾邮件与发件人声誉变化。

写作与内容

B2B冷启动外联序列器

设计可控的B2B冷邮件序列、回复分流、域名预热与合规护栏。

写作与内容

品牌语言规范器

把品牌语气、词汇和产品命名规则整理成可复用的品牌语言规范。

写作与内容

邮件渲染构建器

把已批准的邮件创意转换为兼容多客户端的响应式HTML,并完成渲染质量检查。

自动化与运维

创作者档案注册表

以可追溯事件流维护创作者名册、合作条款、合规记录与绩效事实。

写作与内容

邮件送达率预检

在发送或放量前验证邮件认证、发件声誉与收件箱投递表现。

相关 Skills