邮件实验设计师
为邮件营销设计可验证的 A/B、发送时间和留出组实验,并解读统计与实际效果。
技能明确限制为实验设计和统计解读,要求预先承诺的规则、指定负责人,并将导出数据视为不可信输入;保存记忆前要求用户确认,也不直接决定业务动作。扣分原因是未提供该技能特有的敏感数据最小化、撤销/回滚和实际权限隔离证据,且脚本路径和外部数据流只能从文字声明推断。
流程覆盖模式选择、假设、样本量、持续时间、多重比较、显著性、护栏和缺失输入处理,失败时可返回 NEEDS_INPUT 或 UNDECIDED。扣分原因是本次材料未包含 experiment.py 或技能专属测试,依赖可用性、计算实现、异常输入行为和关键路径无法静态复现;按静态上限不超过10分。
触发场景、四种模式、输入字段、输出形态及“不负责写邮件/质量否决”的边界较清楚,并包含中英文描述;默认使用手工导出,降低对特定海外服务的依赖。扣分原因是对不同 ESP 数据格式、地区合规和中文用户实际环境的适配证据不足,触发排除条件仍主要依赖语义判断。
文档采用结构化 frontmatter、Quick Start、Skill Contract、Data Sources、Instructions、Save Results 和 Next Best Skill,提供版本、Apache-2.0 许可、示例及引用的共享协议。扣分原因是技能本身未说明维护责任人、更新路径或变更日志,引用的依赖文档未在材料中提供;仓库安全策略中的17.x与技能/README的18.0.0也存在版本治理不一致。
技能明确承诺生成假设、变量矩阵、样本量/MDE/功效/持续时间计划以及统计和实际效果解读,并要求同时报告护栏和决策状态;核心任务在设计层面完整。扣分原因是未执行或查看代表性输出,统计辅助脚本和实际 ESP 导出处理结果未得到文件证据,静态评估按上限最多7分。
文档给出了方法、输入、来源标注规则、公式方向和多重比较处理,仓库材料还显示存在一般性测试和CI。扣分原因是没有该技能关键路径的专属测试、真实运行记录或第三方复核证据,且引用的参考文件未提供;静态证据不足以超过5分。
- 在采用结果前,应核验 experiment.py 的实际存在、参数语义、数值边界和输出格式,并用固定样例复算关键统计结果。
- 不要把 ESP 自报收入或归因直接当作增量收入;应确认订单ID真值、去重、归因窗口和实验随机化完整性。
- 邮件实验涉及用户行为数据;技能未明确规定脱敏、最小字段、保留期限或地区隐私合规要求。
- 应解决安全策略17.x与技能/README 18.0.0之间的版本支持矛盾,并确认引用的共享协议文件与当前修订一致。
这个 Skill 能做什么,适合哪些场景?
这是一个面向邮件营销实验设计与结果解读的 Agent Skill,支持 A/B、多变量、发送时间和留出组四种模式。它根据自有 ESP 或分析导出数据制定假设、变量矩阵、样本量、最小可检测效果、运行时长和统计功效计划。完成实验后,它会报告效果、区间、不确定性、统计与实际意义以及退订、投诉和硬退信等护栏。它不会替用户撰写邮件,也不会在缺少预先承诺的负责人和行动规则时替用户选择商业决策。
读取测试模式、测试目标、邮件画像、基线结果、名单规模、显著性水平、统计功效、最小可检测效果、护栏、决策规则以及已完成的 ESP 结果导出;设计每个单元只改变一个变量的实验矩阵,并保留控制组;使用仓库提供的 experiment.py 计算比例比较、样本量、效果区间、p 值和统计/实际意义标记;规划运行时长、比较次数、多重比较规则和读取日期;输出测试设计文档或结果解读文档及 Handoff Summary。
- 邮件营销人员希望比较两个主题行,并已知基线打开率、名单规模和目标提升幅度。
- 生命周期营销团队希望测试不同发送日期或时段,同时保持主题、受众和创意不变。
- 增长团队计划进行主题 × CTA 的 2×2 多变量测试,需要判断每个单元是否有足够样本。
- 电商团队希望通过随机留出组测量发送邮件带来的增量转化或每收件人收入。
- 分析人员拿到包含投递数、打开数、点击数和转化数的 ESP 导出,想判断结果是否具有统计和实际意义。
这个 Skill 有哪些优点和局限?
- 覆盖 A/B、多变量、发送时间和留出组四类常见邮件实验。
- 明确要求每个单元只隔离一个变量,并保留控制组。
- 同时区分统计显著性、实际效果和发送护栏。
- 默认支持用户手动提供的自有数据,不要求付费工具或 MCP。
- 支持样本量、MDE、运行时长、功效和多重比较规划。
- 依赖用户提供准确的 ESP、GA4 或电商导出数据。
- 不会撰写待测试的主题、正文或 CTA。
- 不会计算 SEND/EQS,也不会执行 email-quality-auditor 的 veto 检查。
- 没有负责人和预先承诺的行动规则时,不会自动选择推广或停止。
- 多变量测试在名单规模不足时需要缩减为 A/B 或延长运行时间。
如何安装这个 Skill?
在 Claude Code 中运行 /plugin marketplace add aaron-he-zhu/aaron-marketing-skills,然后运行 /plugin install aaron-marketing@aaron。兼容 Agent Skills 的其他主机可运行 npx skills add aaron-he-zhu/aaron-marketing-skills -s send-experiment-designer,或克隆完整仓库:git clone https://github.com/aaron-he-zhu/aaron-marketing-skills。
如何使用这个 Skill?
直接提出实验设计或结果解读请求,例如:Design an A/B subject-line test. Baseline open rate is 38%, I want to detect a 3-point lift. Goal is retention, list is 12,000. 也可以提供已完成的导出数据,并说明模式为 a-b、multivariate、send-time 或 hold-out。设计至少需要基线率、流量或名单规模和目标检测提升;结果解读需要每个变体的投递数和结果数。缺少必要输入时,技能应返回 NEEDS_INPUT;缺少负责人和预先承诺的行动规则时,决策为 UNDECIDED。