固定条件以后再比较
许多「效果提升」来自测试条件变化。用不同 Prompt、不同模型、不同地区和不同日期查询品牌,再比较两个答案,无法说明策略产生了效果。测量 AI 搜索和推荐时,需要记录 Query、完整 Prompt、模型版本、地区、时间、重复次数和是否开启搜索。[1]
相同原则也适用于其他实验:
- 比较落地页时,尽量保持流量来源和用户意图接近;
- 比较价格时,记录套餐、折扣、销售方式和客户类型;
- 比较渠道时,使用相近的内容质量、投入时间和转化定义;
- 比较外包交付时,给候选人相同范围、材料和验收要求;
- 比较 AI 候选时,固定目标、输入和筛选标准。
现实中无法把所有变量完全控制。记录已经改变的条件,就能知道结论可以支持到什么程度。
复盘结果,也复盘规则
复盘首先回到行动前的计划。需要检查的内容包括:
- 实际结果与预期相差多少;
- 原始假设是否得到支持;
- 执行是否按照计划完成;
- 测量过程是否出现缺失或口径变化;
- 哪些外部条件发生了变化;
- 下一次应该继续、调整还是停止;
- 哪条经验值得写入长期规则。
最后一项容易被遗漏。复盘如果只写「这次效果不好」,下次仍会重复同样的问题。
在一项长期外包内容工作中,委托方把截图、代码、结构和事实核验要求写入固定 Guideline。每次发现新的质量问题,就补充标准和示例,之后的作者都按更新后的版本执行。[2] 这是一种很具体的规则迭代:问题不只被修复在当前交付里,也改变了下一次工作的起点。
复盘还要区分四类失败:
- 假设错误:用户或市场与预期不同;
- 执行不足:计划合理,但样本、时长或操作没有完成;
- 测量失真:数据缺失、定义变化或归因错误;
- 外部变化:平台、政策、竞争或环境改变。
这四类失败对应的下一步不同。假设错误需要换问题,执行不足需要补足实验,测量失真需要修数据,外部变化则需要缩小结论的适用范围。
一份可持续使用的决策日志
决策日志不需要写成长报告。每个重要决定保留一页即可:
| 项目 | 记录内容 |
|---|---|
| 日期与负责人 | 谁在什么时候作出决定 |
| 决策问题 | 这次具体选择什么 |
| 关键事实 | 可追溯的原始观察 |
| 候选解释 | 目前考虑了哪些原因 |
| 采用方案 | 选择了什么,排除了什么 |
| 不确定项 | 仍缺少哪些证据 |
| 投入与期限 | 时间、现金和复盘日期 |
| 停止条件 | 哪些风险出现后不再继续 |
| 实际结果 | 发生了什么 |
| 规则更新 | 下一次怎样做得不同 |
日志的价值会随着时间增加。它能让经营者看见哪些判断经常准确,哪些信息容易被高估,哪类实验总是执行不完整。团队扩大以后,新成员也能理解一项规则来自什么问题,而不只看到最后结论。
证据工作流不会消除不确定性。它只是让事实、解释和行动之间保持清楚的连接。AI 可以帮助收集、压缩、比较和记录,人仍要决定什么值得相信、愿意投入多少,以及出现什么结果时承认原先的判断需要修改。
内容与责任分工、引用和业务结果分层、固定 Prompt/模型/地区/时间条件等章节。
Outline、Guideline、中期检查、交付验收和规则更新部分。