TL;DR
科学方法:(1) 观察现象;(2) 形成解释它的假设;(3) 设计旨在证伪假设的实验;(4) 运行实验;(5) 基于结果更新信念。关键纪律:设计旨在反驳而非确认假设的实验。科学方法的力量来自于系统性地容易被证明为错误——这就是为什么由它产生的信念是可靠的。
科学方法是将科学与意见区分开来的认识论程序。其核心创新是实验测试:与其争论哪种解释更合理,不如设计一个能明确反驳其中一种的测试。经受住反复严格证伪尝试的假设获得可信度;未能通过任何精心设计测试的假设被拒绝或修正。
现代形式化主要归功于卡尔·波普尔的20世纪科学哲学,他将可证伪性确定为区分科学与非科学主张的标准。一个主张如果是科学的,就必须在原则上可以被证明为假。"所有天鹅都是白的"是科学主张——一只黑天鹅就能证伪它。"一切皆有原因"不是科学主张——没有任何观察能证伪它。
应用于纯科学之外,科学方法为任何想要可靠区分真实信念与错误信念的情况提供模板:产品开发(A/B测试、可用性测试)、商业战略(市场实验、试点项目)、医学(临床试验)、个人决策(大型承诺前的小实验)。
科学方法不需要实验室。它需要:具体的、可证伪的预测;测试该预测的、能最小化混杂变量的方法;诚实报告包括反驳你假设的结果在内的所有结果;以及基于证据更新信念的意愿。
步骤1:观察并定义现象
——你在研究什么具体模式或问题?
——精确:"移动用户的转化率为2.3%",而非"移动端转化差"
步骤2:研究现有知识
——已知什么?存在什么解释?
——避免重新发明轮子或与既定发现矛盾
步骤3:形成具体的、可证伪的假设
——"如果X为真,那么在Z条件下应该观察到Y"
——必须足够具体以被推翻
步骤4:设计实验
——什么证据会证伪假设?
——控制混杂变量
——预先注册成功标准(在看到结果之前)
步骤5:收集数据
——严格运行实验
——测量你所说的要测量的内容
步骤6:分析结果
——结果支持还是反驳假设?
——应用适当的统计分析
步骤7:更新信念并报告
——如果结果反驳了假设,则修正假设
——诚实报告方法和结果,包括负面结果
产品开发中的A/B测试:多邻国假设连续学习天数(streaks)会增加留存率。应用科学方法:假设——看到第7天维护连续提示的用户将比未看到的用户30天留存率高15%;实验——随机分配50,000用户到提示组vs.无提示组;预先注册的成功标准——在95%统计置信度下提升≥15%;结果——18%留存提升;假设确认;更新——对所有用户部署连续提示并探索进一步的连续相关机制。没有科学方法(仅凭直觉"连续似乎好"),多邻国将无法可靠区分真正有效的东西与直觉上感觉好的东西。A/B测试允许多邻国每年运行数千个实验,每个结果都建立可靠、基于证据的产品策略。
医学临床试验:COVID-19疫苗:辉瑞-BioNTech的mRNA疫苗开发大规模使用科学方法。假设——两剂BNT162b2将在成人中将有症状COVID-19减少≥50%;实验——43,661名参与者随机分配到疫苗或安慰剂组;双盲(参与者和研究人员都不知道分配);主要终点——PCR确认的有症状COVID-19,第二剂后7天以上;结果——95%效力(170例确诊:安慰剂组162例,疫苗组8例);更新——监管紧急授权,数十亿人部署。双盲随机对照试验是金标准,正是因为它最大程度地控制了混杂变量(安慰剂效应、选择偏差、测量偏差)。
商业假设检验:创业公司假设添加免费试用将提高落地页付费转化率。假设——"开始免费试用"CTA将产生比"立即购买"更高的90天付费转化率;实验——50/50分流测试新访客,跟踪90天;控制混杂——相同广告支出、相同落地页内容,仅CTA不同;结果——免费试用CTA注册量高40%但付费转化率低25%——净效果负面;更新——免费试用吸引"试试看的人";在重新测试前完善资格认定机制。结果反驳了假设。没有受控实验,团队可能将更高注册量归因于免费试用并宣布成功,错过货币化降级。
| 配合使用 | 效果 |
|---|---|
| 可证伪性 | 可证伪性是科学方法的哲学核心 |
| 贝叶斯思维 | 贝叶斯更新形式化了如何从实验证据修正信念 |
| 最小可行测试 | MVT在资源受限的环境中高效应用科学方法 |
| 5个为什么 | 5个为什么生成科学方法随后检验的假设 |
HARKing——知道结果后假设。看到数据后形成假设,然后像预先指定一样呈现。这会产生看似显著但实际是噪音模式匹配的结果。预先注册(在看到结果之前发布假设和方法)可防止此问题。
效力不足的研究。运行太小而无法检测真实效应的实验。200用户的A/B测试无法可靠检测5%的提升;需要数千用户。效力不足的研究频繁产生假阴性(未能检测真实效应),矛盾地产生膨胀的假阳性。
混淆相关性与因果性。科学实验旨在隔离因果关系。没有随机分配的观察性研究可以显示相关性但不能显示因果性。这种混淆产生大量糟糕的健康建议、商业神话和政策错误。
忽视负面结果。出版偏差(优先发表正面结果)腐蚀科学记录。在商业环境中,等效的是"挑选"确认先前信念的实验。诚实报告负面结果对学习至关重要。
什么使假设"科学"vs"非科学"?
遵循卡尔·波普尔:假设在原则上可证伪——如果存在某种可能的观察能证明它错误——则是科学的。"锻炼改善心血管健康"是科学的(我们可以设计可能反驳它的研究)。"一切皆有原因"是不可证伪的——没有任何观察能反驳它,因为任何反证都可以被重新解释为"原因"的一部分。不可证伪的主张不一定错误;它们只是在科学上不可检验。
没有正式实验室或统计团队如何应用科学方法?
关键纪律可在没有正式基础设施的情况下实现:(1)在收集数据前陈述假设;(2)设计真正能证明假设错误的测试;(3)诚实收集和报告结果,包括失败;(4)基于发现更新信念。在商业环境中,即使是简单的前后对比、市场子集的受控试点、或足够样本量的基本A/B测试,也无需统计学博士即可提供科学纪律。
为什么复制很重要,"复制危机"是什么?
科学通过独立复制进步——其他研究人员运行相同实验并检查是否得到相同结果。无法复制的发现可能是侥幸或偏差的结果。"复制危机"(2011年至今)指发现心理学、医学和社会科学中发表的发现出人意料地大比例无法复制。促成因素包括小样本量、HARKing、出版偏差和p-hacking。危机促使改革包括预先注册、开放数据和更大规模的复制研究。
🚀 用话老师为你的假设设计实验 →
本页面是话老师思维模型知识库的一部分。
心智模型是"知道",练成肌肉记忆才是"会"。去 AI 陪练用这个场景过一遍,或在训练营里找对应实战课。
🤖 AI 陪练 🗓️ 30 天训练营 🎨 生成海报