实验室行为实验最容易出问题的地方,往往不是统计分析,而是实验开始之前:研究问题没有被清楚地转化为变量,组间条件并不真正可比,研究者在流程中无意间改变了受试者的体验。结果即使出现显著差异,也很难判断差异究竟来自自变量,还是来自某个未被控制的细节。
对于论文研究而言,一个内部效度较高的实验方案,不只是写出“设置实验组和对照组”,而是要让每一步都能回答一个问题:如果观察到因变量变化,是否有足够理由把它归因于自变量?围绕这个问题设计变量、分组、随机化和记录流程,实验的可重复性会明显提高。
先把研究问题改写成可检验的变量关系
实验设计的起点不是实验材料,而是一个明确的因果判断。研究者需要先区分:自己想操纵什么,想观察什么,以及哪些因素可能同时影响两者。
自变量是研究者主动设置或改变的条件。例如,研究者可能关心不同信息呈现方式是否影响个体的风险选择,那么“信息呈现方式”就是自变量。因变量则是受试者在该条件下表现出的结果,可以是选择结果、判断评分、反应时间、任务完成情况或行为次数等。
变量定义不能只停留在概念层面。“风险偏好”“信任”“合作意愿”这类概念本身无法直接操作,必须进一步说明如何操纵、如何测量。例如,若因变量是合作意愿,需要明确它是通过一次选择任务、连续多轮决策,还是量表评分来体现。不同测量方式反映的可能不是完全相同的心理过程,论文中应说明这种操作化与研究问题之间的对应关系。
在动手设计材料前,可以先用一句完整的话写出核心假设:
在其他条件尽量一致的情况下,自变量的不同水平会导致因变量出现预期方向的差异。
这句话看似简单,却能帮助研究者及时发现设计漏洞。若无法说清“其他条件”包含什么,或因变量无法被稳定记录,实验方案通常还不够成熟。
用操作化定义减少概念与测量之间的偏差
自变量至少要包括两个可比较的水平。实验组接受研究者关注的处理,对照组则提供一个合理基线。这里的“合理”并不等于“什么都不做”,而是指对照条件应尽量排除与研究目的无关的差异。
例如,实验组阅读一段带有某种情绪色彩的材料,而对照组完全不阅读材料,这样得到的差异可能来自情绪内容,也可能只是来自阅读任务本身、材料长度或等待时间。更稳妥的做法是让对照组也完成形式相近、长度相当的任务,只是缺少实验组中的关键操纵。
自变量的操作化应尽量满足三个要求:
- 操纵具有清晰边界。 受试者能够区分不同条件,研究者也能说明各组到底差在哪里。
- 非关键特征尽量一致。 材料长度、任务难度、呈现顺序、界面风格、指导语和实验时长等,不应随意随组别变化。
- 操纵与理论构念相匹配。 如果理论上研究的是“社会评价压力”,操纵不应同时大幅改变奖励、时间限制和任务难度,否则很难确认哪一种变化起了作用。
因变量同样需要提前界定计算规则。若记录的是选择行为,要明确如何编码;若包含多道题目或多轮任务,要预先说明采用总分、平均值、比例还是其他汇总方式。不要等数据收集完成后,再根据结果“挑选”最有利的指标。事后调整指标不仅削弱研究的解释力,也会让复现实验的人无从判断原始分析路径。
必要时可加入操纵检验,用于确认受试者是否实际感知到预设处理。不过,操纵检验本身也可能影响后续行为,尤其是在它直接提醒受试者研究意图时。较常见的处理是将其放在核心因变量测量之后,或采用更间接的检验方式。
设置实验组与对照组时,先确保可比性
实验组与对照组的价值不在于名称,而在于构成一个反事实比较:同一类受试者在没有接受目标处理时,可能会呈现怎样的行为。现实中无法让同一个人同时经历两种条件,因此需要通过分组设计尽可能建立可比的样本。
最基础的组间设计是将不同受试者分别分配到实验条件和对照条件。它的优点是能避免前一条件对后一条件产生学习、疲劳或猜测研究目的等影响。但若样本较小,个体差异可能使组间不平衡更加明显。
当研究问题允许、且因变量不会因重复测量而被明显改变时,也可以采用组内设计,即同一受试者经历多个条件。这样能够减少稳定个体差异带来的干扰,但必须谨慎处理顺序效应。受试者先经历哪个条件、是否会因为熟悉任务而改变表现、是否会把前一次体验带入后一次判断,都是需要在设计阶段处理的问题。
无论采用哪种设计,都应避免让对照组沦为“低质量版本”的实验组。两组应在任务说明、实验环境、接触研究人员的方式、完成时间和奖励规则上尽量一致。研究者想比较的是关键操纵,而不是两套完全不同的实验体验。
识别并控制干扰因素
干扰因素是指除自变量外,仍可能影响因变量、并且在不同条件之间分布不均的因素。它们会让因果解释变得模糊。实验控制并不意味着消除所有个体差异,而是优先控制那些可能系统性影响结果的因素。
常见干扰来源包括受试者的既有特征、实验材料差异、实验时间与环境差异,以及研究者与受试者互动方式的差异。比如,若实验组集中在某一时间段完成任务,而对照组集中在另一时间段完成,那么疲劳、赶时间或环境变化都可能与组别混在一起。
控制干扰因素通常有几种思路。第一种是保持恒定:所有组别使用同一环境、相近的指导语、统一的任务时长和一致的记录方式。第二种是纳入设计:若某一特征确实重要,可在招募、分组或分析时明确考虑它,而不是假设它不存在。第三种是平衡安排:当实验必须使用不同材料、不同任务版本或不同顺序时,应让这些因素在各条件中尽量均衡出现。
需要警惕的是,控制变量并非越多越好。过多限制会让实验任务失去研究对象本来的特征,也可能使样本过于特殊,降低研究结论的适用范围。更合理的原则是:围绕核心因果问题,优先控制那些既可能影响因变量、又可能与自变量条件混淆的因素。
随机分配不是“随便分组”
随机分配的目的,是使受试者中已知和未知的个体差异在不同实验条件中没有系统性偏向。它不是研究者凭感觉交替安排受试者,也不是先看受试者特征再决定其组别,而是按照预先设定的随机规则完成分派。
实施随机分配时,关键是让分配规则在受试者进入实验之前就确定,并尽量减少研究者临场干预的空间。对于组间实验,可以预先生成分组序列,并按照受试者进入实验的顺序执行。若研究对象存在对结果影响较大的关键特征,也可以先按该特征分层,再在各层内随机分配,以避免某一类受试者意外集中在同一组。
随机化还应处理样本规模不均衡的问题。完全不加约束的随机安排,尤其在样本较少时,可能导致各组人数差距较大。研究者可以使用具有平衡目标的随机方案,使不同条件中的人数大致接近,但应在研究计划中写明采用何种分配逻辑,而不是在收集过程中为了“让结果好看”而临时调整。
对于组内设计,随机化重点转向条件顺序。若所有人都先完成条件甲、再完成条件乙,那么两种条件与先后顺序完全重合,无法判断差异来自条件本身还是练习、疲劳或适应。应将不同条件顺序在受试者之间进行平衡安排,并在实验记录中保留每位受试者实际经历的顺序。
让实验流程可复现,而不只是“看起来完整”
一份可执行的实验流程,应当让另一位研究者在不依赖口头说明的情况下,理解受试者从进入实验到结束的完整经历。流程记录不是论文写作末期的补充工作,而是实验设计的一部分。
建议在正式收集数据前,形成一份内部流程表,至少写清以下内容:
- 受试者的招募条件、排除条件与知情同意安排;
- 进入实验后的各个环节,包括说明、练习、操纵、核心任务、问卷与结束说明;
- 每个环节的材料、呈现顺序、预计时长和负责人员;
- 分组或顺序分配的执行规则;
- 因变量、操纵检验和背景变量的记录方式;
- 异常情况的处理原则,例如中途退出、未完成任务或明显不符合任务要求的情形。
其中最容易被忽略的是排除规则。研究者当然需要处理无效数据,但“无效”的判断标准应尽可能提前确定。例如,哪些情况属于未完成、哪些情况说明受试者没有理解任务、哪些记录因技术或流程问题无法使用,都应在数据分析前有明确依据。否则,排除过程可能不自觉地受到研究结果影响。
正式实验前的小规模试运行也很有价值。它不必追求检验最终假设,而是用于发现设计层面的障碍:指导语是否存在歧义、材料是否引发非预期理解、任务是否过于复杂、记录是否遗漏关键变量、受试者是否能按预想完成流程。试运行发现的问题,应反映在正式方案的修订记录中。
在论文方法部分呈现设计逻辑
方法部分不需要把每一次现场操作都写成流水账,但读者应能看清实验设计为何能够支持因果推断。通常需要交代研究设计类型、样本来源与分配方式、自变量和因变量的操作化、实验材料与程序、控制措施,以及数据处理和排除规则。
比起笼统写“受试者被随机分为两组”,更有信息量的表述是说明随机分配在何时发生、分配针对哪些条件、研究者如何保证流程一致,以及是否处理了条件顺序。比起写“控制其他变量”,更应交代哪些关键因素被保持一致,哪些因素通过平衡或记录方式纳入考虑。
一个可靠的实验设计,往往不依赖复杂的技术安排,而依赖研究者对比较条件的克制:只改变真正要检验的因素,尽量让其他体验保持一致;不把随机化当作形式要求,而是让它实际进入招募和执行流程;不等到结果出来后才补写规则,而是在实验前留下可核查的设计痕迹。这样得到的数据,即使结论不符合预期,也仍然具备清晰的解释价值。

