在论文结果部分,“两组差异显著(p < 0.05)”“变量之间存在显著相关”这类写法很常见。它看似完成了统计报告,实际上只给读者留下一个二分判断:是否拒绝零假设。至于差异或关系的方向、大小、估计精度,以及这个结果对研究问题意味着什么,读者仍然无从得知。统计结果报告的任务不是宣布“是否显著”,而是把统计输出转成可复核、可解释的学术句子。

先把统计结果拆成三层信息

p 值只回答“是否可能由随机误差造成”

p 值是在零假设为真的前提下,观察到当前结果或更极端结果的概率。它并不直接表示效应有多大,也不表示零假设为真的概率。p < 0.05 只说明,如果实际上没有效应,出现这种数据的概率较低。它不能告诉读者这种效应是否值得关注。

效应量回答“差异或关系有多大”

效应量是统计结果中容易被忽略的关键信息。常用指标包括 Cohen's d、相关系数 r、η²、优势比 OR 等。例如 d = 0.2、0.5、0.8 通常被粗略视为小、中、大效应,r = 0.1、0.3、0.5 也可作类似参考。只有报告效应量,读者才能判断结果是否具有实际意义。

置信区间回答“估计有多精确”

置信区间反映估计的不确定性。一个较窄的置信区间说明估计相对精确;一个很宽的区间说明样本信息不足,结论需要更谨慎。写作中通常报告 95% CI,例如 95% CI [0.32, 1.31]。区间是否跨零或跨特定阈值,也能帮助读者判断效应方向和稳定性。

从“只报 p 值”到完整报告的四步修改

第一步:先给出描述性结果

推断统计之前,要让读者看到数据的基本形态。至少应报告均值、标准差,或中位数、四分位数等适合数据分布的指标。只写“两组差异显著”会让读者无法判断差异方向。

原写法:

实验组和对照组差异显著。

修改后:

实验组后测成绩(M = 78.40, SD = 8.12)高于对照组(M = 70.25, SD = 9.03)。

第二步:报告效应量并说明大小

报告 p 值的同时,应给出效应量指标,并说明其大小。不要只说“显著”,而要让读者知道效应处于什么水平。

原写法:

干预显著改善抑郁症状。

修改后:

干预组抑郁得分显著低于对照组,t(58) = 2.41, p = .019, d = 0.63。该效应量属于中等水平。

第三步:给出置信区间

置信区间应紧跟在效应量之后,帮助读者判断估计范围。写作时可以写成“95% CI [下限, 上限]”。如果区间较宽,应明确说明结果存在不确定性。

原写法:

两组差异显著。

修改后:

两组后测成绩差异显著,d = 0.63, 95% CI [0.11, 1.14]。该区间不包含 0,但上限接近 1.14,说明效应大小仍有一定不确定性。

第四步:把统计结果放回研究问题

统计显著不等于理论重要。结果部分应把统计发现与研究假设或研究问题联系起来,但避免超出设计允许的推断。观察性研究不宜写成因果结论,小样本研究也不宜把中等效应说成稳定规律。

原写法:

结果表明干预有效。

修改后:

结果初步表明,干预与后测成绩提升相关,效应量为中等,但由于置信区间较宽,需在更大样本中进一步验证。

常见句子修改对照

以下示例中的数值仅用于说明格式,并非真实研究数据。

原写法修改后
焦虑与睡眠质量存在显著负相关(p < 0.05)。焦虑得分与睡眠质量得分呈中等程度负相关,r(198) = −.42, 95% CI [−.53, −.30], p < .001。
两组差异显著。干预组后测成绩(M = 78.40, SD = 8.12)高于对照组(M = 70.25, SD = 9.03),t(58) = 2.41, p = .019, d = 0.63, 95% CI [0.11, 1.14]。
学习动机对成绩有显著影响。控制性别和前期成绩后,学习动机每增加 1 个标准差,期末成绩增加 0.28 个标准差,β = .28, 95% CI [.12, .44], p = .001,效应量为小到中等。

显著性表述的常见问题

“显著性表述”不是越强烈越好。常见错误包括把 p 值的大小直接当作效应大小,把 p < 0.001 写成“非常显著”,或将 p > 0.05 写成“无差异”。更准确的做法是:

  • 报告具体 p 值,当 p < .001 时可写 p < .001,而不写 p = .000。
  • 不把“边缘显著”当作一种正式的统计结论,除非目标期刊允许并有明确标准。
  • 不显著时,也应报告效应量和置信区间,说明“未发现足够证据表明差异存在”,而不是直接写“没有差异”。
  • 避免仅凭 p 值判断结果重要,应结合效应量、置信区间和研究背景。

报告格式要以目标期刊和学科最新规范为准

不同学科对统计结果报告的要求并不完全一致。心理学、教育学等领域通常要求报告效应量和置信区间;医学研究可能更强调临床意义和区间估计;部分工程或计算机领域则更侧重准确率、误差指标或模型性能。APA 风格通常建议报告效应量和置信区间,但具体格式仍会因期刊不同而调整。

写作前应查阅目标期刊的作者指南或统计报告要求,并以最新的格式手册为准。本文提供的句式和方法属于通用写作路径,不替代具体期刊的格式规定。

结果部分自查清单

完成结果部分后,可以逐项检查:

  • 是否先报告了描述性统计,而不是直接从 p 值开始?
  • 每个关键比较或关系是否给出了效应量指标?
  • 是否报告了置信区间或等价的不确定性信息?
  • 是否说明了效应的方向,而不仅仅写“显著”?
  • 是否把统计结果与研究问题联系起来,同时避免过度推断?
  • 是否区分了统计显著与实际重要性?
  • 不显著的结果是否也报告了效应量,而不是简单写“无差异”?

统计结果报告的改进,并不是把句子写得更长,而是让读者在读完结果后能清楚回答三个问题:效应是否存在、效应有多大、估计有多可靠。围绕这三层信息组织句子,才能让论文结果部分从“只报 p 值”走向可复核、可解释的规范报告。

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。