当样本同时包含多个个体和多个年份时,普通最小二乘法通常会把同一个体内部的重复观测当成相互独立,从而低估标准误,也可能忽略不随时间变化但会影响结果的个体特征。面板数据回归的价值,正在于利用个体在时间上的重复观测,控制那些无法直接测量、却可能同时影响解释变量和因变量的异质性。对社科研究者来说,Stata 中的固定效应与随机效应模型是最常用的两条路径,但选择不当会直接影响论文结论的稳健性。
面板数据准备
在运行模型之前,必须让 Stata 知道数据是面板结构,而不是普通的横截面数据。核心变量至少包括个体标识和时间标识。假设数据包含个体代码 id、年份 year、因变量 y 以及解释变量 x1、x2,第一步应执行:
xtset id year
如果数据已经按个体和时间排序,该命令会生成面板设定信息。输出中的 panel variable 和 time variable 可以用来核对数据结构。没有执行 xtset 而直接使用 xtreg,Stata 会提示数据未设定为面板,后续估计也无法进行。还需要额外留意重复观测问题:同一个体在同一年份若出现多条记录,会破坏时间维度识别,必要时先用 duplicates report 检查并处理。
固定效应模型
固定效应模型的关键是剔除不随时间变化的个体异质性。它不要求这些个体特征与解释变量不相关,因此更适合个体特征可能同时影响核心变量的情形。在 Stata 中,基本命令为:
xtreg y x1 x2, fe
输出结果会给出三组 R²:组内、组间和整体。固定效应模型主要使用组内解释力,因为模型实际上利用了每个个体在不同年份的变化来识别系数。系数表下方的 sigma_u、sigma_e 和 rho 分别表示个体效应的标准差、随机扰动的标准差以及个体效应在复合误差中所占比例。rho 较高意味着个体层面的未观测异质性较强,也说明考虑面板结构是合理的。
需要注意,固定效应模型会自动吸收所有不随时间变化的变量,例如性别、民族、出生年份等。如果研究问题本身关注这类变量的影响,固定效应模型无法单独给出系数。它更适合解释“某个体特征的变化如何影响结果”或“时间变化型政策、收入、教育程度等变量对结果的影响”。
随机效应模型
随机效应模型没有把个体效应当作需要消除的参数,而是假设个体效应是随机的,并且与解释变量不相关。它通过广义最小二乘法同时使用组内和组间信息,因此能够估计不随时间变化的变量系数。基本命令是:
xtreg y x1 x2, re
与固定效应不同,随机效应输出通常报告 Wald 检验的整体显著性。系数解读方式类似,但前提假设更强:如果个体效应与解释变量相关,随机效应估计量就会不一致。换句话说,随机效应模型在统计效率上可能更高,但代价是假设更严格。研究者不能因为随机效应模型能估计性别、地区等变量就默认可用,必须先验证核心假设是否成立。
豪斯曼检验与模型选择
豪斯曼检验用于比较固定效应与随机效应估计量的系统差异。其原假设是随机效应模型成立,也就是个体效应与解释变量不相关。若检验拒绝原假设,说明随机效应估计不再一致,应当采用固定效应模型。
在 Stata 中,需要先保存两个模型的估计结果,再进行比较:
xtreg y x1 x2, fe
estimates store fe
xtreg y x1 x2, re
estimates store re
hausman fe re
检验结果中关注 Prob>chi2。如果该值小于常用的显著性水平,例如 0.05,表明两个模型的系数差异超过了随机波动范围,应拒绝随机效应假设,选择固定效应。如果 p 值较大,则不能拒绝原假设,但也不等于“随机效应绝对正确”,只能说明当前数据下没有足够证据否定随机效应模型。
实际使用中,有几个细节会影响检验可信度。第一,如果回归中使用了稳健或聚类稳健标准误,标准豪斯曼检验的适用性会下降,需要改用其他检验形式。第二,检验结果应在模型设定一致的前提下比较,不能一边加入时间虚拟变量、一边省略。第三,样本量较小或个体间变异不足时,检验功效可能较低,不应仅凭一个不显著的 p 值就轻易放弃固定效应。研究者应结合理论预期和核心假设来判断,而不是把豪斯曼检验当成自动选择按钮。
常见误区
一是没有执行 xtset,却直接使用 xtreg。这类错误会导致命令无法运行或面板设定混乱。二是把“固定效应”理解为“个体效应固定不变”,把“随机效应”理解为“个体效应随机变化”。实际上,固定效应允许个体截距不同,但不要求个体效应与解释变量无关;随机效应则假设个体效应服从随机分布,并与解释变量不相关。二者区别主要在于假设条件,而不是字面意义上的“固定”或“随机”。
三是忽视变量在时间上的变异程度。固定效应模型只识别随时间变化的变量,如果一个核心解释变量在样本期内几乎不变,其系数估计会很不稳定,甚至无法估计。此时应当重新审视研究设计,而不是强行报告一个不可靠的系数。四是把豪斯曼检验结果当作最终依据,忽略模型背后的理论假设。尤其在个体异质性较强、解释变量与个体特征明显相关的社科研究中,固定效应通常更稳健,即使随机效应假设未被拒绝,也需谨慎解释。
最后,完成估计后不要只报告系数和星号,还应检查面板设定的质量、核心变量变异程度以及模型稳健性。论文写作中,报告固定效应或随机效应的选择依据、关键检验结果和模型局限,会让方法部分更具有说服力,也能减少审稿过程中的方法性质疑。


