二元Probit回归分析结果解读二元Probit回归是一种用于研究自变量对二分类因变量影响的广义线性模型方法。与Logistic回归采用Sigmoid函数不同Probit回归基于标准正态分布的累积分布函数建立链接将线性组合映射为0到1之间的概率值。该方法在经济学、社会学和医学研究中应用广泛尤其适用于因变量仅取0和1两个值的情形。本研究利用SPSSAU软件将x1、x2、x3、x4、x5作为自变量y作为因变量进行二元Probit回归分析探讨各自变量对二分类结果的影响方向与影响程度。在SPSSAU【实验/医学研究】模块选择【二元probit】将变量拖拽至右侧对应分析框操作如下图一、数据基本信息本次分析共有320个有效样本进入模型不存在缺失数据。因变量y取值为0和1两个类别其中y0的样本有169个占比52.81%y1的样本有151个占比47.19%。因变量两类分布较为均衡比例接近1:1有利于模型的稳定估计。从表1可以看出全部320个样本均有效进入模型分析无缺失数据被排除。因变量y的两个取值分布较为均匀不存在严重的类别不平衡问题模型估计的可靠性有保障。二、模型似然比检验模型似然比检验用于判断纳入自变量后模型整体是否具有统计学意义。原假设为纳入自变量x1、x2、x3、x4、x5前后模型质量无差异即所有自变量的回归系数同时为0。从表2可知仅截距模型的-2倍对数似然值为442.601纳入5个自变量后的最终模型-2倍对数似然值降至166.704似然比卡方值为275.897df5对应的p值为0.000远小于0.01的显著性水平。因此拒绝原假设说明至少有一个自变量的回归系数不为0本次构建的Probit回归模型具有统计学意义纳入的自变量整体上对因变量y具有显著的解释力。此外模型的AIC值为178.704BIC值为201.314这两个指标可用于不同模型之间的比较值越低表示模型拟合越好。三、回归系数分析回归系数反映了各自变量对因变量y取1概率的影响方向和强度。在Probit模型中回归系数为正表示该变量增大时y取1的概率增加回归系数为负则表示y取1的概率降低。模型公式为Probit(p) -0.284 1.836*x1 1.062*x2 - 1.032*x3 0.864*x4 - 0.216*x5其中p代表y为1的概率。备注因变量 yMcFadden R² 0.623Cox Snell R² 0.578Nagelkerke R² 0.771从表3可知各自变量的回归系数及显著性情况如下x1的回归系数为1.836在0.01水平上显著z8.590p0.00095%置信区间为[1.417, 2.255]表明x1对y产生显著的正向影响即x1增大时y取1的概率显著提高。x2的回归系数为1.062同样在0.01水平上显著z6.984p0.00095%置信区间为[0.764, 1.360]x2对y也具有显著的正向影响。x3的回归系数为-1.032在0.01水平上显著z-6.953p0.00095%置信区间为[-1.323, -0.741]说明x3对y产生显著的负向影响x3增大时y取1的概率降低。x4的回归系数为0.864在0.01水平上显著z6.187p0.00095%置信区间为[0.590, 1.137]x4对y具有显著的正向影响。x5的回归系数为-0.216但p值为0.078大于0.05的显著性水平未达到统计学显著性说明x5对y的影响不具有统计学意义。截距项为-0.284在0.05水平上显著z-2.438p0.015。从模型拟合优度来看McFadden R²为0.623Cox Snell R²为0.578Nagelkerke R²为0.771。McFadden R²达到0.623远超0.2的经验阈值说明模型对数据具有良好的解释力。Nagelkerke R²高达0.771接近0.8进一步印证了模型的高解释效力。四、模型预测准确率分析通过模型预测准确率可以评估Probit回归模型对实际数据的分类效果判断模型拟合质量。从表4可知模型的整体预测准确率为88.13%拟合效果较好。具体来看当真实值为0时模型正确预测了151个样本共169个预测准确率为89.35%错误率为10.65%当真实值为1时模型正确预测了131个样本共151个预测准确率为86.76%错误率为13.25%。两类因变量的预测准确率均在86%以上表明模型对y0和y1的识别能力均较为均衡不存在明显的偏向性。整体88.13%的预测准确率说明该Probit回归模型能够较好地拟合实际数据。五、Hosmer-Lemeshow拟合度检验Hosmer-Lemeshow检验是评估二分类模型拟合优度的常用方法。该检验的原假设为模型拟合值与观测值的吻合程度一致。若p值大于0.05则接受原假设说明模型拟合良好。从表5可知Hosmer-Lemeshow检验的卡方值为8.636df8对应的p值为0.374远大于0.05的显著性水平。因此接受原假设认为模型拟合值与观测值的吻合程度一致本次二元Probit回归模型的拟合优度较好。结合前述88.13%的预测准确率进一步证实了模型的可靠性。六、边际效应分析边际效应表示自变量每增加一个单位时因变量y取1的概率的边际变化量。相比回归系数边际效应更直观地反映了自变量对概率的影响幅度在经济学和计量学领域使用较多。从表6可知x1的边际效应为0.268z20.652p0.000在0.01水平上显著意味着x1每增加一个单位y取1的概率增加26.75%影响幅度最大。x2的边际效应为0.155z11.037p0.000x2每增加一个单位y取1的概率增加15.48%。x3的边际效应为-0.150z-10.825p0.000x3每增加一个单位y取1的概率降低15.04%。x4的边际效应为0.126z8.202p0.000x4每增加一个单位y取1的概率增加12.58%。x5的边际效应为-0.031z-1.795p0.073未达到0.05的显著性水平其95%置信区间为[-0.066, 0.003]包含0进一步印证了x5对y不具有显著影响。综合边际效应分析结果x1对y取1概率的边际正向效应最大26.75%其次是x215.48%和x412.58%x3具有显著的边际负向效应-15.04%x5的边际效应不显著。七、图形分析图1 森林图从图1森林图可以看出该图将各自变量的回归系数或效应值及其95%置信区间进行了可视化展示。图中以0为参考基准线各变量对应的效应点及其置信区间横线分别展示了点估计值和区间范围。x1、x2、x4的效应值位于基准线右侧且置信区间不包含0表明它们对y具有显著的正向影响x3的效应值位于基准线左侧且置信区间不包含0表明其对y具有显著的负向影响x5的置信区间跨越基准线0说明其效应不具有统计学显著性与回归系数分析结论一致。森林图直观地展示了各变量的效应大小和显著性差异。图2 预测概率图从图2预测概率图可以看出模型对每个样本的预测概率分布情况。该图展示了模型根据Probit回归方程计算出的各样本y取1的预测概率可以直观观察模型对不同类别样本的区分能力。y1的样本预测概率整体偏高y0的样本预测概率整体偏低说明模型对两类样本具有较好的区分度。少数样本的预测概率处于0.5附近的模糊区域对应了表4中约11.88%的预测错误率。图3 边际效应图从图3边际效应图可以看出各自变量在均值处的边际效应大小及方向。x1的边际效应最大0.268表现为正向效应柱向右延伸x20.155和x40.126也表现为正向效应x3-0.150表现为负向效应柱向左延伸x5-0.031的边际效应接近于0且未通过显著性检验。该图直观对比了各自变量对y取1概率的边际影响幅度与表6的边际效应数值完全一致。八、结论本研究利用SPSSAU软件对320个有效样本进行二元Probit回归分析以x1、x2、x3、x4、x5为自变量探讨其对二分类因变量y的影响。模型似然比检验结果表明模型整体有效χ²275.897p0.000McFadden R²为0.623Nagelkerke R²高达0.771模型解释力较强。回归分析结果显示x1β1.836、x2β1.062和x4β0.864对y产生显著的正向影响p0.01x3β-1.032对y产生显著的负向影响p0.01而x5β-0.216p0.078的影响不显著。边际效应分析进一步表明x1每增加一个单位使y取1的概率增加26.75%影响幅度最大。模型整体预测准确率为88.13%Hosmer-Lemeshow检验通过p0.374表明模型拟合优度良好。综上x1、x2、x4是y取1的显著促进因素x3是显著的抑制因素x5的影响不具有统计学意义。