在“高值高发生组”中,四种模型在验证样本上的AUC均超过0.99,表明其能够较好地区分由AHP概率面划分出的虚拟正、负样本。逻辑回归模型表现最佳,Accuracy为97.78%,Sensitivity为95.56%,Specificity为100%,F1-score为0.9773,Kappa为0.9556,AUC达到1.0000;XGBoost和梯度提升决策树的AUC分别为0.9970和0.9960,朴素贝叶斯相对较低但仍达到0.9926(表2)。ROC曲线进一步显示,逻辑回归在验证集上具有最优判别能力,而基于树的集成模型同样保持较高稳定性(图5)。
在反转标签来源区间的“低值高发生组”中,逻辑回归模型仍取得最优验证结果,Accuracy为98.89%,Recall为100%,F1-score为0.9890,AUC为1.0000(表3)。这一对照试验说明,在当前虚拟样本构造规则下,模型能够稳定学习AHP概率面所编码的环境因子组合特征;但也意味着高精度主要反映模型对知识驱动标签的复现能力,不能直接等同于对真实滑坡发生位置的独立预测能力(图6)。
空间交叉验证结果表明,在高值高发生组中,逻辑回归平均AUC为99.80%,标准差仅为0.39%,平均Accuracy为97.46%,优于其余模型(表4)。在低值高发生组中,逻辑回归平均AUC同样为99.80%,平均F1-score为97.50%,显示该框架在不同空间子区间中具有较好的内部稳定性(表5)。
表4 四种模型五折空间交叉验证结果(高值高发生组)
表5 四种模型五折空间交叉验证结果(低值高发生组)
最终易发性制图表明,四种模型均将研究区中部和南部识别为相对低易发区,而东北部和西北部则表现为高至极高易发区(图7)。不同模型的分级面积比例存在明显差异:逻辑回归结果中低易发区占比最高,为32.92%;XGBoost和梯度提升决策树则更倾向于形成“极低—极高”两端集中的分布格局,表明树模型对特征空间极端差异更敏感(图8)。在反转样本定义的实验中,各模型总体空间格局相近,但高易发区更多出现在研究区北部及边缘地带,进一步说明易发性分区结果会受到虚拟标签规则的显著影响(图9)。
图7 乌蒙山区滑坡易发性图(a) logistic regression; (b) Naive bayes; (c) extreme gradient boosting; (d) gradient boosting decision tree
敏感性分析显示,训练集比例从50%提高至90%时,梯度提升决策树的平均AUC始终高于0.972,表现出较强稳定性;逻辑回归的精度随训练样本增加趋于稳定(图10)。当正负样本严重失衡时,模型Accuracy反而升高,但AUC明显下降,XGBoost在1:200极端比例下AUC降至0.500,揭示仅以Accuracy判断模型优劣可能掩盖少数类识别失效问题(图11)。随着样本数量增加,四种模型的性能波动均逐渐减小,其中逻辑回归在样本量达到500时平均AUC已接近0.998,显示分层虚拟样本可为简单模型提供相对稳定的训练基础(图12)。
图10 不同训练样本划分比例下四种集成模型验证AUC与Accuracy箱线图
图11 不同正负样本比例下四种集成模型验证AUC与Accuracy箱线图
图12 不同正负样本数量下四种集成模型验证AUC与Accuracy箱线图