CatBoost结果解读:类别特征编码与过拟合控制

📅 2026/8/3 15:25:35 👁️ 阅读次数 📝 编程学习
CatBoost结果解读:类别特征编码与过拟合控制

CatBoost分类模型结果解读

一、方法概述

CatBoost(Categorical Boosting)是一种基于梯度提升决策树的机器学习算法,由Yandex公司开发。该算法在处理分类特征和序列数据方面具有显著优势,能够有效减少参数调优的工作量,并通过对称决策树结构降低过拟合风险。本研究利用SPSSAU软件对欺诈检测数据进行CatBoost分类建模分析,旨在通过用户行为特征变量预测欺诈行为,为金融风控提供科学依据。

在SPSSAU【机器学习】模块选择【CatBoost】,将变量拖拽至右侧对应分析框,操作如下图:

二、数据概览

本研究共纳入1000个样本,以换设备次数、支付失败次数、换IP次数、换IP国次数、交易金额5项指标作为自变量,以欺诈标签(0=非欺诈,1=欺诈)作为因变量进行分类建模。因变量分布如下表所示:

由表1可知,1000个样本中非欺诈样本(标签=0)为600例,占比60.00%;欺诈样本(标签=1)为400例,占比40.00%。数据无缺失值,全部纳入分析。

由表2可知,按照8:2的比例将数据划分为训练集(800个样本,占80.00%)和测试集(200个样本,占20.000%),用于模型训练与泛化能力评估。

三、特征权重分析

由表3可知,CatBoost模型的特征权重分布相较于LightGBM更为均衡。换设备次数的权重最高,为0.234(23.36%),对模型构建起关键作用。支付失败次数与换IP国次数并列第二,权重均为0.208(20.77%)。交易金额的权重为0.187(18.70%),换IP次数的权重为0.164(16.40%)。五项特征的权重分布相对均匀,最高与最低之间差距仅为6.96个百分点,表明CatBoost模型对多维度行为特征均给予了较为均衡的重视。

图1 CatBoost特征权重分布图

由图1可知,CatBoost的特征权重分布呈现较为平缓的梯度格局。换设备次数以23.36%的权重位居首位,支付失败次数与换IP国次数权重相同(均为20.77%),交易金额和换IP次数紧随其后。与LightGBM中交易金额一家独大的局面不同,CatBoost更强调设备更换、IP变更等行为维度特征的综合判别作用。

四、训练集模型评估

由表4可知,CatBoost模型在训练集上达到了完美分类效果:整体准确率、精确率、召回率和f1-score均为1.000。非欺诈类和欺诈类的各项指标均达到满分,表明模型在训练数据上实现了完全拟合。

五、测试集模型评估

由表5可知,CatBoost模型在测试集上的整体准确率为89.00%,综合精确率为89.93%,综合召回率为89.00%,综合f1-score为0.886。相较于训练集的完美表现,测试集性能有所下降,存在一定过拟合,但整体分类效果良好。

从各类别看:非欺诈类(0.0)的精确率为0.861,召回率为0.984,f1-score为0.919,召回率高达98.4%,表明模型对非欺诈样本的覆盖能力极强。欺诈类(1.0)的精确率为0.964,召回率为0.730,f1-score为0.831。欺诈类精确率较高(96.4%),说明模型判定为欺诈的可靠性较强;但召回率为73.0%,仍有约27%的欺诈样本未能被识别。

六、模型参数汇总

由表6可知,CatBoost模型采用Auto损失函数,迭代次数设置为500次,学习率为0.1,树最大深度为6。L2正则化系数为3.0,特征子集比例为1.0。模型在测试集上取得89.00%的准确率和0.886的f1-score。

七、结论

本研究基于SPSSAU平台,利用CatBoost算法对1000个欺诈检测样本进行分类建模分析。结果显示,CatBoost模型对五项行为特征的权重分配较为均衡,换设备次数(23.36%)、支付失败次数(20.77%)和换IP国次数(20.77%)是前三位重要特征。模型在测试集上的准确率为89.00%,综合f1-score为0.886,整体分类效果良好。与LightGBM相比,CatBoost在特征利用的均衡性方面表现更优,但欺诈样本的召回率(73.0%)仍有提升空间。