Advertisement

《Credit Risk Scorecard》第5章开发用例集

阅读量:

范涛

发表于2017-03-31

第五章:Scorecard Development Process, Stage 3: Development Database Creation

特征筛选

特征选取应综合考量多个维度,包括:(1)具备预测价值;(2)数据来源稳定且具有抗干扰能力;(3)便于获取;(4)具备良好的可解释性;

样本划分

开发/验证:在建模过程中,需将样本划分为训练集与测试集。常见的做法包括交叉验证、跨时间段验证等。

良好/不良/拒绝样本:

常见的开发样本选择方法包括:(1)过采样,这种方法需要在模型构建完成后进行相应调整;(2)按比例采样,使开发样本的分布与实际样本分布保持一致。

开发数据的采集与构建

随机性与代表性:所选样本必须具有随机性,并能够代表评分卡应用的目标群体(需排除某些特定类型的样本)。若样本偏向某一类群体,可能会削弱对其他群体的预测能力。

未分场景的数据集:针对不同应用场景构建评分卡时,需要为每个场景建立相对独立的子样本集。同时,也应保留一份未进行场景划分的整体数据集。这样做的目的在于便于评估分场景评分卡相较于不分场景评分卡所带来的性能提升程度。

数据异常情况:在数据收集过程

全部评论 (0)

还没有任何评论哟~