模型评估指标(一)
发布时间
阅读量:
阅读量
模型的构建依托于历史数据,而模型的应用则面向未来数据
- 模型在训练集上所表现出的误差,即实际结果与预测结果之间的偏差,被定义为训练误差或经验误差
- 模型在验证集以及测试集上所产生的误差则被称作泛化误差。
正负样本选择策略
- 在二分类任务中存在正类与负类样本的区分,而在多分类任务中则无需进行此类定义
- 正类与负类样本的界定并无统一标准,但一旦完成定义,后续评估指标的计算方式将产生相应变化
#通常情况下,少数类别样本会被设定为正类样本
当少数类别被划归为正类时,即以违约样本(不良样本)作为正类具有以下优势:
1> 有助于缓解数据分布不均衡所带来的影响
2> 更加聚焦于对不良样本的识别能力,这与实际业务需求更为契合。
若将多数类别设定为正类,即以未发生违约的样本(优质样本)作为正类则具备如下优点:
1> 表达方式更为直观,优质样本作为正类、不良样本作为负类更符合常规认知
2> 更加侧重于对坏账率及通过率的关注程度。
理想的评分卡模型应致力于提升通过率的同时降低坏账率。
混淆矩阵

还没有任何评论哟~
