机器学习学习笔记(二)第2章 模型评估(Python版本)
发布时间
阅读量:
阅读量
西瓜书第二章的笔记内容主要围绕着评估学习算法的多种途径展开,与传统算法中通过时间复杂度和空间复杂度进行衡量的方式相比,机器学习算法的评估过程更加复杂。
一、基本概念
错误率(error rate) - 指在分类任务中,被错误分类的样本数量占总样本数的比例。假设共有m个样本,其中有a个被误判,则错误率E=a/m,而精度(accuracy)则为1-a/m。
误差(error) - 描述的是学习算法在预测输出与实际输出之间的偏差。在训练集上产生的误差被称为“训练误差(training error) ”或“经验误差(empirical error) ”;而在新样本上出现的误差则称为“泛化误差(generalization error)”。
过拟合(overfitting) - 当学习器将训练样本中的特定特征误认为是所有潜在样本所共有的普遍属性时,就会发生过拟合现象,这会显著削弱模型的泛化能力。与此相对的是“欠拟合(underfitting) ”。
测试集(testing set) - 用于评估学习器泛化性能的一组数据样本。
验证集(validation set) - 在模型选择与调参过程中使用的数据集合,主要用于对模型进行评估和优化。
二、评估方法
留出法(hold-out)- 将整个数据集D划分为两个互不重叠
全部评论 (0)
还没有任何评论哟~
