Advertisement

机器学习基础专题:样本选择的核心知识点

阅读量:

样本选择

选取最小规模的训练集合S\sub完整训练集T,不会对模型性能产生负面影响。

优势:

  • 缩短模型运算所需时间
  • 与问题关联度较低的数据无法提供有效信息,应予以排除
  • 消除干扰性信息

数据去噪

噪声数据

  1. 特征值存在异常(如数据缺失或数值超出合理范围),可能在一定程度上增强模型的鲁棒性
  2. 标注信息出现偏差,将对数据的整体质量产生负面影响。

处理方法

融合或投票机制为基础的策略

  1. 集成过滤方法Ensemble Filter
  2. 基于交叉验证的委员会过滤技术Cross-Validated Committees Filter
  3. 迭代划分过滤方式Iterative-Partitioning Filter

依据实际业务需求开展的处理措施

  1. 对爬取的数据进行净化处理
  2. 去除无意义的展示记录
  3. 排除用户最后一次点击之后的展示内容(可能存在未被用户注意到的情况)

采样

优点

  • 解决因高维特征与海量数据所带来的挑战,有效压缩处理时长
  • 在面对样本分布不均的分类任务时,有助于调节各类样本的数量比例

计算样本大小

P(|e-e_0|\geq\epsilon) \leq \delta

其中,e表示对样

全部评论 (0)

还没有任何评论哟~