机器学习基础专题:样本选择的核心知识点
发布时间
阅读量:
阅读量
样本选择
选取最小规模的训练集合S\sub完整训练集T,不会对模型性能产生负面影响。
优势:
- 缩短模型运算所需时间
- 与问题关联度较低的数据无法提供有效信息,应予以排除
- 消除干扰性信息
数据去噪
噪声数据
- 特征值存在异常(如数据缺失或数值超出合理范围),可能在一定程度上增强模型的鲁棒性
- 标注信息出现偏差,将对数据的整体质量产生负面影响。
处理方法
融合或投票机制为基础的策略
- 集成过滤方法Ensemble Filter
- 基于交叉验证的委员会过滤技术Cross-Validated Committees Filter
- 迭代划分过滤方式Iterative-Partitioning Filter
依据实际业务需求开展的处理措施
- 对爬取的数据进行净化处理
- 去除无意义的展示记录
- 排除用户最后一次点击之后的展示内容(可能存在未被用户注意到的情况)
采样
优点
- 解决因高维特征与海量数据所带来的挑战,有效压缩处理时长
- 在面对样本分布不均的分类任务时,有助于调节各类样本的数量比例
计算样本大小
P(|e-e_0|\geq\epsilon) \leq \delta
其中,e表示对样
全部评论 (0)
还没有任何评论哟~
