Python数据挖掘算法
发布时间
阅读量:
阅读量
1、首先简述数据挖掘的过程
第一步:数据选择
数据来源可包括企业原始业务信息、已公开的数据库资源,亦可通过网络爬虫技术进行采集。
第二步: 数据预处理
由于原始数据中很可能存在噪声干扰或信息缺失等问题,因此需要对数据实施标准化处理。常用的方法包括最小-最大标准化、Z-score标准化以及改进型Z-score标准化。

第三步:特征值数据转换
通过提取数据特征,使这些信息能够满足特定数据挖掘算法的分析模型需求。在实际应用中,存在多种不同的数据模型,后续将进行详细说明。
第四步:模型训练
选取合适的挖掘算法对已处理的数据集进行训练过程。
第五步:测试模型+效果评估
当前存在两种主流方法:
十折交叉验证 :将整个数据集随机划分为十个相等的部分,每次使用其中九份作为训练集,剩余一份作为测试集,重复该过程共十次。十折交叉验证的核心在于确保数据被较为均衡地划分。
N折交叉验证也被称为留一法:几乎全部的数据用于训练过程,仅保留一个样本用于测试,并依次对每个样本执行相同操作。留一法的优势在于其结果具有较高的确定性。
第六步:模型使用
利用完成训练的模
全部评论 (0)
还没有任何评论哟~
