Advertisement

机器学习工程实例垃圾邮件过滤系统数据预处理训练模型交叉验证精准率召回率计算步骤详细解析

阅读量:

本博客所呈现的所有内容均源自《Hands-On Machine Learning with Scikit-Learn & TensorFlow》一书及其配套的GitHub源代码。

在阅读《Hands-On》一书至第三章时,发现习题中的最后两道题目为实践性较强的编程练习,本人尝试进行操作后取得了一定成效,因此决定将过程记录下来。

运行环境:Jupyter Notebook 语言:Python3.6.4


0**、题目描述**

整体目标是构建一个用于识别垃圾邮件的过滤系统。

主要步骤包括:

  • http://spamassassin.apache.org/old/publiccorpus/网址获取开源数据集,其中包含垃圾邮件与正常邮件
  • 对数据集进行解压处理,并对其进行观察以了解其结构和格式
  • 将数据集划分为训练集与测试集两部分
  • 构建一个适用于该数据集的数据预处理流程,将每封电子邮件转换为特征向量的形式
  • 引入超参数配置
  • 使用多种机器学习分类算法进行训练,并计算其精确率与召回率指标

1**、数据获取**

按照题目的要求,首先需要完成数据集的下载工作。虽然这一步可以通过直接访问网址手动完成

全部评论 (0)

还没有任何评论哟~