Web文本数据清洗流程
发布时间
阅读量:
阅读量
目前约80%的数据呈现非结构化特征。在数据分析流程中,文本预处理被视为不可或缺的关键步骤。现有大量原始文本数据呈现出高度无组织性和噪声特性。
已知情况表明,社交媒体数据呈现出高度非结构化的特点,并由于其具有非正式的交流特点,在实际应用中会伴随多种常见问题如拼写错误、语法不正确的情况也存在。这些现象包括但不限于俚语的使用频率较高以及包含诸如URL等多余信息的情况较为普遍,并且常见的停用词和表达式也会对数据的质量产生影响
一个典型的商业案例是:假如你想深入了解的话,其主要特点在于iPhone在粉丝中的受欢迎程度远超其他竞争对手的核心优势。
下面对这条推特做文本预处理:
1、去掉HTML 字符 :
从Web获取的数据通常包含许多常见的HTML实体, 如lt;、gt;、amp;等, 它们嵌入到原始数据中. 因此, 必要地消除这些实体. 一种方法是通过特定的方法去除它们. 另一种方法则是利用适当的Python库(如W3C推荐的功能强大的模块)将这些 entity 解析并生成标准标记. 例如, 使用该工具能够将诸如amp;等符号正确地转化为相应的字符.

2、解码数据:
全部评论 (0)
还没有任何评论哟~
