spark环境中的中文文档词频统计系统(去停用词)
发布时间
阅读量:
阅读量
Linux系统下spark终端运行中文文档词频统计的python程序。
1.环境配置与系统搭建
*前提
(1)鉴于Spark需在Hadoop平台基础上运行,因此首要任务是完成Hadoop的环境搭建。
(2)在Hadoop环境搭建完成后,接下来应进行Spark环境的配置工作。
这里采用的编程语言为python,完成以上两个步骤后,我们开始配置编程环境。
(1)于Windows操作系统中获取python-3.7.3版本(如遇操作困难,可参考网络上的相关教程),完成下载后进行解压处理,并将解压得到的Python安装包复制至Spark文件夹内部;
(2)在Windows系统中下载jieba(一个用于中文分词的Python库,若操作不熟悉,可通过网络教程学习),完成解压后同样将jieba库的安装包转移至Spark文件夹内。随后进入Spark终端,定位到jieba包中setup.py文件所在的路径,并执行以下命令:python setup.py install
例如

全部评论 (0)
还没有任何评论哟~
