PySpark统计频率并返回 TOP N结果
发布时间
阅读量:
阅读量
输入为文本格式的文件,其内容以纯文字形式存储,不包含任何格式或结构化信息。输出结果则为经过处理后的文本内容,具体形式取决于所执行的操作或转换规则。
[('技术', 48),
('百度', 45),
('模型', 38),
('语义', 31),
('分析', 30),
('情感', 25),
('NLP', 20),
('自然语言', 20),
('方法', 19),
('中', 18),
('用户', 17),
('观点', 16),
('计算', 16),
('主题', 16),
('数据', 15),
('理解', 13),
('词', 13),
('评论', 13),
('语言', 12),
('文本', 12)]
代码实现:
import jieba
from pyspark.context import SparkContext
sc = SparkContext("l
全部评论 (0)
还没有任何评论哟~
