Advertisement

PySpark统计频率并返回 TOP N结果

阅读量:

输入为文本格式的文件,其内容以纯文字形式存储,不包含任何格式或结构化信息。输出结果则为经过处理后的文本内容,具体形式取决于所执行的操作或转换规则。

复制代码
 [('技术', 48),

    
  ('百度', 45),
    
  ('模型', 38),
    
  ('语义', 31),
    
  ('分析', 30),
    
  ('情感', 25),
    
  ('NLP', 20),
    
  ('自然语言', 20),
    
  ('方法', 19),
    
  ('中', 18),
    
  ('用户', 17),
    
  ('观点', 16),
    
  ('计算', 16),
    
  ('主题', 16),
    
  ('数据', 15),
    
  ('理解', 13),
    
  ('词', 13),
    
  ('评论', 13),
    
  ('语言', 12),
    
  ('文本', 12)]
    
    
    
    

代码实现:

复制代码
 import jieba

    
  
    
 from pyspark.context import SparkContext
    
  
    
 sc = SparkContext("l

全部评论 (0)

还没有任何评论哟~