Advertisement

Python对瓦尔登湖进行高频词分析

阅读量:

在文本处理过程中,在分析单词出现频率时会遇到这一问题。为了具体说明这一点,在这里我们选择英文小说《瓦尔登湖》作为案例研究,并探讨作者常用哪些词汇及其各自的出现频率情况。

首先必须下载《瓦尔登湖》的内容:点击获取《瓦尔登湖》


思路分析:

  1. 第一步:打开文档并将其内容存储为字符串变量。
  2. 接下来:对这个字符串执行分词处理。
  3. 最后一步:计算每个单词在文本中的出现次数,并记录下来。

把下载好的“Walden.txt”放到桌面,复制一下完整的路径名,特别注意:

通常在Windows系统中,默认情况下文件名路径中的子级与父级通过反斜杠‘ \ ’分隔。相比之下,在Python编程语言中,则是以正斜杠‘ / ’作为文件名路径中的分隔符。

文件打开的时候,如果出现以下错误:

复制代码
    UnicodeDecodeError: 'gbk' codec can't decode byte 0xbf in position 2: illegal multibyte sequence
    
    AI写代码python
    
    运行

请指出文件编码出现偏差的问题,并建议将编码参数设置为utf-8格式。特别提醒,在使用open函

全部评论 (0)

还没有任何评论哟~