Advertisement

结巴分词思路解析及Python代码实战

阅读量:

本研究所涉及的程序均基于jupyter Notebook平台进行执行,且已配置完成jieba库的安装工作

结巴常用函数解析

结巴常用函数 作用
jieba.lcut(text) 对text文件内容进行分词,返回的是分词后的词语列表
jieba.load_userdic(txt_file) 为防止某些目标词汇分割,需要载入紫东义词典,告诉程序说,这几个字是一个词语,不要分割

jieba.lcut(text)代码实战

在实际操作过程中,由于通过jupyter Notebook执行代码时,部分代码片段可能存在复制不完整的情况,从而导致无法完整运行的问题,因此推荐用户使用jupyter Notebook进行代码的执行。若选择其他类型的编译环境,则需注意对相关代码进行必要的调整,例如涉及导入模块或变量定义的部分。

复制代码
    import jieba
    text = '我来到北京清华大学'
    wordlist=jieba.lcut(text) # wordlist默认是列表形式
    print(wordlist)
    
    
      
      
      
      
    

![在这里插入图片描述](https://ad.itadn.com/c/weblog/blog-img/i

全部评论 (0)

还没有任何评论哟~