结巴分词思路解析及Python代码实战
发布时间
阅读量:
阅读量
本研究所涉及的程序均基于jupyter Notebook平台进行执行,且已配置完成jieba库的安装工作
结巴常用函数解析
| 结巴常用函数 | 作用 |
|---|---|
| jieba.lcut(text) | 对text文件内容进行分词,返回的是分词后的词语列表 |
| jieba.load_userdic(txt_file) | 为防止某些目标词汇分割,需要载入紫东义词典,告诉程序说,这几个字是一个词语,不要分割 |
jieba.lcut(text)代码实战
在实际操作过程中,由于通过jupyter Notebook执行代码时,部分代码片段可能存在复制不完整的情况,从而导致无法完整运行的问题,因此推荐用户使用jupyter Notebook进行代码的执行。若选择其他类型的编译环境,则需注意对相关代码进行必要的调整,例如涉及导入模块或变量定义的部分。
import jieba
text = '我来到北京清华大学'
wordlist=jieba.lcut(text) # wordlist默认是列表形式
print(wordlist)

还没有任何评论哟~
