Python中文分词工具
发布时间
阅读量:
阅读量
将mecab-chinesedic-binary文件下载后,放置于MeCab的bin目录中,具体操作方法可参考:详细内容请参见《用MeCab打造一套实用的中文分词系统》
在命令行界面执行以下指令:mecab -d mecab-chinesedic-binary wakati wiki.zh.text.jian -o wiki.zh.text.jian.seg -b 10000000
其中,wiki.zh.text.jian表示一个中文语料库,而wiki.zh.text.jian.seg则为完成分词处理后的文本结果。
2.应用中文分词工具jieBa
- #encoding=utf-8
- import jieba
- #全模式
- text = "我来到北京清华大学"
- seg_list = jieba.cut(text, cut_all=True)
- print u"[全模式]: ", "/ ".join(
全部评论 (0)
还没有任何评论哟~
