Advertisement

Python中文分词工具

阅读量:

将mecab-chinesedic-binary文件下载后,放置于MeCab的bin目录中,具体操作方法可参考:详细内容请参见《用MeCab打造一套实用的中文分词系统》

在命令行界面执行以下指令:mecab -d mecab-chinesedic-binary wakati wiki.zh.text.jian -o wiki.zh.text.jian.seg -b 10000000

其中,wiki.zh.text.jian表示一个中文语料库,而wiki.zh.text.jian.seg则为完成分词处理后的文本结果。

2.应用中文分词工具jieBa

  1. #encoding=utf-8
  2. import jieba
  3. #全模式
  4. text = "我来到北京清华大学"
  5. seg_list = jieba.cut(text, cut_all=True)
  6. print u"[全模式]: ", "/ ".join(

全部评论 (0)

还没有任何评论哟~