Advertisement

Python基础 中文文本

阅读量:

中文文本分析工具库概述

jiaba中文分词库应用

jieba库核心函数解析

函数 描述
jiba.cut(s) 精确模式,返回一个可迭代数据类型
jieba.cut(s,cut_all=True) 全模式,输出文本s中所有可能单词
jiba.cut_for_search(s) 搜索引擎模式,适合搜索引擎建立索引的分词结果
jiaba.lcut(s) 精确模式,返回一个列表类型
jieba.lcut(s,cut_all=True) 全模式,返回一个列表类型
jieba.lcut_for_search(s) 搜索引擎模式,返回一个列表类型
jiaba.lcut_for_search(s) 搜索引擎模式,返回一个列表类型
jiaba.add_word(w) 向分词词典中增加新词w

精准切分模式

复制代码
    >>>import jieba
    >>>s='我爱北京天安门'
    >>>for x in jieba.cut(s):   #jieba.cut()返回一个可迭代类型
    	print(x,end=' ')
    我 爱 北京 天安门 
    >>> jieba.lcut(s)
    ['我', '爱', '北京', '天安门']
    
    

全部评论 (0)

还没有任何评论哟~