Advertisement

支持Tokenizer类的处理

阅读量:

在keras.preprocing包中包含了text以及与序列相关的功能。

1. text模块提供的方法

  • text_to_word_sequence(text,fileter) 可被视为此函数功能类str.split 的一个实现方式 *
复制代码
 import jieba

    
 import keras.preprocessing.text as T
    
 from keras.preprocessing.text import Tokenizer
    
  
    
 text1='这里的风景真漂亮'
    
 text2='这件衣服很好看,我很喜欢,你觉得呢?'
    
  
    
 text1=' '.join(jieba.cut(text1))
    
 text2=' '.join(jieba.cut(text2))
    
 texts=[text1,text2]
    
  
    
 T.text_to_word_sequence(text1)
    
 T.text_to_word_sequence(text2)
    
  
    
 T.one_hot(text1,20)#(20表示数字化向量为20以内的数字)
    
 T.one_hot(text2,20)

输出结果:

复制代码
 t

全部评论 (0)

还没有任何评论哟~