Advertisement

在 tensorflow.keras.datasets.imdb 中 load_data 函数被解析

阅读量:

初次涉足自然语言处理领域,我选择学习2017年的CS224n课程,因为其中的作业任务似乎需要借助tensorflow框架完成,而2019年更新后的课程则改用pytorch。在实践过程中,我以IMDB数据集作为起点,对数据进行了初步解析,发现其中包含评论内容以及对应的正负面评价标签。接下来需要对词向量进行词嵌入(Embedding)处理,由于网络结构采用的是循环神经网络RNN而非传统的ANN模型,因此不能使用稀疏向量(Sparse vector),而是需要将其转换为稠密向量(Dense vector)。

在数据预处理阶段,原始数据经过了一系列操作,这些操作实际上都被封装在了load_data函数之中。最终该函数返回了处理完成的train_data、train_labels、test_data和test_labels。通过查阅一些内置方法的具体实现内容,可以了解其背后的操作逻辑,并为我们在实际处理数据时提供一定的启发与参考。

复制代码
 def load_data(path='imdb.npz',

    
           num_words=None,
    
           skip_top=0,
    
           maxlen=None,
    
           seed=113,
    
           start_char=1,

全部评论 (0)

还没有任何评论哟~