掌握RNN与LSTM的原理
发布时间
阅读量:
阅读量
总说
这篇主要是为了详细阐述RNN和LSTM的形式构造过程,帮助理解其核心机制。表达较为松散。
RNN
我们知道,在卷积神经网络中(CNN),一个输入会对应一个单一结果(output)。然而,在某些场景下(如自然语言处理),我们希望生成一系列输出,并且这些输出之间存在关联关系(correlated)。例如,在机器翻译任务中(Machine Translation),这正是所需的情形。因此,在处理这类关联性问题时(associative problems),特别是在序列数据处理中(sequence data processing),出现了一种称为循环神经网络(Recurrent Neural Network, RNN)的技术。进一步思考一下,则发现只要能够通过某种机制整合历史信息与当前输入的数据模式(data pattern),就可以有效地解决类似的问题(problems)。
不同于CNN的主要区别在于,RNN模型包含一个隐层状态h_t,这个状态需要综合考虑过去的所有输入x_1,x_2,...,x_{t-1}以及当前输入x_t的信息进行融合处理。由于RNN模型是一个迭代更新的过程,在第t步中,系统仅接收当前时刻的输入数据x_t。那么,在如何处理过去的历史信息方面存在特定需求吗?答案是肯定的:我们需要依赖于前一时刻的状态h_{t-1}来完成这
全部评论 (0)
还没有任何评论哟~
