Advertisement

构建一个基于层次化注意力机制的神经网络模型

阅读量:

最近我意外地获得了连续的完整空闲时间。借此机会,我尝试实现了一些具有启发性的论文中的创意,其中给我留下最深刻印象的是《Hierarchical Attention Networks for Document Classification》。相关代码我已经整理并放置在此:
https://github.com/triplemeng/hierarchical-attention-model

综述

当前,在自然语言处理领域中,若希望在各类应用中获得最先进的成果,通常都离不开注意力机制的支持。例如机器翻译、问答系统以及自然语言推理等任务,均广泛采用该技术。然而,这里存在一个值得探讨的问题:传统的注意力模型往往要求任务本身具备明确的源与目标的概念。比如在机器翻译中,源语言与目标语言是明确区分的;在问答系统中,则存在问题与答案之间的对应关系;而在自然语言推理任务中,则涉及句子对之间的逻辑关联。注意力机制在此类任务中通常被定义为源与目标之间的相关性。

但并非所有任务都具备这种源和目标的二元结构。例如文档分类任务仅涉及原始文本内容,并不包含任何目标语或特定对象;再如情感分析(可视为最基础形式的文档分类),同样只依赖于输入文本本身。那么,在这种情况下如何应用注意力机制呢?这就需要引入一种新的技术变体——内部注意力(亦称自注意力),其核心思想在于关注文本自身内部的信息关联。

全部评论 (0)

还没有任何评论哟~