Advertisement

详细研究XLNet中的注意力机制

阅读量:

BERT后时代,在20个任务上超越了BERT的XLNet引起了广泛关注。其最显著的改进在于并未在输入中添加[MASK]标记,并且仍然能够有效利用上下文信息,在解决BERT的预训练与微调不一致问题方面取得了显著成效。

1、XLNet如何实现在不加 [Mask] 情况下利用上下文信息呢?

XLNet 基于 Permutation Language Modeling (PLM) 对输入文本进行重新排列。这使得当前词及其周围的上下文有可能出现在重新排列后的上下文中。然而实际上,并非通过调整输入顺序来实现这一点,而是依赖于关键的 Attention Mask 机制来完成。

img

此图正是文中所介绍的注意力机制的核心内容。仅凭图片难以充分理解其内在逻辑。参考张俊林老师的论文《XLNet:运行机制及与BERT的异同比较》[1]文中存在一个极具重要意义的关键论述点:

在Transformer架构中,在处理输入序列T时,在第i个位置(Ti)开始的位置上进行操作。这种操作基于注意力掩码机制,在Ti的位置前后元素作为上下文信息,并从中随机选取i-1个元素作为关键信息点。其余未被选

全部评论 (0)

还没有任何评论哟~