Advertisement

XLNet: 通用自回归预训练模型

阅读量:

XLNet:通用自回归预训练方法

    • AR和AE
      • XLNet的比较优势

      • Transformer-XL

        • Transformer的特点和缺陷
        • 语言模型里的Transformer
        • XL是什么
        • 相对位置编码
      • XLNet的目标函数:排列语言模型(Permutation Language Modeling)

      • 双流自注意力(Two-Stream Self Attention)

      • 实验

BERT(前文有 介绍)火了以后 XLNet算是首个真正意义上能和其叫板的工作了。在20个任务上都超过BERT,其中很多还是大幅的超越。

AR和AE

作者首先对当前NLP领域中广泛采用的预训练技术进行了归类,将其划分为自回归语言模型(AR)与自编码模型(AE)两大类别。由此,诸如ULMFit、ELMo、GPT以及GPT2等依赖传统语言模型进行预训练的方法被统一归入AR类别。而BERT则通过其创新性的MLM(Masked LM)机制,采用带有噪声的输入形式(即使用[MASK]标记替换部分token),以恢复原本的token序列,从本质上看,这属于去噪自编码器的范畴,因此B

全部评论 (0)

还没有任何评论哟~