XLNet: 通用自回归预训练模型
发布时间
阅读量:
阅读量
XLNet:通用自回归预训练方法
-
- AR和AE
-
XLNet的比较优势
-
Transformer-XL
-
- Transformer的特点和缺陷
- 语言模型里的Transformer
- XL是什么
- 相对位置编码
-
XLNet的目标函数:排列语言模型(Permutation Language Modeling)
-
双流自注意力(Two-Stream Self Attention)
-
实验
-
- AR和AE
BERT(前文有 介绍)火了以后 XLNet算是首个真正意义上能和其叫板的工作了。在20个任务上都超过BERT,其中很多还是大幅的超越。
AR和AE
作者首先对当前NLP领域中广泛采用的预训练技术进行了归类,将其划分为自回归语言模型(AR)与自编码模型(AE)两大类别。由此,诸如ULMFit、ELMo、GPT以及GPT2等依赖传统语言模型进行预训练的方法被统一归入AR类别。而BERT则通过其创新性的MLM(Masked LM)机制,采用带有噪声的输入形式(即使用[MASK]标记替换部分token),以恢复原本的token序列,从本质上看,这属于去噪自编码器的范畴,因此B
全部评论 (0)
还没有任何评论哟~
