Advertisement

MASS: 统一GPT和BERT的Seq到Seq框架

阅读量:

MASS: 一统GPT和BERT的Seq to Seq框架

    • MASS的功能
      • GPT和BERT

        • 比较
        • 痛点
      • MASS模型

        • 模型解释
        • 思想根源
      • 实验

      • 结语

MASS功能解析

MASS的完整名称为Masked Sequence to Sequence Pre-training for Language Generation,这一名称本身已暗示了其与GPT以及BERT(前文已有说明)之间的联系:"Masked"对应的是BERT所采用的"Masked LM"机制,而"Language Generation"则指向GPT所依赖的语言建模技术。
"Sequence to Sequence"则进一步明确了该模型的核心主题:其本质上属于一个序列到序列的框架。

构建这样一个Seq2Seq框架,实际上是对GPT和BERT在处理序列到序列语言生成任务时所面临问题的一种针对性改进:在该类任务中,这两类模型通常需要分别训练编码器与解码器,这使得在Seq2Seq任务中表现最优的编码器-注意力-解码器结构无法实现联合训练。因此,在涉及此类任务时,GPT和BE

全部评论 (0)

还没有任何评论哟~