Advertisement

面试总结:Bert

阅读量:

bert两个预训练任务

Task1:Masked Language Model

通过在训练过程中对输入语料中的部分单词进行随机遮蔽处理(即所谓的Masking),MLM(Masked Language Model)旨在通过预测这些被遮蔽单词的上下文来优化语言模型的学习效果。在BERT的相关实验研究中发现,在总Token数量中约有15%会被随机遮蔽处理。

每个句子会被多次输入到模型中用于参数训练。然而,在每次训练过程中,并不会每次都对这些单词进行遮蔽处理。相反地,则是会在确定哪些位置需要进行遮蔽处理之后:

  • 通常情况下(80%)会将这些位置替换成[MASK]标记;
  • 约10%的时间会替换成其他随机词汇;
  • 约10%的时间则保持原有词piece不变。
在这里插入图片描述

这么做的原因是:**如果句中某特定Token被百分之百mask化,在微调过程中模型将面临处理未见过Token的风险。加入随机Token的目的在于防止Transformer架构导致模型过分依赖单一Token的信息存储机制;否则会导致模型误以为该[mask]标记对

全部评论 (0)

还没有任何评论哟~