Advertisement

阅读《CPM-2:大型规模、低成本预训练语言模型》

阅读量:

大規模高性價比預訓練語言模型CPM-2

1 Introduction

  • 通过知识继承方式加快预训练进程,其核心目标是借助已有PLM所蕴含的知识,以辅助新模型的预训练阶段
    • 对Prompt-Tuning方法进行深入探究。该方法采用prompt(Lester et al.,2021)替代传统的fine-tuning策略,从而降低任务相关参数的存储需求。借助prompt机制,只需保留提示标记的嵌入信息,而提示标记所涉及的参数量通常不超过整体模型参数总量的0.01%
    • 开发了一种新型推理工具:INFMOE

基于成本效益导向的预训练流程,成功构建了两个模型:CPM-2与MoE版本

随着PLMs数量持续增长,其使用成本也随之上升,主要开销体现在以下三个方面:

  1. 需要消耗大量计算资源
  2. 存储需求显著增加
  3. 推理设备具有较高要求(Strict equipment requirement)

将整个预训练流程细分为三个阶段:中文预训练、双语预训练以及MoE预训练

在论文实验过程中观察到以下现象:

  1. prompt的具体位置对结果具有重要影响
  2. 将prompt tuning与fine-tuning相结合的方式能够取得更优效果

Prompt

在原有输入

全部评论 (0)

还没有任何评论哟~