阅读《CPM-2:大型规模、低成本预训练语言模型》
发布时间
阅读量:
阅读量
大規模高性價比預訓練語言模型CPM-2
1 Introduction
- 通过知识继承方式加快预训练进程,其核心目标是借助已有PLM所蕴含的知识,以辅助新模型的预训练阶段
- 对Prompt-Tuning方法进行深入探究。该方法采用prompt(Lester et al.,2021)替代传统的fine-tuning策略,从而降低任务相关参数的存储需求。借助prompt机制,只需保留提示标记的嵌入信息,而提示标记所涉及的参数量通常不超过整体模型参数总量的0.01%
- 开发了一种新型推理工具:INFMOE
基于成本效益导向的预训练流程,成功构建了两个模型:CPM-2与MoE版本
随着PLMs数量持续增长,其使用成本也随之上升,主要开销体现在以下三个方面:
- 需要消耗大量计算资源
- 存储需求显著增加
- 推理设备具有较高要求(Strict equipment requirement)
将整个预训练流程细分为三个阶段:中文预训练、双语预训练以及MoE预训练
在论文实验过程中观察到以下现象:
- prompt的具体位置对结果具有重要影响
- 将prompt tuning与fine-tuning相结合的方式能够取得更优效果
Prompt
在原有输入
全部评论 (0)
还没有任何评论哟~
