Advertisement

论文《CPM: A Large-scale Generative Chinese Pre-trained Language Model》

阅读量:

1. Introduction

  1. GPT-3包含了175亿参数,并消耗了570GB的数据用于训练。其中大部分语料来源于英语(占93%),而GPT-3本身的参数并未分布化。因此引出了CPM(中国预训练语言模型):它拥有26亿参数,并采用了100GB中文数据集进行训练。
  2. CPM不仅支持多种下游任务如对话交互、文章创作以及文本填充等。
  3. 该模型在分词语料库基础上开发了一种新型的分词策略,并显著提升了批处理效率至每秒3千个批次。
  4. 该研究的主要贡献包括:
    • 发布了一个新型的大规模预训练语言模型
    • 开发了一种新型的分词策略以适应汉语语料库
    • 实现了批处理效率提升至每秒数千批次
    • 在小样本学习甚至无样本学习任务中展现出良好的性能

全部评论 (0)

还没有任何评论哟~