论文《CPM: A Large-scale Generative Chinese Pre-trained Language Model》
发布时间
阅读量:
阅读量
1. Introduction
- GPT-3包含了175亿参数,并消耗了570GB的数据用于训练。其中大部分语料来源于英语(占93%),而GPT-3本身的参数并未分布化。因此引出了CPM(中国预训练语言模型):它拥有26亿参数,并采用了100GB中文数据集进行训练。
- CPM不仅支持多种下游任务如对话交互、文章创作以及文本填充等。
- 该模型在分词语料库基础上开发了一种新型的分词策略,并显著提升了批处理效率至每秒3千个批次。
- 该研究的主要贡献包括:
- 发布了一个新型的大规模预训练语言模型
- 开发了一种新型的分词策略以适应汉语语料库
- 实现了批处理效率提升至每秒数千批次
- 在小样本学习甚至无样本学习任务中展现出良好的性能
全部评论 (0)
还没有任何评论哟~
