BERT的概述
发布时间
阅读量:
阅读量
本文介绍了近期备受关注的[BERT]模型(https://arxiv.org/pdf/1810.04805.pdf),该模型已在11个不同的自然语言处理任务中展现了卓越的效果。然而,在介绍论文之前我想指出这项工作的复现难度较高。我认为未来最有潜力的应用方向将是直接利用作者提供的经过预训练的模型。
回顾
近年来,在完成下游自然语言处理任务的研究中,大量借助预训练的语言表征,并将这些方法归纳为两种类型:基于特征的和微调方法。
| 分类 | 代表 | task-specific模型 | 使用方案 |
|---|---|---|---|
| feature-based | ELMo | 需要 | 把表征作为feature提供给下游任务 |
| fine-tuning | OpenAI GPT,(前文介绍过的) ULMFiT | 不需要 | fine tune预训练的参数 |
这两类方法的共同特点是在预训练阶段采用了相同的优化目标函数,并且都采用了单向的语言模型架构。作者对这些方法提出了批评意见……尽管像ELMo这类算法通过整合正向与反向的语言建模机制而表现出更强的能力……但本质上它们仍然等同于两个单向语言模型的简单叠加。对于SQuAD这类基于阅读理解的任务来说……能够从正反两个方向有效提取context信息具有重要意义……然而目前存在的诸多不足使得现有方法仍显力有限
BERT, OpenAI
全部评论 (0)
还没有任何评论哟~
