multi-lingual sentence embedding
发布时间
阅读量:
阅读量
去年BERT最终推动了整个NLP领域的蓬勃发展。其核心目的在于借助预先训练完成的模型,迅速实现对新任务目标的适应(即迁移学习)。实际上,在NLP领域中,还存在大量需要借助迁移学习来解决的任务,尤其是涉及不同语言之间的转换与学习。
动机
跨语言学习的驱动力源于诸多小语种语言资源的稀缺性。对于主流语言而言,例如英语,由于研究者众多,相关自然语言处理任务的训练语料库也较为充足(如情感分析领域的SST、蕴含推理领域的NLI等)。然而,对于全球范围内的许多小语种而言,获取如此丰富的资源却显得极为奢侈。若能借助多语言联合训练的方式,构建出一种具备“超语言”特性的编码器,并利用其进行零样本迁移学习,则可有效缓解资源不足的问题。
以解决某小语种的语义相似性任务为例,在以往的研究中,通常需要先构建该语言的大规模语义相似性数据集(如英语中对应的STS-B数据集),随后基于该数据集训练出一个分类器。倘若存在100种小语种,则需重复这一过程100次。不仅重复性工作耗费大量资源,单是为某一特定小语种创建高质量的数据集本身便充满挑战。
Facebook AI Research提出的Massively Multilingual Sentence Embeddings for Zero-Shot Cross-Lingual Transfer and Beyond有效应对了上述问题。该方法成功训练出一个与具体语言无关的句子嵌入模型。借助这一模型,可以在诸如英语等主流语言上完成特定自然语言处理任务的训练(如前述的语义相似性任务),并在训练完成后直接应用于其他语言的相关任务中。
全部评论 (0)
还没有任何评论哟~
