FastText算法
发布时间
阅读量:
阅读量
-
介绍
-
字符级别的n-gram
-
模型架构
-
分层softmax分类
- 例子
-
Hashing Tricks
-
结论和思考
-
参考
介绍
FastText是由Facebook于2016年开源的一项词向量计算与文本分类工具,在学术领域并无重大的创新。然而它具有一些明显的优点,在文本分类任务中
Fasttext主要包含两个核心功能:一个是训练词向量 ,另一个是文本分类 。相较于word2vec而言, Fasttext在词向量训练中加入了subwords特性。
fastText的基本思路是:将整份文档中的单词以及n-gram向量通过累加的方式获得整个文档的向量表示,并随后利用这个向量来进行多分类任务。在这一过程中涉及两个关键的技术要点:一是引入了基于字符级别的n-gram特征,并二是采用了分层结构化的Softmax分类方法。
字符级别的n-gram
大多数现有方案普遍采用单一表征机制,并且参数之间缺乏交互,在此过程中未能反映语义层次结构。这对于处理多形态语言的任务而言存在明显局限性。
word2vec将语料库中的每个单词视为原子,并通过向量化的方式对每个单词进行编码。这种做法忽视了词素间的细微差异,在传统的word2vec模型中无法捕捉到这些形态上的相似性。由于传统的word2ve
全部评论 (0)
还没有任何评论哟~
