Advertisement

NLP 数据集整理(维护中)

阅读量:

本文汇总了近期所见的自然语言处理相关研究论文中采用的语料数据资源,并将持续进行更新。若各位读者还了解文中未提及的数据集,欢迎在评论区留言告知~只需提供数据集名称、对应文献及下载链接即可,一经收到信息将第一时间补充至本内容中.
以下为可供自然语言处理实验使用的各类免费英文语料数据库整理(每个语料资源的链接均在注释中对应的文章内,文中亦详细说明了使用方法)。

Semantic Similarity

WordSim3531数据集包含353组词语对,主要用于评估词语间的语义相似性排序。通常情况下,语义相似性通过计算两个词向量之间的余弦距离来衡量。

TOEFL2数据集由80道同义词选择题构成,每道题目提供四个选项,要求从中挑选出与目标词最为接近的同义词。例如,在levied一题中,四个选项分别为imposed(正确答案)、believed、requested和correlated。该数据集同样采用余弦距离作为衡量标准,以确定最相近的词语。

Semantic&Syntactic3数据集涵盖8869个语义相关问题和10675个句法相关问题,该数据集被应用于T.Mikolov提出的word2vec模型中。所涉及的问题形式通常为类比推理题,如“man与woman的关系类似于king与queen的关系”或“predict与predicting的关系类似于dance与dancin

全部评论 (0)

还没有任何评论哟~