Outlier detection用于提高对话系统的数据质量和多样性-学习笔记
发布时间
阅读量:
阅读量
Outlier Detection for Improved Data Quality and Diversity in Dialog Systems
-
论文采用以下步骤对数据集中的异常值进行检测:
-
对每个样本生成对应的向量形式。
-
通过计算所有向量的平均值得到整体的均值表示。
-
分别测量每个样本与该均值之间的距离差。
-
将这些距离按从小到大的顺序排列。
-
(仅保留前k%的数据作为离群点,其余部分被删除。)
最终步骤以括号形式呈现,因为实际应用中通常采用动态阈值策略,使用户可根据需求灵活控制所保留数据的范围和数量。
- 文章介绍了一种全新的异常检测技术,该方法利用句子的连续性表达方式。通过融合神经距离嵌入机制与基于距离的离群点识别手段,能够有效识别短文本集合中的错误条目和独特条目。
- 若某样本与其他样本存在显著差异,则可能属于异常点。其成因可能有二:(1)该样本并非当前类别中的有效成员(即为错误样本),或(2)该样本在当前类别中较为特殊(即为唯一性样本)。
- 异常检测不仅有助于识别错误信息,还可应用于其他多个方面。即使数据集中不存在错误信息,某些异常点仍可能是最具价值、最具信息量的实例。在数据采集过程中引入这些实例作为指导,有助于生成更
全部评论 (0)
还没有任何评论哟~
