Advertisement

Outlier detection用于提高对话系统的数据质量和多样性-学习笔记

阅读量:

Outlier Detection for Improved Data Quality and Diversity in Dialog Systems

  1. 论文采用以下步骤对数据集中的异常值进行检测:

  2. 对每个样本生成对应的向量形式。

  3. 通过计算所有向量的平均值得到整体的均值表示。

  4. 分别测量每个样本与该均值之间的距离差。

  5. 将这些距离按从小到大的顺序排列。

  6. (仅保留前k%的数据作为离群点,其余部分被删除。)

最终步骤以括号形式呈现,因为实际应用中通常采用动态阈值策略,使用户可根据需求灵活控制所保留数据的范围和数量。

  1. 文章介绍了一种全新的异常检测技术,该方法利用句子的连续性表达方式。通过融合神经距离嵌入机制与基于距离的离群点识别手段,能够有效识别短文本集合中的错误条目和独特条目。
  2. 若某样本与其他样本存在显著差异,则可能属于异常点。其成因可能有二:(1)该样本并非当前类别中的有效成员(即为错误样本),或(2)该样本在当前类别中较为特殊(即为唯一性样本)。
  3. 异常检测不仅有助于识别错误信息,还可应用于其他多个方面。即使数据集中不存在错误信息,某些异常点仍可能是最具价值、最具信息量的实例。在数据采集过程中引入这些实例作为指导,有助于生成更

全部评论 (0)

还没有任何评论哟~