论文复现与改进针对该弱标注多标签矩阵恢复问题,采用改进后的MCWD方法帮助你的弱标注多标签数据取得好成绩.
发布时间
阅读量:
阅读量
改进后的MCWD算法,让你的弱标注多标签数据赢在起跑线上
-
前言
-
MCWD算法
-
- 算法展示
-
- 算法改进
- 实现代码
-
实验结果
-
总结
前言
最近看完李航老师的《统计学习与方法》,心痒难耐想要重新演示几个算法。正好碰上了云音乐的云村视频标签运维中存在标注不完全的问题,在这方面可被视为弱监督学习的数据。在此之前的数据处理主要采用多标签分类的方法,在线测试后各项性能指标有所提升。然而觉得直接使用神经网络模型对弱监督数据进行多标签分类略显不合适。
- 存在标签缺失的问题,神经网络的意识在于我竟可能相信你给我的数据都是准确的,某个样本有某个标签是准确的,没有某个标签也是准确的。这会导致对于一些有缺失的标签,尽管网络见过相似的特征,但拟合的标签组却大不相同,无法有效学习到标签与特征的关系。
- 当标签缺失情况较少,而样本数据量足够多时,神经网络确实能比较好的应付脏数据带来的错误信息,但是对于那些本来就很少被标注,而且缺失情况较多的标签,最后模型在推理时,该类标签的产出也会非常稀有,预测不准确。尽管我们在最后加入了先验:即有效标注越少的标签越有可能被遗漏,对每个标签结果都乘以其IDF来纠正,但效果不是非常明显。这就导致最后输出的样本标签区分度较低,作为特征效果较差。
- 比
全部评论 (0)
还没有任何评论哟~
