详解熵-交叉熵-KL散度-互信息
发布时间
阅读量:
阅读量
首先介绍几个信息论中的概念。
熵, 表示某个概率分布的不确定度:
H(x) = - \sum p(x) log p(x)
联合熵,两个变量联合分布的不确定度:
H(x,y) = \sum \sum p(x,y) log p(x,y)
条件熵,在X确定后,Y的不确定度:
H(Y|X) = \sum p(x_i) H(Y|X=x_i) = \sum \sum p(x,y) log (p(x,y)/p(x))
KL散度也被定义为相对熵,在信息论中用来表征两个概率分布之间的差异程度。
具体而言,在使用非真实分布 q(x) 时所获得的平均编码长度与基于真实分布 p(x) 的平均编码长度之间的差异即为 KL 散度。
特别地,在机器学习领域中由于训练数据集是固定的因此当假设函数中的 H§ 被视为常数时最小化 KL 散度 DKL(p||q) 就等价于最小化交叉熵 H(p,q),同时这也等价于最大化似然估计。
在机器学习领域中, 我们力求使模型学得的数据分布P(model)与真实世界的数据分布P(real)之间的差距尽可能小. 为此, 我们需要最小化两者之间的KL散度. 然而由于缺乏真实世界标注信息, 因此我们的策略就是尽可能使模型学得与训练集保持高度一致. 基于独立同分布采样的理论基础, 具体而言, 如果我们能够确保训练集
全部评论 (0)
还没有任何评论哟~
