常见机器学习概念
发布时间
阅读量:
阅读量
信息熵
信息熵作为信息论中的基础性概念,用于表征信息源中各个可能事件出现的不确定性程度。20世纪40年代,香农(C.E.Shannon)在热力学相关理论的基础上,提出将去除冗余后信息的平均含量定义为“信息熵”,并将其视为信息期望值的数学表达形式,同时推导出了计算信息熵的具体公式。[1]该理论的建立有效解决了对信息进行量化评估的问题。
公式:

其中:𝑝(𝑥𝑖)表示随机事件𝑥𝑖发生的概率。
信息量
某一特定事件所携带的信息量应当随着其出现概率的增加而减少,并且该数值不能为负数。
若存在两个相互独立的事件x与y,那么在同时观测到这两个事件发生时所获取的信息量,应当等于单独观测到每个事件发生时所获取信息量的总和,即:
h(x,y) = h(x) + h(y)
由于x与y为两个相互独立的事件,因此满足p(x,y) = p(x) * p(y)。
结合上述推导过程,可以明显发现h(x)必然与p(x)的对数存在某种关联(因为唯有对数函数具备将乘法运算转化为加法运算的特性)。由此可得信息量的具体表达式如下:
