Advertisement

数理知识

阅读量:

文章目录

  • 引言

  • 一、 数理统计与概率论

    • 1 随机变量(random variable)
    • 2 概率分布(probability distribution)
    • 3 边缘概率分布(marginal probability distribution)
    • 4 条件概率
    • 5 期望、方差与协方差
      • 5.1 期望(expectation)
      • 5.2 方差(variance)
      • 5.3 协方差(covariance)
      • 5.4 相关系数
  • 6 常见的概率分布

    • 6.1 离散变量的概率分布或范畴分布(categorical distribution)
    • 6.2 连续变量的概率分布
    • 6.3 混合类的概率模型
  • 第二章 信息论基础

  • 第二节 信息论的核心衡量标准

    • 第一节 自信息量(self-information量)
    • 第二节 香农熵量(Shannon entropy quantity)
    • 第三节 Kullback-Leibler散度量(Kullback-Leibler divergence quantity) / 相对熵量(relative entropy quantity)
    • 第四节 cross-entropy量(cross-entropy quantity)

引言

博主近期整理了多年的学术笔记本,并希望通过博客等平台进行记录。为了避免纸质媒介遗失这些珍贵的学习资源(即通过POST方式),同时也方便自己日后回顾这些知识。考虑到各类笔记内容繁杂(涉及模糊系统、模式识别、条件随机场等多个研究领域),难免个别地方较为浅显或存在混乱之处。但对于初学者来说已经足够掌握基础。


一、 数理统计与概率论

1 随机变量(random variable)

随机变量 x 被被称为能够从值域 X 中取到一个变量。它既可以表现为离散型也可以表现为连续型。

  • 随机变量是对可能状态的一种表征, 它通常伴随着一个概率分布来详细描述各状态的可能性;
  • 在动态贝叶斯网络或贝叶斯分类器中, 这种随机变量的概率分布构成了一项特别关键的知识;
  • 然而, 在基于样本数据的机器学习模型中, 数据分布却被有意地未予考虑, 比如深度学习领域我们往往不太关注某种特征的具体概率分布情况。

2 概率分布(probability distribution)

概率分布用于表征随机性在各种可能的状态下出现的概率大小。就其离散性和连续性而言,离散型和连续型随机变量分别采用不同的表示方法。

  • 对于离散型随机变量X来说,在其中的概率分布被命名为概率质量函数(Probability Mass Function, PMF),通常用P(X)来表示。
    • 对于连续型随机变量X及其所对应的概率分布来说,在这里我们将其称为概率密度函数(Probability Density Function, PDF),通常用p(X)来表示。

以下以离散随机变量的PMF为例,介绍几个其它概念:

对于某个随机变量,我们记 x \sim P(x)表示前者服从后者的分布。

P(x=x_1)代表当x=x_1时的概率。值得注意的是,在统计学中,P(x=x_1, y=y_1) 被被称为 联合概率分布(joint probability distribution),它表示x=x_1y=y_1同时发生的发生可能性。即当随机变量连续时被称为 联合概率密度

除此之外,在离散型随机变量 x 的所有可能取值中共有 k 个不同的状态,并且这些状态下对应的概率完全相同的情况下,则我们将其称为 uniform probability distribution(均匀概率分布),具体满足条件为:对于每个可能的状态 x_i(其中i=1,2,\dots,k),都有 P(x=x_i) = \frac{1}{k}

对于满足 \sum_{x \in X}P(x) = 1 的随机变量X ,我们称其为可归一化的(normalized),即该随机变量必须遵循的一条基本性质。类似地,在连续型随机变量的情况下,则具有\int p(x)dx=1 的性质。

3 边缘概率分布(marginal probability distribution)

一组变量

一组变量

一组变量

举个例子来说吧,在集合X和Y中任意取值\wideparen{x},\wideparen{y}的情况下, 假设我们都知道联合概率P(x = \wideparen{x}, y = \wideparen{y})的存在, 则由此可得边缘概率:对于任意的\wideparen{x} ∈ X, 都有P(x = \wideparen{x}) = ∑_{\wideparen{y}} P(x = \wideparen{x}, y = \ wideparen{y} ) ;特别地, 在连续型随机变量的情况下, 则变为p(\ widebreath{x}) )=∫ p(\\ widebreath)x, \\ widebreath)y) dy

例题:袋内装有两只白球和三只黑球,在有放回的情况下进行两次独立抽取。求随机变量(X,Y)的概率分布及其边缘分布情况。其中随机变量X定义为:当第一次取出黑球时取值为1,在其他情况下取值为0;随机变量Y定义为:当第二次取出黑球时取值为1,在其他情况下取值为0。

解:其联合概率分布为:
\begin{aligned} P(X=0,Y=0)&=\frac{C_2^1C_2^1}{C_5^1C_5^1}=\frac{4}{25}\\ P(X=0,Y=1)&=\frac{C_2^1C_3^1}{C_5^1C_5^1}=\frac{6}{25}\\ P(X=1,Y=0)&=\frac{C_3^1C_2^1}{C_5^1C_5^1}=\frac{6}{25}\\ P(X=1,Y=1)&=\frac{C_3^1C_3^1}{C_5^1C_5^1}=\frac{9}{25} \end{aligned}则其边缘概率分布为:
\begin{aligned} P(X=0)&=P(X=0,Y=0)+P(X=0,Y=1)=\frac{10}{25}\\ P(X=1)&=P(X=1,Y=0)+P(X=1,Y=1)=\frac{15}{25}\\ P(Y=0)&=P(X=0,Y=0)+P(X=1,Y=0)=\frac{10}{25}\\ P(Y=1)&=P(X=0,Y=1)+P(X=1,Y=1)=\frac{15}{25} \end{aligned}

4 条件概率

条件概率的核心理论比较抽象难懂。
深入学习此处:[数理知识]贝叶斯公式和最大似然估计笔记

返回目录

5 期望、方差与协方差

5.1 期望(expectation)

The expected value is the average of the mapping f from x to ˆx when the input space follows a probability distribution. As in, for instance, when f is applied to each element x in the input space X, which is governed by a probability distribution P or p, the expected value of f(X) can be computed as either a sum over all possible x weighted by P(x), or as an integral over all possible x weighted by p(x).

  • 基于分布的可归一性特性,则对于任意常数 c 来说,满足 \mathbb{E}[cf(x)] = c\,\mathbb{E}[f(x)] 以及 \mathbb{E}[c] = c 的性质得以成立。这一性质在计算方差与协方差时发挥着重要作用。

Tip:f(x) 对于 x 分布情况下的期望常被简记为 \mathbb E_X[f(x)]\mathbb E[f(x)]\mu_x

  • 显然,期望是线性的,这就意味着:\mathbb E_X[\alpha f(x)+\beta g(x)]=\alpha \mathbb E_X[f(x)]+\beta\mathbb E_X[g(x)]成立。
  • x,y 相互独立时,下面这个式子也是成立的:\mathbb E_{X,Y}[f(x)·g(y)]= \mathbb E_X[f(x)] ~ ·\mathbb E_Y[g(y)]
  • 线性关系 :当z=\alpha x + \beta y +\cdots,则称变量 x,y,z,\cdots 成线性关系。

请注意:数学期望 \mathbb E 概念上并不等于算术平均值 \frac{1}{n}\sum_{i=1}^{n} x_i;仅当所有 x_i 均匀分布时两者才会相等。

5.2 方差(variance)

方差被视为一种衡量指标,在统计学中用于反映一组数据与其均值之间的偏离程度。具体而言,在我们从随机变量x按照其概率分布抽取样本时,这些数据点与其均值之间的差异程度有多大,则由方差这一指标来衡量。其计算方法如下:
\begin{aligned}Var(f(x))&=\mathbb E \{(f(x)-\mathbb E[f(x)])^2\}\\ &=\sum_{x}P(x)(f(x)-\mu_x)^2\\ &=\int p(x)(f(x)-\mu_x)^2 dx \end{aligned}
此外,在统计学中将方差的平方根定义为标准差(standard deviation),通常表示为 Std(x)\sigma_x

Note: The variance is often abbreviated as \sigma_x^2. 当方差数值较大时,则表明变量x的取值范围较为宽广。

Based on the linearity of expectation, the variance can also be derived using this alternative expression: \sigma_x^2 = \mu_{x^2} - \mu_x^2
Given a constant c, based on the linearity of expectation, we obtain the relationship: \sigma_{cx}^2 = c^2\sigma_x^2
Furthermore, in scenarios involving a global constant offset, the variance remains unaffected, i.e., \sigma_{x\pm c}^2 = \sigma_x^2 where c represents a constant. This property is particularly useful in normalization processes。
Particularly, when random variables x,y are independent, their combined variance exhibits a linear relationship: \sigma_{x\pm y}^2 = \sigma_x^2 + \sigma_y^2.
Conversely, if they are not independent, the combined variance is given by \sigma_{x\pm y}^2 = \sigma_x^2 + \sigma_y^2 \pm Cov(x,y)

5.3 协方差(covariance)

协方差被定义为衡量两个线性随机变量之间关系的程度。当|Cov(f(x), g(y))|越大时,则表明两变量之间的关联程度越高。计算公式如下:
\begin{aligned} Cov(f(x),g(y))&=\mathbb E \{(f(x)-\mathbb E[f(x)])\times(g(y)-\mathbb E[g(y)])\}\\ &=\mu_{xy}-\mu_x\mu_y \\ 其中,μ_{xy}&=\sum_{x_i,y_i}^{x,y} P(x=x_i,y=y_i)f(x_i)g(y_i) \end{aligned}

显然 若两个随机变量相互独立 则其协方差为零 即完全不相关;当其值为正时 表示其为正相关xy都倾向于同时取得较大或较小的值(换句话说 x越大 y越大 x越小 y越小);反之则为负相关 。(此外 还有一种较为通俗的说法 协方差就是xy在总体分布方向上的异同度 其值越大则同向程度越高)

对于常数a b c d 下面的式子成立:Cov(a\mathbf x+b c\mathbf y+d)=ac~Cov(\mathbf x \mathbf y)

同样 以下式子成立:Cov(\mathbf x+\mathbf z \mathbf y)=Cov(\mathbf x \mathbf y)+Cov(\mathbf z \mathbf y)

当两个随机变量不相互独立时 协方差与方差满足下面的关系:\sigma_{x\pm y}^2=\sigma_x^2+\sigma_y^2 \pm Cov(x y)

5.4 相关系数

随机变量 x,y 之间的相关系数 \rho_{xy} 具有明确的数学表达式:
\begin{aligned}\rho_{xy}&=\frac{协方差(Cov)(x,y)}{标准差(\sigma_x)与标准差(\sigma_y)} = \frac{期望值(\mu_{xy})减去期望值(\mu_x)\cdot期望值(\mu_y))}{标准差(\sigma_x)与标准差(\sigma_y)}\\ &= \frac{概率空间上函数(f(x))与(g(y))偏差乘积的期望值}{函数(f(x))偏差绝对值期望与函数(g(y))偏差绝对值期望的乘积} \\ &= \frac{概率空间上函数(f(x))与(g(y))偏差乘积的期望值}{概率空间上|f(x) - 期望值(f[x])|绝对值的期望与概率空间上|g(y) - 期望值(g[y])|绝对值的期望之积}\end{aligned}
相比于协方差测量的标准差比值方法,在这种情况下它能够更好地衡量两个随机变量之间的关联程度

能够直观地看出相关系数实际上是通过消除变量量纲差异(采用标准化处理和归一化方法)后计算出的一种衡量变量间线性关系强度的方式。可以看出,在计算得到的相关系数中满足\vert \rho_{xy} \vert \leq 1。其数值的符号则反映了两变量在分布上的同向性和异向性,而数值的大小则具体表现在两变量间关系的方向(同向或反向)及程度上。(换句话说,在\vert \rho_{xy} \vert越接近于1时表示两个变量之间的线性关系越强;当\rho_{xy}为正值时表明两者呈正相关关系,反之则为负相关关系)。

补充说明:关于协方差与相关系数

下面用一个例子来感受一下相关系数的影响:

对具有相同概率分布的二项分布x,y,有 P(x=0)=\frac{1}{3}P(x=1)=\frac{2}{3},求其联合概率分布。

解:不难得知:
\mu_x=0\times\frac{1}{3}+1\times\frac{2}{3}=\frac{2}{3}=\mu_y\sigma_x^2=\frac{1}{3}\times(0-\mu_x)^2+\frac{2}{3}\times(1-\mu_x)^2=\frac{2}{9}=\sigma_y^2设其相关系数为 \rho_{xy}、协方差为 Cov(x,y),得:
\begin{aligned} \rho_{xy}&=\frac{Cov(x,y)}{\sigma_x\sigma_y}\\ &=\frac{\mu_{xy}-\mu_x\mu_y}{\sigma_x\sigma_y} \end{aligned}又∵
\begin{aligned} \mu_{xy}&=P(x=0,y=0)\times0\times0+P(x=0,y=1)\times0\times1\\ &+P(x=1,y=0)\times1\times0+P(x=1,y=1)\times1\times1\\ &=P(x=1,y=1) \end{aligned}∴其联合概率分布为:
\begin{aligned} P(x=1,y=1)&=\rho_{xy}\sigma_x\sigma_y+\mu_x\mu_y=\frac{2\rho_{xy}+4}{9}\\ P(x=1,y=0)&=P(x=1)-P(x=1,y=1)=\frac{2-2\rho_{xy}}{9}\\ P(x=0,y=1)&=P(y=1)-P(x=1,y=1)=\frac{2-2\rho_{xy}}{9}\\ P(x=0,y=0)&=P(x=0)-P(x=0,y=1)=\frac{1+2\rho_{xy}}{9}\\ \end{aligned}

分析以上结果:

  • 在两者呈正相关的情形下(即两者的关联程度逐步增强),随着相关系数r逐步增强:
    ① 同时发生取值为1的情况以及同时发生取值为0的情况所对应的事件频次增多;
    ② 而各自单独取值为1或单独取值为0的情况所对应的事件机会则逐步减少至零;
    即两者的趋同性程度不断加强。
  • 在两者呈负相关的情形下(即两者的关联程度逐步减弱),随着r数值逐步降低:
    ① 各自单独取值为1或单独取值为0的情况所对应的事件频率提升;
    ② 同时发生两个变量都取值为1或者都取值为0的情况所对应的事件机会则持续下降;
    即两者的差异性程度不断加剧。
    (需要注意的是,在本题设定中由于联合概率p必须满足非负性条件(即p≥0),因此在两种情形下当变量间具有相同的边缘分布时其最大可能的相关系数最小也只能达到-½)

6 常用概率分布

6.1 离散型概率分布或范畴分布(categorical distribution)

名称 分布 期望 方差 备注

| 0-1分布 或 伯努利(Bernoulli)分布| P(x=k)=p^k(1-p)^{(1-k)}
k=0,1| p| p(1-p)| P(x=1)=p,~P(x=0)=1-p |
| 二项分布 x\sim B(n,p)| P(x=k)=C_n^kp^kq^{n-k}
k=1,2,,\cdots,n| np| n^2p^2+npq| P(事件A发生)=p, ~q=1-pn是实验重复次数
P(x=k)n次实验中事件A发生k次的概率 |
| 几何分布| P(x=k)=q^{k-1}p
k=1,2\cdots| \frac{1}{p}| \frac{1-p}{p^2}| P(事件A发生)=p, ~q=1-pk是实验重复次数
P(x=k)是恰好重复k次实验后事件A才发生的概率 |
| 超几何分布| P(x=k)=\frac{C_M^kC_{N-M}^{n-k}}{C_N^n}
k=1,2\cdots n| n\frac{M}{N}| \frac{nM(N-M)(N-n)}{N^2(N-1)}| N个产品中有M个目标产品,任取n件,恰好取出kM的概率 |
| 泊松(Poisson)分布 x\sim P(\lambda)| P(x=k)=\frac{\lambda^k}{k!}e^{-\lambda}
k=0,1,\cdots| \lambda| \lambda| \ |

6.2 连续型概率分布

名称 分布 期望 方差 备注
均匀分布 x\sim U(a,b) f(x)=\frac{1}{(b-a)},~a<x<b \frac{a+b}{2} \frac{(b-a)^2}{12} x 在区间(a.b)上均匀分布
指数分布 x\sim E(\lambda) f(x)=1-e^{-\lambda x},~x\ge0 \frac{1}{\lambda} \frac{1}{\lambda^2} |
正态分布 或 高斯(Gauss)分布 x\sim N(\mu,\sigma^2) f(x)=\sqrt{\frac{1}{2\pi\sigma^2 }}\exp \left ( -\frac{1}{2\sigma^2}(x-\mu)^2 \right ),~-\infin<x<\infin \mu \sigma^2 \frac{x-\mu}{\sigma} \sim N(0,1)

| 多维正态分布 x\sim N(\mu,\Sigma)| f(\mathbf x)=\sqrt{\frac{1}{(2\pi)^n\det(\Sigma) }}\exp \left ( -\frac{1}{2}(\mathbf x- \mu)^T \Sigma^{-1}(\mathbf x- \mu)\right )| \mu| \Sigma| \mathbf x\in \R^n\mu为均值列向量
\det(\Sigma)为方差矩阵的行列式 |
|拉普拉斯(Laplace)分布 x\sim La(\mu,\gamma)|f(x)=\frac{1}{2\gamma}\exp \left( -\frac{\vert x-\mu\vert}{\gamma}\right)|\mu|2\gamma^2|其关于x=\mu对称,对称点处有极大值\frac{1}{2\gamma}|

6.3 混合型概率分布

名称 分布 期望 方差 备注
经验分布 x\sim Emp(n,\mu) f(\mathbf x)=\frac{1}{n}\sum_{i=1}^n\delta(\mathbf x-\mathbf x^{(i)}) ||\delta(·)狄拉克函数 (dirac delta function)

dirac delta function被称为\delta(x-\mu),它被称作一个仅在x=\mu处以外的所有点上其值均为零但在狭窄区域内的函数,其积分结果等于1。

返回目录


二、 信息论基础

信息论主要研究的是一个信号包含的信息量以及如何对它进行量化。

信息论的量化标准

信息论基于一种特别的方式来量化一个信号中所含有信息的量:

  1. 必然会发生的事情不会携带任何信息;例如:太阳每天都会升起这一现象并不会提供相关信息。
  2. 较低概率的事件所引发的信息含量高于较高概率事件所引发的信息内容。
  3. 独立事件所包含的信息容量呈现线性增长特性;例如:连续两次投掷硬币所得信息容量相当于单次投掷结果的两倍。
  4. 每个信号都携带有正的信息。

信息论中存在一个有趣的观点:当不太可能发生的事情发生了所带来的意义要远远大于常见事件的发生所带来的影响。具体而言,在信息论框架下接收一个信号并进行源信号推测主要依赖于贝叶斯推理方法。

  • 例如,在实际情况下如果某个现象A有三个潜在的原因导致其发生而现象B仅有一个原因引起其发生那么相对于现象A现象B发生的可能性要小得多因此一旦观察到现象B我们就可以立即确定其原因。
  • 简而言之一个信号所携带的信息量与其不确定性程度密切相关而这种不确定性则与概率分布密切相关:当潜在的原因众多且各原因出现的概率大致相同时信号所携带的信息量会显著增加这是因为根据贝叶斯规则我们无法仅凭观测结果唯一确定具体是哪个原因触发了该信号从而使得可推测的后续事件数量也随之增加。

补充:对于这些量化思想的理解从直观上可能并不容易。我可以采用一种更通俗的方式来解释它们:

  1. 假设某人向你说明"明天太阳将从东方升起"——即便他说了一百遍也不会给你带来新的信息;
  2. 如果有人告诉你"太阳明天将从西方升起"——这就非常有趣了;
  3. 如果有人向你透露两件事——第一件是你知道"太阳即将从西方落下";第二件是你知道"地球正在反方向转动"——那么你就会明白"为什么太阳会从西方落下"——这两件事各自传递的信息量是可以叠加在一起的;
  4. 至于任何信号所携带的信息量肯定是正数……当然不可能让某人告诉你一件事反而使你失去了原本已经知道的知识(信息)。

1 自信息(self-information)

依据前述核心理念,在信息论领域中设定了一项衡量标准——自信息量(self-information):I_{x} = -\log P(x)其中P_x表示事件x的概率值域范围限定在(0,1]区间内

  • 当自然对数作为基数时(即底数为e),其信息单位被称为奈特(nats);而当基数为2时(即底数为2),则称为比特(bit)。
  • 在自然对数计算中(即底数为e),1奈特是由概率\frac{1}{e}观测到某一事件所获得的信息量。
  • 注意到,在某一事件的概率非常低甚至不可能发生的情况下(即概率趋近于零),该事件的自信息量会变得极大;根据定义,在概率趋近于零的情况下,默认自信息量趋近于零。

我们来验证自信息是否符合信息论的信息量化思想:

  1. P(x)=1 时,I(x)=-logP(x)=0
  2. P(x_1)<P(x_2) 时,I(x_1)>I(x_2)
  3. I(x_1)+I(x_2)=-(\log P(x_1)+\log P(x_2))=-\log P(x_1)·P(x_2) > I(x_i) ~,i=\{1,2\}
  4. 由于 P(x)\in[0,1],所以 I(x)>0

2 信息熵 / 香农熵(Shannon entropy)

当我们在计算香农熵时,在公式中我们使用了数学符号来表示各个参数之间的关系

Tip:香农熵 \mathbb E_{x \sim P}[I(x)] 本质上等于自信息 I(x) 在概率分布 P(x) 下所对应的数学期望值(平均数值)。

例题:
当随机变量A有两种可能的结果且每个结果出现的概率相同,则其香农熵计算结果为H(x) = -\sum p_i \log_2 p_i = 1 \, \text{bit}
每个事件提供的信息量均为- \log_2{\frac{1}{2}} = 1 \, \text{bit}。这表示当以\frac{1}{2}的概率观测到某一结果时所获得的信息量为一比特。
当随机变量B具有四个等概率的结果时,其香农熵计算结果提升至H(x) = 2 \, \text{bits}。这表明观察到随机变量B所提供的信息量较之于变量A更高,并且变量B本身的不确定性也更为显著。

  • 在通道编码及通信领域中(或:在信道编码及通信系统中),香农熵确定了将事件编码成一个信息所需的最小二进制位数(基于二进制计算时)。举例而言,在问题B中所需的信息量为两位二进制码——"00"、"01"、"10"、"11"分别对应四种可能的取值情况。此时该值的自信息量等于其对应的二进制码长。
  • 当变量x呈现连续型分布时(或:当随机变量x取连续型值时),香 Shannon熵也被称作微分熵(或:differential entropy)。

3 KL散度(Kullback-Leibler divergence) / 相对熵(relative entropy)

若一个随机变量有两个独立的概率分布P(x)Q(x)存在,则我们可以用KL散度来评估这两个概率分布之间的差异程度:
根据定义,

D_{KL}(P||Q)=\mathbb E_{x \sim P}[\log \frac{P(x)}{Q(x)}]

进一步展开,

D_{KL}(P||Q)=\mathbb E_{x \sim P}[\log P(x)-\log Q(x)]

即,

D_{KL}(P||Q)=\sum_{x_i} P(x_i) \cdot \log \frac{P(x_i)}{Q(x_i)}

  • KL散度( Kullback–Leibler divergence)被称作相对熵(relative entropy)。
  • 在信息论中,在通信编码领域中的KL散度具有明确的意义——它表示使用基于Q分布的概率模型来对来自P分布的信息源进行最优编码所需的信息量与实际所用信息量之间的差异。

计算自信息量并用Q编码所需的平均比特数:其中H_{QP}(x)表示在给定概率分布P下使用Q编码方案对事件x进行编码所需的平均信息量。该值通过取负对数概率乘以频率的方式计算得到。

以事件B为例,在四个事件的概率分布设定为\frac{3}{8},\frac{1}{8},\frac{3}{8},\frac{1}{8}的情况下,则基于P的编码构建样本:
H_{PP}(x)=-2 \left(\frac{3}{8}\log \frac{3}{8}+\frac{1}{8}\log \frac{1}{8}\right)=3-\frac{3}{4}\log_2 3 (bit)在此基础上使用Q分布进行编码生成来自P的数据:
H_{QP}(x)=-2 \log \frac{1}{4} \left(\frac{3}{8}+\frac{1}{8}\right)=2 (bit)因此在采用Q分布编码策略来表示原本属于P分布的数据时会增加:
H_{QP}(x)-H_{PP}(x)=\frac{3}{4}\log_2 3 - 1 (bit)直接计算KL散度可得:D_{KL}(P||Q)=2 \left(\frac{3}{8}\log \frac{\frac{3}{8}}{\frac{1}{4}} + \frac{1}{8}\log \frac{\frac{1}{8}}{\frac{1}{4}}\right)=\frac{3}{4}\log_2 3 - 1 (bit)这与之前计算得到的结果一致

  • KL散度具有的这一特性也将被应用于参数估计过程中,在已知分布P的情况下,则通过求解Q^*=argmin D_{KL}(P||Q)来进行拟合。
    • 从其物理意义显而易见可知,KL散度是非负的;当且仅当分布PQ完全相同时(即对于所有可能取值x有概率质量函数满足p(x)=q(x)),其取值才会等于零。

4 交叉熵(cross-entropy)

类似于KL散度的是另一种信息论工具,在其定义中包含两个重要的信息量指标:D_\text{KL}\left(P||Q\right)=\mathcal H\left[P;Q\right]-\mathcal H\left[P,P\right]其中\mathcal H[P;Q]表示联合分布的信息量而\mathcal H[P,P]代表单一分布的信息量。基于这一关系式我们能够得出互信息的具体计算方式如下所示:

返回目录

全部评论 (0)

还没有任何评论哟~