熵:对不确定性建模

信息熵

熵是用来度量与结果的概率分布相关的不确定性的。因此,它也可以衡量意外。

熵与方差不同,方差度量一个数值集合或数值分布的离散程度。不确定性与离散程度有关,但是两者并不是一回事。

通过比较具有最大熵的分布与具有最大方差的分布,可以将这种区别鲜明地呈现出来。

N个二元随机事件会产生2N个可能的结果序列,并且,与之等价,我们可以通过提出N个“是或否”问题知悉结果序列。这也意味着,信息熵将不确定性水平(和信息内容)N分配给了2N个结果上的一个等可能分布。

熵在数学上等于概率与它们的对数之和的相反数。
$$
给定一个概率分布(p_{1},p_{2},\dots,p_{n}),信息熵,H_{2}等于:
$$
$$
H_{2}(p_{1},p_{2},\dots,p_{n})=-\sum_{i=1}^np_{i}log_{2}(p_{i})
$$

公理基础

上述的熵测度是唯一满足以下四个公理的测度:

  1. 对称性
    $$
    对于任何转置概率,都有连续函数,H(\sigma(\vec p))=H(\vec p)
    $$
  2. 最大化
    $$
    对于所有N,H(\vec p)在p_{i}=\frac{1}{N}处最大化
    $$
  3. 零性
    $$
    H(1,0,0,\dots,0)=0
    $$
  4. 可分解性
    $$
    若\vec p=(p_{11},p_{12},\dots,p_{nm}),则H(\vec p)=H_{2}(P_{1},P_{2},\dots,P_{n})+\sum_{i=1}^NH(Q_{P_{i}})
    $$
    $$
    其中,P_{i}=\begin{matrix} \sum_{j=1}^{m} \end{matrix},且Q_{P_{i}}=(\frac{p_{i_{1}}}{P_{i}},\dots,\frac{p_{im}}{P_{i}})
    $$
    前三个条件很容易理解,它必定是连续的和对称的,而且在所有结果以相同的概率发生时最大化,同时在某些结果上等于零。

第四个条件可分解性则要求在具有m个子类别的n个类别上定义的概率分布的熵,等于各类别上的分布的熵与每个子类别的熵的总和。

香农证明,有一类熵测度是唯一满足这些公理的测度。

利用熵区分结果类别

  1. 平衡结果没有不确定性,因此其熵等于零。
  2. 周期性过程具有不随时间变化的低熵。
  3. 完全随机过程具有最大的熵。
  4. 复杂性具有中等程度的熵,因为复杂性位于有序性和随机性之间。

最大熵和分布假设

在很多情况下,我们建模时都必须把不确定性包括进来;因而作为建模者,必须对有关的分布做出假设。这里的原则是,我们要尽量避免做出任意特殊假设(ad hoc assumption)

对于艺术珍品或稀有手稿的可能价值,正态分布却可能没有意义。在这些情况下,我们对决定它们价值的过程几乎一无所知。一种方法是假设一个具有最大不确定性的分布,即最大熵分布。

最大熵分布的形状取决于各种约束条件。

在某些情况下,我们可能知道分布的均值,也知道所有值都必定是正数。给定这些约束条件,最大熵分布必定具有长尾,因为我们要将分布置于更多的值上,从而必须使少数高值结果与许多低值结果保持平衡。不难证明,熵最大化分布是一个指数分布。

如果我们确定了均值和方差(并且允许出现负值)​,那么最大熵分布则是正态分布。

  1. 均匀分布:给定范围(a,b)​,使熵最大化。
  2. 指数分布:给定均值,使熵最大化。
  3. 正态分布:给定均值和方差,使熵最大化。

我们利用中心极限定理解释了物种的高度、重量和长度为什么会服从正态分布。在这里,我们再给出一个不同的、基于模型的解释:如果一种突变能够最大化熵(以便探索最好的生态位)​,并且假设平均规模和总离散度是固定的,那么规模的分布将会是正态的。

关键不在于这种最大熵方法是不是提供了一个更好的解释,而在于给定约束下最大化熵必定会导致正态分布。因此,当我们看到正态分布时,它可能是最大化熵的结果。

熵的实证含义和规范含义

事实上,我们可以将熵测度用于任何实际应用,可以用它来衡量对金融市场的干预是增加了还是减少了不确定性,可以检验选举、体育赛事或博彩中的结果到底是不是随机的。在这些应用中,熵都是作为一个实证的衡量标准来使用的。它告诉我们世界是什么样的,而不是世界应该是什么样。

同时,我们也可以通过设计来规范分类。建筑师克里斯托弗·亚历山大(Christopher Alexander)证明,诸如强中心、厚边界和非独立这类的几何属性,能够生成复杂的生活建筑、社区和城市。亚历山大渴望城市和生活空间中的复杂性。中央银行的规划者可能不太喜欢复杂性,在金融市场中,他们可能更喜欢可预测的均衡结果。不过幸运的是,使用模型,我们既可以探索复杂性,也可以讨论均衡的可能性。