熵与不确定性
熵:对不确定性建模
信息熵
熵是用来度量与结果的概率分布相关的不确定性的。因此,它也可以衡量意外。
熵与方差不同,方差度量一个数值集合或数值分布的离散程度。不确定性与离散程度有关,但是两者并不是一回事。
通过比较具有最大熵的分布与具有最大方差的分布,可以将这种区别鲜明地呈现出来。
N个二元随机事件会产生2N个可能的结果序列,并且,与之等价,我们可以通过提出N个“是或否”问题知悉结果序列。这也意味着,信息熵将不确定性水平(和信息内容)N分配给了2N个结果上的一个等可能分布。
熵在数学上等于概率与它们的对数之和的相反数。
$$
给定一个概率分布(p_{1},p_{2},\dots,p_{n}),信息熵,H_{2}等于:
$$
$$
H_{2}(p_{1},p_{2},\dots,p_{n})=-\sum_{i=1}^np_{i}log_{2}(p_{i})
$$
公理基础
上述的熵测度是唯一满足以下四个公理的测度:
- 对称性
$$
对于任何转置概率,都有连续函数,H(\sigma(\vec p))=H(\vec p)
$$ - 最大化
$$
对于所有N,H(\vec p)在p_{i}=\frac{1}{N}处最大化
$$ - 零性
$$
H(1,0,0,\dots,0)=0
$$ - 可分解性
$$
若\vec p=(p_{11},p_{12},\dots,p_{nm}),则H(\vec p)=H_{2}(P_{1},P_{2},\dots,P_{n})+\sum_{i=1}^NH(Q_{P_{i}})
$$
$$
其中,P_{i}=\begin{matrix} \sum_{j=1}^{m} \end{matrix},且Q_{P_{i}}=(\frac{p_{i_{1}}}{P_{i}},\dots,\frac{p_{im}}{P_{i}})
$$
前三个条件很容易理解,它必定是连续的和对称的,而且在所有结果以相同的概率发生时最大化,同时在某些结果上等于零。
第四个条件可分解性则要求在具有m个子类别的n个类别上定义的概率分布的熵,等于各类别上的分布的熵与每个子类别的熵的总和。
香农证明,有一类熵测度是唯一满足这些公理的测度。
利用熵区分结果类别
- 平衡结果没有不确定性,因此其熵等于零。
- 周期性过程具有不随时间变化的低熵。
- 完全随机过程具有最大的熵。
- 复杂性具有中等程度的熵,因为复杂性位于有序性和随机性之间。
最大熵和分布假设
在很多情况下,我们建模时都必须把不确定性包括进来;因而作为建模者,必须对有关的分布做出假设。这里的原则是,我们要尽量避免做出任意特殊假设(ad hoc assumption)。
对于艺术珍品或稀有手稿的可能价值,正态分布却可能没有意义。在这些情况下,我们对决定它们价值的过程几乎一无所知。一种方法是假设一个具有最大不确定性的分布,即最大熵分布。
最大熵分布的形状取决于各种约束条件。
在某些情况下,我们可能知道分布的均值,也知道所有值都必定是正数。给定这些约束条件,最大熵分布必定具有长尾,因为我们要将分布置于更多的值上,从而必须使少数高值结果与许多低值结果保持平衡。不难证明,熵最大化分布是一个指数分布。
如果我们确定了均值和方差(并且允许出现负值),那么最大熵分布则是正态分布。
- 均匀分布:给定范围(a,b),使熵最大化。
- 指数分布:给定均值,使熵最大化。
- 正态分布:给定均值和方差,使熵最大化。
我们利用中心极限定理解释了物种的高度、重量和长度为什么会服从正态分布。在这里,我们再给出一个不同的、基于模型的解释:如果一种突变能够最大化熵(以便探索最好的生态位),并且假设平均规模和总离散度是固定的,那么规模的分布将会是正态的。
关键不在于这种最大熵方法是不是提供了一个更好的解释,而在于给定约束下最大化熵必定会导致正态分布。因此,当我们看到正态分布时,它可能是最大化熵的结果。
熵的实证含义和规范含义
事实上,我们可以将熵测度用于任何实际应用,可以用它来衡量对金融市场的干预是增加了还是减少了不确定性,可以检验选举、体育赛事或博彩中的结果到底是不是随机的。在这些应用中,熵都是作为一个实证的衡量标准来使用的。它告诉我们世界是什么样的,而不是世界应该是什么样。
同时,我们也可以通过设计来规范分类。建筑师克里斯托弗·亚历山大(Christopher Alexander)证明,诸如强中心、厚边界和非独立这类的几何属性,能够生成复杂的生活建筑、社区和城市。亚历山大渴望城市和生活空间中的复杂性。中央银行的规划者可能不太喜欢复杂性,在金融市场中,他们可能更喜欢可预测的均衡结果。不过幸运的是,使用模型,我们既可以探索复杂性,也可以讨论均衡的可能性。