师爷香农提出了最初公式,历经一个多世纪的学术研究,结合马尔科夫链等理论,被反复升级优化。
简单来说,符号种类数量越小,信息熵越低,符号种类数量越大,信息熵越大。
信息熵越低的语言,文字理解学习起来更容易,但相同长度的文本能表达的信息量也越少,可以理解为更费口舌更费笔墨但不费脑子,沟通效率更低。
例如英文的一阶信息熵大约是4比特,汉字一阶信息熵大约是9.6比特,不同文本样本和不同建模得出的计算值会略有误差,但差距之大显而易见。
实际生活中最直观的例子,就是同样内容的文本,例如产品说明书或者联合国文件,就会出现汉字篇幅更短的情况。