随机游走
随机游走伯努利瓮模型 (Bernoulli urn model)每一次,从一个装了G个灰球和W个白球的瓮中随机抽取一个球,结果等于抽取出来的球的颜色。在下一次抽取之前,球要先放回瓮中。$$令P=\frac{G}{(G+W)}表示灰球的比例。在抽取N次的情况下,灰球的期望数量N_{G},及其标准差\sigma_{N_{G}}:$$$$N_{G}=N\times P,\sigma_{N_{G}}=\sqrt{N\times...
传播模型、扩散模型和传染模型
传播模型前提假设:$$假设存在一个相关人群,用N_{POP}表示。感染者或知情者用I_{t}表示,其余成员(易感者)用S_{t}表示。$$$$相关人群的总人数等于感染者或知情者人数加上易感者人数的总和:N_{POP}=I_{t}+S_{t}$$ 广播模型 - R形$$I_{t+1}=I_{t}+P_{broad}\times S_{t}$$$$其中,P_{broad}表示广播概率,I_{t}和S_{t}分别等于时间t上的知情者和易感者的数字。$$$$初始状态为I_{0}=0,且S_{0}=N_{POP}$$这个模型的目标是描述一个信息源传播信息的过程,可以是政府、企业或报纸。但是,这个模型不适用于在人与人之间传播的传染病或思想。由于广播模型更适合描述思想和信息的传播(而不是传染病的传播),所以我们在这里说知情者的人数,而不说感染者的人数。 扩散模型 -...
熵与不确定性
熵:对不确定性建模信息熵熵是用来度量与结果的概率分布相关的不确定性的。因此,它也可以衡量意外。 熵与方差不同,方差度量一个数值集合或数值分布的离散程度。不确定性与离散程度有关,但是两者并不是一回事。 通过比较具有最大熵的分布与具有最大方差的分布,可以将这种区别鲜明地呈现出来。 N个二元随机事件会产生2N个可能的结果序列,并且,与之等价,我们可以通过提出N个“是或否”问题知悉结果序列。这也意味着,信息熵将不确定性水平(和信息内容)N分配给了2N个结果上的一个等可能分布。 熵在数学上等于概率与它们的对数之和的相反数。$$给定一个概率分布(p_{1},p_{2},\dots,p_{n}),信息熵,H_{2}等于:$$$$H_{2}(p_{1},p_{2},\dots,p_{n})=-\sum_{i=1}^np_{i}log_{2}(p_{i})$$ 公理基础上述的熵测度是唯一满足以下四个公理的测度: 对称性$$对于任何转置概率,都有连续函数,H(\sigma(\vec p))=H(\vec p)$$ 最大化$$对于所有N,H(\vec...
网络模型
网络模型结构网络由节点以及连接节点(node)的边(edge)组成。由边连接起来的节点互为邻居。 网络中的边可以是定向的,也可以是非定向的。在非定向网络中,一个节点的度(degree)等于连接到它的边的数量。 网络以一组网络统计数据为特征。对于每个统计量,我们可以计算网络平均值和所有节点的分布。度分布(degree distribution)告诉我们某些节点是否比其他节点连接得更多。 路径长度(length),指两个节点之间的最小距离,与度成反比。当增加边时,就缩短了节点之间的平均距离。 最短路径上的节点在网络中起着关键作用。如果信息是通过最短路径传递的,那么就必定会经过最短路径上的节点。 节点的介数得分(betweenness...
线性模型与非线性模型
线性模型线性回归模型的目标是找到能够最小化到各数据点的直线。回归线越靠近数据,模型解释的数据越多,R2就越大(得到解释的百分比越大)。如果数据全部都恰好位于回归线上,R2就等于100%。 统计学家使用p值来表示系数的显著性,p值等于基于回归的系数不为零的概率。p值为5%意味着数据由一个系数等于零的过程生成的概率为1/20。显著性的标准阈值是5%和1%。但是,显著性并不是我们唯一关心的东西。一个系数可能是显著的,但是却很小。如果真的是这样,就可以对相关关系很有信心,但是变量的影响其实不大。又或者,也可能系数虽然不显著但却很大,这通常发生在有噪声数据或数据带有许多遗漏变量的情况下。 回归所揭示的是变量之间的相关关系,而不是因果关系。PS:在我们能够用回归发现显著的相关性之前,有一种方法远比回归方法好,这种方法就是通常所称的“数据挖掘”(data mining)。但是,数据挖掘存在识别与其他因果变量相关的某个变量的风险。数据挖掘还可能导致虚假的相关关系,即两个变量只是偶然相关。我们可以通过创建训练集(training set)和检验集(testing...
与价值和权力有关的模型
与价值和权力有关的模型两个标准: “最后上车者价值”(last-on-the-bus value,简称LOTB),它等于一位行动者在团队已经形成的情况下加入团队时的边际贡献。 夏普利值(Shapley value),它等于行动者遍历所有可能的加入团队的序列,加入团队时的边际贡献平均值。⚠️:我们是在合作博弈模型的框架下定义这些度量标准的。合作博弈模型由一组博弈参与者和一个价值函数组成。这个价值函数为每个可能的博弈参与者子集分配一个集体收益。 合作博弈...
正态分布与幂律分布
分布为事件或价值分配概率。 各种统计量将分布中包含的信息压缩为单个数值,例如均值,分布的平均值。 均值之外的第二个重要统计量是方差,可以衡量一个分布的离散程度,也就是数据与均值之间距离的平方的平均值 正态分布分布以数学的方式刻画变量的变差(在某个类型内部的差异)和多样性(不同类型之间的差异),将变量表示为在数值上或类别上定义的概率分布。 我们可以通过中心极限定理(Central Limit...
REDCAPE与多模型思维
REDCAPE 模型功能 推理:reasoning 从模型中得出的推论总是采用条件判断形式:如果条件A成立,那么可以得出结果B。 当我们将模型中推导出来的主张与叙述性主张进行比较时,这种“条件性”的威力将会变得更加明显,即便后者有经验证据支持时也是如此。 通过利用模型,我们可以划出一条界线:什么时候应该采用、什么时候不能采用。 解释:explanation 模型为经验现象提供了清晰的逻辑解释。 模型可以解释点值(point values)和点值的变化。 最有效的模型既能解释简单的现象,也能解决令人费解的问题。 基于模型的解释必须包括正式的假设和明确的因果链条,而且这些假设和因果链条都要面对数据。 设计:design 模型还可以通过提供框架来帮助设计,因为只有在适当的框架内我们才可以考虑不同选择的含义。工程师使用模型设计供应链;计算机科学家使用模型设计Web协议;社会科学家使用模型设计制度。 交流 communication 由于创造了一种共同的表示方法,模型能够有效地改进交流。模型要求对相关特征及其关系给出正式的定义,这使我们能够精确地进行交流。可复制、可度量等。 行动...
模型基础知识
模型是客观世界的表示“Essentially, all models are wrong, but some are useful.” - An Accidental Statistician, George Box 六类人工智能领域的常见问题这里引用龚才春博士对于模型的分类,我们依照模型用以解决问题的方向,将模型分为6大类,分别是权重问题、状态问题、序列问题、表示问题、相似问题以及分类问题。 权重问题: TF-IDF模型(Term Frequency - Inverse Document Frequency,词频率-逆文档频率):单一维度 线性回归模型:多维度 PageRank模型:结构权重模型,而非统计权重模型,如网站的链接关系 状态问题: 词法分析模型 字符串匹配模型 序列问题: 隐马尔可夫模型 最大熵模型 表示问题: 向量空间模型...
随记
Source: KY. Goh., CS. Heng., & ZJ. Lin. (2013). Social Media Brand Community and Consumer Behavior: Quantifying the Relative Impact of User- and Marketer-Generated Content. Information Systems Research 24(1), 88-107. DOI: 10.1287/isre.1120.0469. Dimensions: content information richness, content valence, directed communication versus undirected communication Hypotheses: H1A: UGC information richness has a smaller impact than MGC information richness on consumers’ purchase...