泊松分布是一种离散概率分布,用于描述指定观测窗口内事件发生的次数。它只有一个参数 ,表示预期发生次数;其可能取值为非负整数。在统计学中,泊松分布是计数数据的基本模型,尤其适用于事件以稳定的平均速率独立发生的情形。与二项分布的计数不同,泊松分布的计数没有有限的上界。(itl.nist.gov)
定义与概率
则称 服从参数为 的泊松分布,记作 。
其中, 表示 的阶乘,且 。由指数函数的级数展开可得 ,因此所有概率之和为 1。通常也将极限情形 纳入定义,此时规定 以概率 1 取值为 0。(online.stat.psu.edu)
当 时,其累积分布函数为
当 时,。因此,累积概率构成的是阶梯函数,而非平滑曲线。(itl.nist.gov)
例如,在一个预期每小时发生三次到达的模型中,一小时内恰好发生两次到达的概率为 ,没有到达的概率为 。这些结果是所假定模型的推论,并不能证明任何特定的到达系统都遵循这一模型。
矩与分布形状
因此,其标准差为 。均值与方差相等这一性质称为等离散性。当 较小时,分布明显右偏;其偏度为 ,因此随着参数增大,分布逐渐趋于对称。(online.stat.psu.edu)
当 不是整数时,概率最大的计数值为 。当 为正整数时, 和 都是众数。这些结论可由相邻概率之比得出:
尽管每次观测到的计数都是整数,均值却不一定是整数。(itl.nist.gov)
与二项分布的关系
泊松分布可以作为二项分布的极限出现。若 ,且 、、,则对每个固定的非负整数 ,都有
这解释了泊松分布为何与“发生机会很多,但每次机会中事件发生的概率很小”的情形相关。每次机会都可以用一个服从伯努利分布的变量表示,而这些变量之和就是成功次数。(online.stat.psu.edu)
对于有限的 ,当 较大且 较小时,可以用参数为 的泊松分布近似二项分布的概率。不过,两者的区别仍然重要:二项随机变量的取值不能超过 ,而泊松近似却为所有非负整数计数赋予正概率。(online.stat.psu.edu)
泊松过程与叠加
泊松过程是一种描述事件随时间发生情况的随机过程。在齐次泊松过程中,不相交时间区间内的计数具有统计独立性,且一个区间内计数的分布仅取决于该区间的长度。若事件发生速率为 ,则
速率 的单位是单位时间内的事件数,与无量纲的预期计数 不同。相邻事件之间的等待时间服从均值为 的指数分布。泊松分布描述的是计数,而泊松过程描述的是完整的事件发生序列。(probabilitycourse.com)
独立的泊松计数具有加法封闭性:若 ,则它们的和仍服从泊松分布,参数为 。类似地,将相互独立的泊松点过程叠加后,其强度测度也相加。如果以固定概率独立地保留每个事件,所得过程仍是泊松过程,这一操作称为稀疏化。这些性质为合并事件流或仅能观测部分事件的建模提供了基础。(stat.berkeley.edu)
当 较大时,可以用均值和方差均为 的正态分布进行近似。这一关系可通过中心极限定理和上述加法性质来理解。使用连续性校正,例如用正态分布在 以下的概率近似 ,可以改善离散计数与连续取值之间的对应关系。(online.stat.psu.edu)
估计、回归与局限
对于共享同一参数的独立观测值 ,其似然函数为
通过最大似然估计得到的估计值是样本均值,即 。如果所有计数均为零,且参数空间包含零这一边界值,则估计值为零。(statproofbook.github.io)
泊松回归将泊松分布扩展到条件均值依赖于解释变量的计数数据。它是一种广义线性模型,通常采用对数连接函数。通过引入暴露量项,可以将不同观测时长或不同总体规模下的计数按发生率建模。应用示例包括客服来电次数和交通流量计数。(online.stat.psu.edu)
泊松模型的一个主要局限是,它要求条件均值与条件方差相等。当变异程度超过泊松模型的预测时,就会出现过度离散,这可能是因为观测之间存在模型未考虑的差异。准泊松模型放宽了对方差关系的要求;负二项分布模型则提供了另一种分布选择。比较方差与均值时,必须考虑模型中条件均值的差异,而不能只依据合并后的计数。(online.stat.psu.edu)